Bỏ qua để đến nội dung

Chuyển lời nói thành văn bản (Engine cục bộ)

TomoriBot xem chuyển lời nói thành văn bản là tính năng endpoint tùy chỉnh transcription. Các tệp âm thanh đính kèm được phiên âm trong nền và thêm vào ngữ cảnh cuộc trò chuyện khi có một endpoint phiên âm đang hoạt động.

Việc gửi hiển thị bản phiên âm là riêng biệt. /config > Engine > Notices chỉ kiểm soát việc bản phiên âm tin nhắn thoại có được gửi trong đoạn chat hay không; mục này không bật hoặc tắt STT trong nền.

Các engine hiện có

Quy trình cài đặt

  1. Khởi động một máy chủ STT từ các hướng dẫn engine ở trên.
  2. Trong /providers, chọn Add New Custom Endpoint và sử dụng API Compatibility openai-compatible-transcription.
  3. Chọn endpoint đã lưu và sử dụng menu thả xuống model để thêm mã model do máy chủ báo cáo.
  4. Mở /config > Models > Switch Models để chọn và kích hoạt endpoint đã đăng ký.

Quy trình phiên âm

Khi một endpoint phiên âm đang hoạt động, TomoriBot sẽ đọc các tệp âm thanh đính kèm được hỗ trợ trong nền và thêm bản phiên âm vào ngữ cảnh trò chuyện. Không cần gán persona.

Chỉ sử dụng /config > Engine > Notices nếu bạn cũng muốn các bản phiên âm đó được gửi hiển thị rõ ràng trong đoạn chat.

Người dùng ElevenLabs nên chọn Add New ProviderElevenLabs trong /providers; tùy chọn này đăng ký tính năng phiên âm cùng với giọng nói.