語音轉文字(本機引擎)
TomoriBot 把語音轉文字視為 transcription 自訂端點功能。當有作用中的轉錄端點時,音訊附件會在背景被轉錄,並加入對話脈絡。
可見的逐字稿張貼是另一回事。/config > Engine > 通知 只控制語音訊息的逐字稿是否張貼在聊天中,它不會啟用或停用背景 STT。
可用引擎
WhisperX適合初學者的本機轉錄,使用 servers/stt 底下參考用的 WhisperX 伺服器。
whisper.cpp當輕量的 whisper.cpp HTTP 伺服器提供 OpenAI 相容的轉錄端點時使用它。
KoboldCPP當你的版本提供 OpenAI 相容的音訊轉錄時,使用 KoboldCPP 以 Whisper 為基礎的 STT。
設定流程
- 從上面的引擎指南啟動一個 STT 伺服器。
- 在
/providers中選擇 新增自訂端點,並使用 API 相容性openai-compatible-transcription。 - 選取已儲存的端點,並用它的模型下拉選單加入伺服器回報的模型代號。
- 開啟
/config> 模型 > 切換模型,選取並啟用註冊好的端點。
逐字稿流程
當有作用中的轉錄端點時,TomoriBot 會在背景讀取支援的音訊附件,並將逐字稿加入聊天脈絡。不需要指派人格。
只有你也想讓那些逐字稿可見地張貼在聊天中時,才需要使用 /config > Engine > 通知。
使用 ElevenLabs 的人應該在 /providers 中選擇 新增供應商 與 ElevenLabs,它會同時註冊轉錄與語音。