跳转到内容

语音识别(本地引擎)

TomoriBot 把语音识别当作 transcription 这一自定义端点功能来处理。只要有一个处于激活状态的转写端点,音频附件就会在后台被转写,并被加入对话上下文。

转写内容的公开显示是另一回事。/config > 行为 > 提示这一项只控制语音消息的转写是否会发到聊天里;它不会启用或停用后台的语音识别。

可用引擎

设置流程

  1. 从上面的引擎指南里启动一个语音识别服务器。
  2. /providers 里选择添加新自定义端点,并把 API 兼容性设为 openai-compatible-transcription
  3. 选中已保存的端点,用它的模型下拉菜单添加服务器上报的模型代码。
  4. 打开 /config > 模型 > 切换模型,选中并激活已注册的端点。

转写流程

当转写端点处于激活状态时,TomoriBot 会在后台读取受支持的音频附件,并把转写内容加入聊天上下文。不需要指派任何人格。

只有当你还想把这些转写内容公开发到聊天里时,才需要用到 /config > 行为 > 提示。

使用 ElevenLabs 的话,在 /providers 里选择添加新提供方ElevenLabs;它会在注册语音的同时一并注册转写。