Speech-to-Text (Motores Locais)
O TomoriBot trata speech-to-text como a capacidade de endpoint personalizado transcription. Os anexos de áudio são transcritos em segundo plano e adicionados ao contexto da conversa quando existe um endpoint de transcrição ativo.
A postagem visível de transcrições é separada. /config > Engine > Notices controla apenas se as transcrições de mensagens de voz são postadas no chat; ele não ativa ou desativa o STT em segundo plano.
Motores Disponíveis
Fluxo de Configuração
- Inicie um servidor STT a partir dos guias de motores acima.
- Em
/providers, escolha Add New Custom Endpoint e use a compatibilidade de APIopenai-compatible-transcription. - Selecione o endpoint salvo e use seu menu suspenso de modelo para adicionar o código do modelo relatado pelo servidor.
- Abra
/config> Models > Switch Models para selecionar e ativar o endpoint registrado.
Fluxo de Transcrição
Quando um endpoint de transcrição está ativo, o TomoriBot lê os anexos de áudio suportados em segundo plano e adiciona a transcrição ao contexto do chat. Nenhuma atribuição de persona é necessária.
Use /config > Engine > Notices apenas se você também quiser que essas transcrições sejam postadas visivelmente no chat.
Usuários da ElevenLabs devem escolher Add New Provider e ElevenLabs em /providers; isso registra a transcrição juntamente com a fala.