Qwen3-TTS
Use servers/tts/qwen3tts/server.py para ambos os modos do Qwen3-TTS 12Hz 1.7B, a opção de TTS maior porém a mais precisa entre as atuais do TomoriBot. Por padrão, ele inicia no modo automático, que escolhe o modelo Base de clone de voz ou o modelo VoiceDesign a partir do formato de cada requisição.
Configuração
Seção intitulada “Configuração”Execute estes comandos a partir da raiz do repositório do TomoriBot, a pasta onde você clonou o TomoriBot:
Usando o Windows PowerShell
Seção intitulada “Usando o Windows PowerShell”python -m venv servers\tts\qwen3tts\.venvservers\tts\qwen3tts\.venv\Scripts\Activate.ps1python -m pip install --upgrade pippip install -r servers\tts\qwen3tts\requirements.txtpython servers\tts\qwen3tts\server.pyUsando Bash no Linux/macOS
Seção intitulada “Usando Bash no Linux/macOS”python3 -m venv servers/tts/qwen3tts/.venvsource servers/tts/qwen3tts/.venv/bin/activatepython -m pip install --upgrade pippython -m pip install -r servers/tts/qwen3tts/requirements.txtpython servers/tts/qwen3tts/server.pyA URL padrão do endpoint no modo automático é http://127.0.0.1:8012. Você também pode especificar o modo automático explicitamente:
python servers\tts\qwen3tts\server.py --mode autoO modo automático inspeciona cada requisição /synthesize: requisições com ref_audio usam o modelo de clone, enquanto requisições com instruct usam o modelo VoiceDesign. Ele mantém apenas um modelo carregado por vez e troca os modelos quando o tipo de requisição muda, de modo que a primeira requisição após uma troca pode ser mais lenta.
Registrar no TomoriBot
Seção intitulada “Registrar no TomoriBot”Para a maioria dos usuários, registre o servidor no modo automático para que um único endpoint possa suportar as personas tanto para clone de voz quanto para VoiceDesign.
Execute /providers, escolha Add New Custom Endpoint e use a compatibilidade da API de fala:
- API Compatibility:
tts-clone endpoint_url:http://127.0.0.1:8012
Após salvar a conexão, selecione-a e use o menu suspenso de modelo para adicionar um modelo de fala (Speech). O formulário do modelo pede por Voice Source Mode e Script Markup; escolha Auto e Plain para o servidor em modo automático.
Use /providers para registro do endpoint e configuração do modelo. Em seguida, abra /config > Models > Switch Models para selecionar e ativar o endpoint registrado.
Configurar Vozes das Personas
Seção intitulada “Configurar Vozes das Personas”Clonagem de voz
Seção intitulada “Clonagem de voz”Use isso para personas que devem imitar um clipe de referência:
- Prepare um clipe de voz limpo de 10 a 20 segundos com um locutor e sem música de fundo.
- Abra
/configem Models > TTS Parameters & Voices e envie o clipe. - Abra
/configem Persona > Voice e, em seguida, escolha a persona e a amostra de voz.
VoiceDesign
Seção intitulada “VoiceDesign”Use isso para personas que devem usar uma descrição de voz escrita em vez de uma amostra:
- Abra
/configem Persona > Voice e escolha VoiceDesign. - Escolha a persona.
- Insira um prompt de voz em linguagem natural, como a idade do locutor, tom, sotaque e estilo de entrega.
Remova o prompt do VoiceDesign de uma persona em Persona > Voice em /config. Durante a geração, o TomoriBot envia o prompt salvo no corpo JSON de /synthesize como instruct; comandos pontuais de voice_instructions a partir da ferramenta são anexados.
O modo automático mantém ambas as configurações. Personas configuradas em Persona > Voice em /config usam a síntese de clone ou a síntese do VoiceDesign de acordo com sua seleção.
(Opcional) Servidor Apenas para VoiceDesign
Seção intitulada “(Opcional) Servidor Apenas para VoiceDesign”Inicie o mesmo servidor no modo VoiceDesign ao servir Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign.
Windows PowerShell:
servers\tts\qwen3tts\.venv\Scripts\Activate.ps1$env:TOMORI_TTS_MODE = "voice-design"python servers\tts\qwen3tts\server.pyBash:
source servers/tts/qwen3tts/.venv/bin/activateTOMORI_TTS_MODE=voice-design python servers/tts/qwen3tts/server.pyVocê também pode passar --mode voice-design em vez de definir TOMORI_TTS_MODE. A URL padrão do endpoint apenas para VoiceDesign é http://127.0.0.1:8014.
Registre-o da mesma forma que o modo automático, mas use a URL do endpoint http://127.0.0.1:8014 e escolha VoiceDesign como o Voice Source Mode no modelo de fala (Speech).