Pular para o conteúdo

Comparação de Motores TTS

O TomoriBot suporta vários sidecars locais de Text-to-Speech, cada um adequado a diferentes idiomas, perfis de hardware e requisitos de latência.

Esta página traz resultados empíricos de benchmark, tempos de síntese e clipes de áudio para comparação, gravados em um ambiente de teste idêntico com as mesmas referências de clonagem de voz.

  • Prompt padrão (usado para Chatterbox Standard/Turbo/Nano, MOSS-TTS, CosyVoice 3, VoxCPM2 e Qwen3-TTS):

    “Pain and pleasure are two sides of the same coin. Go on now… flip it. Either way, I’ll let you feel all of me.”

  • Prompt do Fish Audio S2 Pro (testado com tags de expressão entre colchetes):

    “Pain and pleasure are two sides of the same coin. [laughs] Go on now… flip it. [whispers] Either way, I’ll let you feel all of me.”

Os tempos informam o tempo total de geração (segundos de relógio desde a requisição até o áudio pronto) e o Real-Time Factor (RTF), definido como o tempo de geração dividido pela duração do áudio:

  • RTF < 1.0 (negrito): o motor gera a fala mais rápido que o tempo real (por exemplo, 0.50× RTF renderiza um clipe de 10 segundos em 5 segundos). Só esses motores conseguiriam acompanhar uma chamada de voz ao vivo, que o TomoriBot não implementa hoje.
  • RTF > 1.0: a geração demora mais que o áudio falado. O TomoriBot envia cada mensagem de voz como um arquivo completo, então um RTF maior significa apenas uma espera mais longa.
MotorWindows nativo(1)
(RTX 4070 Ti SUPER)
Linux / WSL2macOS
(Apple Silicon)
Amostra de áudio
Fish Audio S2 Pro~8-10 min(2)
(~65× RTF)
Não testadoNão testado
Chatterbox (Turbo, padrão)~5.0s (clipe de 8.7s)
0.57× RTF
Não testadoNão testado
Chatterbox (Nano)~3.0s (clipe de 8.0s)
0.38× RTF
Não testadoNão testado
Chatterbox (Standard)~6.0s (clipe de 7.8s)
0.77× RTF
Não testadoNão testado
MOSS-TTS~12.0s (clipe de 8.8s)
1.36× RTF
Não testadoNão testado
CosyVoice 3~6.0s (clipe de 13.9s)
0.43× RTF
Não testadoNão testado
VoxCPM2~8.0s (clipe de 7.4s)
1.09× RTF
Não testadoNão testado
Qwen3-TTS~10.0s (clipe de 9.2s)
1.09× RTF
Não testadoNão testado
  • (1) Ambiente de teste: NVIDIA GeForce RTX 4070 Ti SUPER (16 GB GDDR6X, Ada Lovelace) no Windows 11 (execução nativa), usando uma amostra de áudio de referência mono de 24 kHz com 26.6 segundos e transcrição literal correspondente.
  • (2) Fish Audio S2 Pro: no Windows, a execução roda em modo eager não compilado (~65× RTF) por causa da latência de lançamento de kernels CUDA ao longo das suas 76 avaliações de camada por token. Recomenda-se executar no Linux ou WSL2 com a fusão do compilador OpenAI Triton (torch.compile) para evitar esse travamento de despacho.

「そんな顔して……ほんとは私にやられたいんでしょ?ざぁこざぁこ~♡」

MotorWindows nativo(1)
(RTX 4070 Ti SUPER)
Linux / WSL2macOS
(Apple Silicon)
Amostra de áudio
IrodoriTTS~4.0s (clipe de 8.5s)
0.47× RTF
Não testadoNão testado
  • (1) Medido no mesmo ambiente de teste com RTX 4070 Ti SUPER e Windows 11.

  • Escolha o Fish Audio S2 Pro se você quer a maior fidelidade vocal possível, tags de expressão refinadas entre colchetes ([whisper], [laughs], [sigh]) e tem acesso a Linux ou WSL2, onde a fusão do compilador Triton pode ser ativada.
  • Escolha o Chatterbox (Turbo / Nano / Standard) para clonagem de voz em inglês com pouco uso de VRAM. O Nano (~3.0s, 0.38× RTF) oferece a maior velocidade em CPU/GPU, o Turbo (~5.0s, 0.57× RTF) suporta tags de evento paralinguísticas ([laughter], [sigh]) e o Standard (~6.0s, 0.77× RTF) permite ajuste criativo de orientação CFG e de exagero emocional.
  • Escolha o MOSS-TTS para clonagem de voz multimodal experimental e geração de voz descrita por texto em inglês/chinês.
  • Escolha o CosyVoice 3 se você precisa de clonagem zero-shot multilíngue de alta qualidade com direção de entrega em linguagem natural ("Speak in English with excitement").
  • Escolha o VoxCPM2 se você precisa de suporte multilíngue abrangente (30 idiomas), Ultimate Cloning assistida por transcrição e design de voz natural.
  • Escolha o Qwen3-TTS se você quer clonagem limpa em vários idiomas, com design de voz flexível e boa aderência ao prompt.
  • Escolha o IrodoriTTS se o seu bot fala japonês. Foi o único motor exclusivo para japonês medido (~4s, 0.47× RTF no Windows) e interpreta nativamente emojis Unicode (😊, 😢, 😡) para modular a emoção da personagem.

Todos os sidecars do TomoriBot atualmente retornam um WAV completo para o bot. “Caminho de streaming” significa que o modelo upstream ou um backend de serviço separado tem um; isso não significa que o streaming de chat de voz do Discord está implementado. Os tamanhos são parâmetros de modelo, não tamanhos de VRAM ou de download, e a coluna de 16 GB é uma orientação de configuração, não um pico medido. A coluna de velocidade descreve a troca pretendida de cada motor; os tempos medidos acima vêm de uma única máquina Windows e não classificam os motores no Linux.

MotorTamanho do modelo; GPU de 16 GBIdiomasFontes de voz e controlesVelocidade / caminho de streamingEscolha para
Chatterbox350M Turbo (padrão), 110M Nano ou 500M Standard; sim, o Nano pode usar CPUInglêsClonagem por referência, tags de evento suportadas; o modelo Standard oferece CFG/exageroFoco em rapidez e tamanho pequeno; o wrapper retorna o WAV completoConfiguração pequena de clone em inglês ou experimentos com CPU
Qwen3-TTS1.7B por modo; sim, os modelos são trocados10, incluindo inglês/japonêsClone ou VoiceDesign descrito por textoFocado em qualidade; streaming upstream, o wrapper faz bufferClone multilíngue de uso geral e VoiceDesign em japonês
MOSS-TTS4B clone + ~1.7B design, trocados; 16 GB é um alvo de teste, não verificado; o flagship de 8B provavelmente nãoClone: 31, incluindo japonês; design: inglês/chinêsClone ou VoiceGenerator descrito por texto; tags de idioma no cloneExperimental; o clone Local tem backend de streaming upstream, o wrapper faz bufferComparar a qualidade de clone do MOSS ou design de voz em inglês/chinês
IrodoriTTS~0.8B na v4.1 Small atual; ~3-4 GB de VRAM observados em uma execução localApenas japonêsClone ou VoiceDesign; dicas de estilo por emojiPassos de amostragem trocam qualidade por velocidade; o wrapper faz bufferVozes japonesas leves e entrega guiada por emoji
Fish S2 Pro4B; BF16 oficial por padrão (~16-18 GB), INT8 opcional para 16 GB83 declarados upstreamClonagem por referência (exige transcrição de referência), tags de expressão livres entre colchetesModelo Dual-AR pesado; exige Linux/WSL2 com Triton para síntese rápida (~65× RTF no modo eager do Windows)Clonagem expressiva refinada; verifique os termos da licença de pesquisa
VoxCPM22B; ~8 GB em BF16 relatados upstream30Clone, Voice Design, Ultimate Cloning assistida por transcrição, instruções de entrega~0.30 RTF em RTX 4090 upstream; streaming upstream, o wrapper faz bufferUm único modelo multilíngue com os controles de fonte de voz mais amplos
CosyVoice 30.5B no núcleo; 16 GB com folga, download/runtime maiores9, incluindo japonês, mais dialetos chinesesClone, clone interlinguístico, entrega em linguagem naturalFoco em baixa latência; streaming nativo de texto/áudio upstream, o wrapper faz bufferUm futuro candidato a streaming com clonagem interlinguística

Os tamanhos dos modelos e as contagens de idiomas seguem as páginas upstream de Chatterbox, Qwen3-TTS, MOSS, Irodori, Fish S2 Pro, VoxCPM2 e CosyVoice 3. Consulte cada guia para detalhes de SO, driver, licença, revisão do modelo e memória. Uma GPU de 16 GB não necessariamente comporta um modelo TTS e um LLM local grande ao mesmo tempo.

O valor de VRAM do Irodori é uma única observação local, não um mínimo publicado nem um benchmark entre motores. O uso de memória varia com o runtime, a precisão, o tamanho do script e outras cargas de trabalho da GPU.

A primeira requisição automática do Qwen3-TTS inclui o carregamento do modelo. O MOSS baixa os dois modelos durante a configuração e aquece o modelo de clone na inicialização por padrão, mas qualquer um dos servidores automáticos ainda precisa carregar o outro modelo após uma troca de modo. O TomoriBot espera até TTS_SYNTHESIZE_TIMEOUT_MS (padrão 240000 ms) por cada resposta completa.