Skip to content

Comparación de motores de texto a voz

TomoriBot admite múltiples sidecars locales de texto a voz, cada uno adecuado para diferentes idiomas, perfiles de hardware y requisitos de latencia.

Esta página proporciona resultados de benchmarks empíricos, tiempos de síntesis y clips de comparación de audio grabados en un entorno de prueba idéntico con referencias de clonación de voz coincidentes.

Clonación de voz multilingüe y en inglés

Section titled “Clonación de voz multilingüe y en inglés”
  • Prompt estándar (usado para Chatterbox Standard/Turbo/Nano, MOSS-TTS, CosyVoice 3, VoxCPM2, Qwen3-TTS):

    “Pain and pleasure are two sides of the same coin. Go on now… flip it. Either way, I’ll let you feel all of me.”

  • Prompt de Fish Audio S2 Pro (probado con etiquetas de expresión entre corchetes):

    “Pain and pleasure are two sides of the same coin. [laughs] Go on now… flip it. [whispers] Either way, I’ll let you feel all of me.”

Los tiempos informan tanto el tiempo de generación completo (segundos totales del reloj desde la solicitud hasta el audio terminado) como el Factor de tiempo real (RTF), definido como el tiempo de generación dividido por la duración del audio:

  • RTF < 1.0 (negrita): el motor genera voz más rápido que en tiempo real (por ejemplo, 0.50× RTF renderiza un clip de 10 segundos en 5 segundos). Solo estos motores podrían mantener el ritmo de una llamada de voz en vivo, lo cual TomoriBot no implementa hoy.
  • RTF > 1.0: la generación tarda más que el audio hablado. TomoriBot envía cada mensaje de voz como un archivo completo, por lo que un RTF más alto solo significa una espera más larga.
MotorNativo de Windows(1)
(RTX 4070 Ti SUPER)
Linux / WSL2macOS
(Apple Silicon)
Muestra de audio
Fish Audio S2 Pro~8-10 min(2)
(~65× RTF)
Sin probarSin probar
Chatterbox (Turbo, predeterminado)~5.0s (clip de 8.7s)
0.57× RTF
Sin probarSin probar
Chatterbox (Nano)~3.0s (clip de 8.0s)
0.38× RTF
Sin probarSin probar
Chatterbox (Estándar)~6.0s (clip de 7.8s)
0.77× RTF
Sin probarSin probar
MOSS-TTS~12.0s (clip de 8.8s)
1.36× RTF
Sin probarSin probar
CosyVoice 3~6.0s (clip de 13.9s)
0.43× RTF
Sin probarSin probar
VoxCPM2~8.0s (clip de 7.4s)
1.09× RTF
Sin probarSin probar
Qwen3-TTS~10.0s (clip de 9.2s)
1.09× RTF
Sin probarSin probar
  • (1) Entorno de prueba: NVIDIA GeForce RTX 4070 Ti SUPER (16 GB GDDR6X, Ada Lovelace) en Windows 11 (ejecución nativa) usando una muestra de audio de referencia mono de 24 kHz de 26.6 segundos con transcripción literal coincidente.
  • (2) Fish Audio S2 Pro: la ejecución de Windows se ejecuta en modo entusiasta sin compilar (~65× RTF) debido a la latencia de lanzamiento del kernel CUDA en sus evaluaciones de 76 capas por token. Se recomienda ejecutar en Linux o WSL2 con la fusión del compilador OpenAI Triton (torch.compile) para evitar este estancamiento de despacho.

「そんな顔して……ほんとは私にやられたいんでしょ?ざぁこざぁこ~♡」

Rendimiento y comparación de audio en japonés

Section titled “Rendimiento y comparación de audio en japonés”
MotorNativo de Windows(1)
(RTX 4070 Ti SUPER)
Linux / WSL2macOS
(Apple Silicon)
Muestra de audio
IrodoriTTS~4.0s (clip de 8.5s)
0.47× RTF
Sin probarSin probar
  • (1) Medido en el mismo entorno de prueba RTX 4070 Ti SUPER Windows 11.

  • Elige Fish Audio S2 Pro si quieres la mayor fidelidad vocal posible, etiquetas de expresión entre corchetes detalladas ([whisper], [laughs], [sigh]), y tienes acceso a Linux o WSL2 donde la fusión del compilador Triton puede habilitarse.
  • Elige Chatterbox (Turbo / Nano / Estándar) para la clonación de voz en inglés con una pequeña huella de VRAM. Nano (~3.0s, 0.38× RTF) proporciona la máxima velocidad en CPU/GPU, Turbo (~5.0s, 0.57× RTF) admite etiquetas de eventos paralingüísticos ([laughter], [sigh]), y Estándar (~6.0s, 0.77× RTF) permite una guía CFG creativa y un ajuste de exageración emocional.
  • Elige MOSS-TTS para clonación de voz multimodal experimental y generación de voz en inglés/chino descrita por texto.
  • Elige CosyVoice 3 si necesitas clonación zero-shot multilingüe de alta calidad con dirección de entrega en lenguaje natural ("Speak in English with excitement").
  • Elige VoxCPM2 si necesitas soporte multilingüe completo (30 idiomas), Clonación Definitiva asistida por transcripción y diseño de voz natural.
  • Elige Qwen3-TTS si quieres una clonación limpia en varios idiomas con diseño de voz flexible y cumplimiento estable de prompts.
  • Elige IrodoriTTS si tu bot habla japonés. Fue el único motor exclusivo para japonés medido (~4s, 0.47× RTF en Windows) y analiza de forma nativa emojis Unicode (😊, 😢, 😡) para modular la emoción del personaje.

Todos los sidecars de TomoriBot devuelven actualmente un WAV completo al bot. “Ruta de transmisión” significa que el modelo ascendente o un backend de servicio separado tiene una; no significa que la transmisión de chat de voz de Discord esté implementada. Los tamaños son parámetros del modelo, no tamaños de VRAM o descarga, y la columna de 16 GB es una guía de configuración en lugar de un pico medido. La columna de velocidad describe la compensación prevista de cada motor; los tiempos medidos arriba provienen de una máquina con Windows y no clasifican los motores en Linux.

MotorTamaño del modelo; GPU de 16 GBIdiomasFuentes de voz y controlesVelocidad / ruta de transmisiónElígelo para
Chatterbox350M Turbo (predeterminado), 110M Nano, o 500M Estándar; sí, Nano puede usar CPUInglésClonación de referencia, etiquetas de eventos compatibles; el modelo estándar ofrece CFG/exageraciónEnfoque rápido/pequeño; el envoltorio devuelve WAV completoConfiguración de clonación pequeña en inglés o experimentos con CPU
Qwen3-TTS1.7B por modo; sí, los modelos se intercambian10, incluyendo inglés/japonésClon o Diseño de voz descrito con textoEnfoque en la calidad; transmisión upstream, el envoltorio almacena en búferClon multilingüe de propósito general y Diseño de voz en japonés
MOSS-TTSClon 4B + diseño ~1.7B, intercambiados; 16 GB es un objetivo de prueba, no verificado; insignia de 8B probablemente noClon: 31, incluyendo japonés; diseño: inglés/chinoClon o Generador de voz descrito con texto; etiquetas de idioma de clonaciónExperimental; el clon local tiene backend de transmisión upstream, el envoltorio almacena en búferComparar la calidad del clon MOSS o el diseño de voz en inglés/chino
IrodoriTTS~0.8B Pequeño v4.1 actual; ~3-4 GB VRAM observados en una ejecución localSolo japonésClon o Diseño de voz; pistas de estilo emojiLos pasos de muestreo cambian calidad por velocidad; el envoltorio almacena en búferVoces japonesas de huella pequeña y entrega impulsada por emoji
Fish S2 Pro4B; predeterminado oficial BF16 (~16-18 GB), INT8 opcional para 16 GB83 afirmados upstreamClonación de referencia (requiere transcripción de referencia), etiquetas de expresión entre corchetes de forma libreModelo Dual-AR pesado; requiere Linux/WSL2 con Triton para síntesis rápida (~65× RTF en modo entusiasta en Windows)Clonación expresiva de grano fino; verifica los términos de la licencia de investigación
VoxCPM22B; ~8 GB BF16 reportados upstream30Clon, Diseño de voz, Clonación Definitiva asistida por transcripción, instrucciones de entrega~0.30 RTF en RTX 4090 upstream; transmisión upstream, el envoltorio almacena en búferUn modelo multilingüe con los controles de fuente de voz más amplios
CosyVoice 3Núcleo de 0.5B; 16 GB cómodos, descarga/tiempo de ejecución mayor9, incluyendo japonés, más dialectos chinosClon, clon translingüe, entrega en lenguaje naturalEnfoque de baja latencia; transmisión nativa de texto/audio upstream, el envoltorio almacena en búferUn futuro candidato de transmisión con clonación translingüe

El tamaño del modelo y los recuentos de idiomas siguen las páginas upstream de Chatterbox, Qwen3-TTS, MOSS, Irodori, Fish S2 Pro, VoxCPM2, y CosyVoice 3. Revisa cada guía para detalles de sistema operativo, controlador, licencia, revisión del modelo y memoria. Una GPU de 16 GB no puede alojar necesariamente un modelo de texto a voz y un LLM local grande simultáneamente.

La cifra de VRAM de Irodori es una sola observación local, no un mínimo publicado o un benchmark entre motores. El uso de la memoria varía con el tiempo de ejecución, la precisión, la longitud del guion y otras cargas de trabajo de la GPU.

La primera solicitud automática de Qwen3-TTS incluye la carga del modelo. MOSS descarga previamente ambos modelos durante la configuración y calienta el modelo de clonación al inicio de forma predeterminada, pero cualquier servidor automático aún tiene que cargar el otro modelo después de un cambio de modo. TomoriBot espera hasta TTS_SYNTHESIZE_TIMEOUT_MS (predeterminado 240000 ms) por cada respuesta completa.