Skip to content

De texto a voz (Motores locales)

TomoriBot trata la voz como una capacidad de endpoint personalizado. Los motores locales se ejecutan fuera del bot como servidores HTTP e implementan POST /synthesize; los motores de clonación reciben texto junto con la muestra de audio de referencia configurada, mientras que los motores con capacidad de Diseño de voz también pueden recibir instrucciones en lenguaje natural.

Motores disponibles

Flujo de configuración

  1. Elige un motor de las tarjetas de arriba y configura su envoltorio desde servers/tts/.
  2. En /providers, elige Agregar nuevo punto de conexión personalizado y usa la compatibilidad de API tts-clone.
  3. Selecciona el endpoint guardado y usa su menú desplegable de modelos para agregar su modelo de Voz, Modo de fuente de voz y Estilo de marcado del guion.
  4. Abre /config > Modelos > Cambiar modelos y selecciona el modelo de Voz registrado.

Flujo de voz de la persona

Para los motores de clonación, agrega y asigna una muestra de voz por persona:

  1. Prepara un clip limpio de 10-20 segundos con un solo orador y sin música de fondo.
  2. Abre /config en Modelos > Parámetros y voces TTS y sube la muestra. Se acepta cualquier formato de audio; TomoriBot lo convierte a WAV mono.
  3. Proporciona una transcripción coincidente cuando el motor se beneficie de ella. Fish S2 Pro reenvía la transcripción de referencia almacenada a la solicitud de clonación, y VoxCPM2 la usa para una Clonación Definitiva de mayor fidelidad.
  4. Abre /config en Persona > Voz, luego elige la persona y la muestra de voz.

Para Qwen3-TTS, MOSS-VoiceGenerator, IrodoriTTS o VoxCPM2 VoiceDesign, omite la muestra de audio y usa Persona > Voz en /config para guardar una descripción de voz en lenguaje natural para la persona. CosyVoice 3 usa el modo Clon de voz con una muestra de referencia y acepta directrices de entrega únicas a través de voice_instructions.

Los usuarios de ElevenLabs deben elegir Agregar nuevo proveedor y ElevenLabs en /providers; esto registra los endpoints de voz y transcripción juntos.

TomoriBot elimina la sintaxis de emoji personalizados de Discord como :pepega: o <:pepega:123456789012345678> de los guiones de voz generados antes de la síntesis. Los emojis Unicode también se eliminan a menos que el endpoint de voz use marcado de emoji, que está destinado para IrodoriTTS. Las etiquetas entre corchetes se conservan para endpoints como Chatterbox Turbo y Fish S2 Pro cuando su Estilo de marcado del guion está configurado en Etiquetas entre corchetes.

VoxCPM2 usa el Estilo de marcado del guion Plano. Su Diseño de voz y controles de estilo de habla viajan a través del campo instruct de TomoriBot, y el envoltorio de VoxCPM2 los convierte a la sintaxis de control en lenguaje natural entre paréntesis nativa del modelo.

CosyVoice 3 también usa el Estilo de marcado del guion Plano. Asigna referencias respaldadas por transcripción a la clonación zero-shot, referencias sin transcripción a la clonación translingüe y voice_instructions a su ruta condicionada por instrucciones. Las etiquetas entre corchetes en línea se eliminan porque las instrucciones de CosyVoice se aplican a todo el enunciado.

Comparación de motores

Para ver benchmarks de latencia empírica en paralelo, reproducción de muestras de audio y una matriz de características detallada comparando todos los envoltorios compatibles, consulta la Comparación de motores de texto a voz.