Guía de configuración de TTS

Escucha tu chat en tres pasos. Empieza gratis, sin cuenta ni clave de API.

1. Activa la lectura del chat

¿Todavía no conectaste el chat? Empieza aquí: instala SSN, añade tu fuente y abre el panel.

Abre: ventana emergente de la extensión SSN o la sección de la aplicación de escritorio llamada Fuentes y ajustes (Sources and Settings).

En Superposición principal de chat y panel de control (Main chat overlay & control dock), despliega Mensaje — Texto a voz (Message — Text to Speech). Activa el interruptor que se muestra aquí:

Ventana emergente real: Mensaje — Texto a voz, con Activar TTS en el panel encendido
Interruptor azul = lectura del chat activada.

2. Elige una voz gratuita

En la misma sección, desplázate hasta Proveedor de texto a voz (TTS Service Provider). Elige Piper TTS, luego una voz.

Ventana emergente real: Piper TTS seleccionado, con voz English US Female HFC Medium
Piper no necesita cuenta ni clave de API. Espera a que termine su primera descarga de voz.

Usa copiar enlace (copy link) junto a Superposición principal de chat y panel de control (Main chat overlay & control dock) para obtener tu enlace actualizado.

3. Reprodúcela en OBS

  1. Añade en OBS una Fuente de navegador (Browser Source) y pega ese enlace.
  2. Activa Controlar audio vía OBS (Control audio via OBS) en sus propiedades.
  3. Envía un mensaje de chat. Comprueba el medidor de audio de la fuente y luego haz una grabación corta.

¿Quieres escucharlo tú también? En Propiedades de audio avanzadas de OBS, elige Monitorización y salida (Monitor and Output) para esa fuente. Mantén una sola copia leyendo el chat.

Escucha las voces gratuitas

¿Prefieres otro sonido? Estas cuatro voces son gratuitas. Pulsa reproducir para compararlas.

Piper

Inglés de Estados Unidos, femenina (HFC), calidad media.
en_US-hfc_female-medium

Ver ajustes y voces

Kokoro

Bella, femenina estadounidense. Probada con CPU/WASM, q8.
af_bella

Ver ajustes y voces

Kitten

Voz 4, femenina. Modelo nano v0.1 incluido.
expr-voice-4-f

Ver ajustes y voces

eSpeak

Inglés. Una voz sintética que ocupa poco.
en

Ver ajustes y voces

Muestras en español y portugués

Elige un idioma encima de la lista de voces en los ajustes de SSN y luego utiliza Prueba. Piper ofrece España, México, Brasil y Portugal; Kokoro añade tres voces en español y tres en portugués de Brasil.

Piper - Español (España)

DaveFX

Kokoro - Español

Dora

Piper - Portugués (Brasil)

Faber

Kokoro - Portugués (Brasil)

Dora

Síntesis local gratuita, con una descarga inicial. Las muestras omiten el tiempo de carga. Piper es el punto de partida más ligero; Kokoro puede ser lento con CPU. Utiliza Piper si la voz se retrasa respecto al chat.

Texto de las muestras y detalles de las pruebas

Las cuatro muestras en inglés leen: ¡Bienvenidos a la transmisión! Gracias por acompañarnos. ¿A qué juego deberíamos jugar después? La lectura de nombres está desactivada.

Comprobado el 7 de septiembre de 2026 en OBS 32.2.2 con Windows 11: un mensaje de chat llegó al panel real, generó voz, movió el medidor de la fuente de navegador y apareció en una grabación. Kokoro tardó notablemente más en empezar a hablar en esta prueba con CPU. Estos clips muestran la voz, no el tiempo de espera.

La voz del sistema ofreció cinco voces en esta computadora, pero no produjo audio en la grabación de la fuente de navegador. Ese resultado es específico de esta configuración; prueba siempre tu URL final y una grabación. No se incluyen voces en la nube porque no se utilizaron credenciales de pago.

¿Necesitas ayuda?

¿Mi plataforma de chat admite TTS?

Si SSN recibe el chat como texto, puede leerlo en voz alta. YouTube, Twitch, TikTok y otras fuentes utilizan la misma función. Tu plataforma de chat no necesita su propia compatibilidad con TTS.

¿No se oye voz?

Comprueba que el panel reciba chat y luego revisa el interruptor TTS, el proveedor y los filtros. Utiliza el enlace recién copiado. Deja que termine la primera descarga del modelo.

¿Funciona en Chrome/Edge, pero no en OBS?

OBS tiene su propio navegador y lista de voces. La voz del sistema puede no funcionar allí, incluso si enumera voces. Prueba Piper, Kokoro, Kitten o eSpeak. Un cable de audio virtual no puede solucionar la falta de voz.

¿El medidor se mueve, pero la grabación no tiene sonido?

Comprueba el silencio y la asignación de pistas de grabación en OBS. Utiliza Monitorización y salida si también quieres escucharlo; evita capturar esa salida de monitorización una segunda vez. guía de audio de OBS.

¿Puedo utilizar un panel de OBS o Mensajes destacados en su lugar?

Un panel de navegador personalizado de OBS es un panel de control, no la fuente de navegador de escena utilizada arriba. Para Mensajes destacados, activa TTS en las opciones propias de esa superposición y copia su enlace. Mantén una sola página leyendo para evitar voces duplicadas.

Comparar todos los proveedores: requisitos, costo y desventajas

Empieza con Piper para una voz local gratuita, o compara Kokoro si prefieres su sonido. Prueba eSpeak cuando la rapidez de respuesta importe más que el realismo. Kitten es otra opción compacta en inglés. Escucha antes de decidir.

ProveedorAdecuado paraDesventajaRequisitos / costo
KokoroVoces en inglés, español y portugués de Brasil.Mayor uso de CPU; el primer audio puede tardar.Gratis, sin clave. Descarga archivos de modelo/voz; CPU o WebGPU compatible.
PiperVoces neuronales locales; opciones en inglés, español y portugués.La calidad y la pronunciación varían según la voz.Gratis, sin clave. Descarga el modelo seleccionado (HFC medium: unos 63 MB), más archivos del motor.
KittenModelo compacto en inglés, ocho voces.Menos idiomas y estilos de voz.Gratis, sin clave. Modelo incluido actual: unos 24 MB, más archivos de motor/voz; CPU.
eSpeakLigero, muchos idiomas, inicio rápido.Sonido deliberadamente sintético/robótico.Gratis, sin clave. Carga archivos de motor/idioma incluidos; no necesita modelo neuronal ni GPU.
TTS del sistemaUtiliza las voces que ofrece tu navegador o aplicación de escritorio.La lista de voces y la captura de OBS varían; algunas voces necesitan Internet.Sin tarifa de proveedor de SSN. Requiere una voz del sistema/navegador que funcione; prueba en la página real de reproducción.
ElevenLabsID de voces, selección de modelo y controles de estabilidad/estilo.Pueden aplicarse límites de cuenta, retrasos de red y cargos de API.Internet, clave de API e ID de voz accesible. El texto del chat se envía al proveedor.
Google CloudVoces con nombre y controles de idioma, velocidad y tono.No todas las voces admiten todos los controles.Internet, Cloud TTS API activada, clave de API y voz/idioma coincidentes. Se aplican facturación y cuota.
GeminiEstilos de voz e instrucciones escritas sobre la forma de hablar.Los modelos preliminares y las cuotas pueden cambiar; la latencia varía.Internet, clave de API de Gemini y acceso al modelo TTS seleccionado. Comprueba límites y facturación de la cuenta.
SpeechifyID de voz con controles de velocidad, idioma y modelo.Necesita acceso a API; las voces disponibles dependen de la cuenta.Internet y clave de API de Speechify. Se aplican las condiciones y límites de uso de API.
OpenAIVoces con nombre y controles de modelo y formato.Requiere facturación de API e Internet; la suscripción de la cuenta es independiente.Clave de API con acceso a TTS. El texto del chat se envía al endpoint configurado.
Personalizado / localUtiliza tu propio servidor de voz compatible.Más configuración: endpoint, modelo, voz y acceso del navegador deben coincidir.Un endpoint de voz compatible con OpenAI accesible; clave si se requiere. Los costos de equipo local o alojamiento varían.

Los tamaños de descarga anteriores corresponden a archivos de modelos, no al uso total de memoria ni a todos los recursos necesarios. Los proveedores locales utilizan la computadora que ejecuta el panel/superposición; el primer uso puede ser más lento y OBS tiene su propia caché. Los proveedores en la nube ahorran procesamiento local, pero envían el texto fuera del dispositivo.

OBS: los cuatro proveedores locales siguientes pasaron las pruebas de grabación de la fuente de navegador. Los proveedores en la nube/personalizados devuelven audio para que lo reproduzca la página, pero no se probaron con cuentas reales en esta revisión. La voz del sistema necesita una prueba independiente aunque enumere voces.

Ajustes de proveedores y nombres de voces

Ajustes reales de la aplicación de escritorio, capturados con un perfil nuevo. Abre el proveedor que quieras; los campos de claves de API están vacíos deliberadamente. Estos controles configuran el panel o la superposición de SSN seleccionados. Selecciona una captura para verla a tamaño completo.

TTS del sistema

La lista de idiomas está vacía en este perfil nuevo. Las voces disponibles dependen del navegador o aplicación y de las voces instaladas; no existe una lista universal de voces de SSN.

Ajustes reales del proveedor Voz del sistema de SSN
Kokoro

Elige una voz en SSN; el modelo se carga en la página que habla. La selección incluye inglés de Estados Unidos/Reino Unido, español y portugués de Brasil. Utiliza el filtro de idioma para encontrar voces; Probar reproduce una frase corta en el idioma seleccionado. Para reducir el uso de CPU, prueba Piper.

Ajustes reales del proveedor Kokoro de SSN
Nombres de voces y valores de URL
  • Heart (femenina estadounidense) — af_heart
  • Alloy (femenina estadounidense) — af_alloy
  • Aoede (femenina estadounidense) — af_aoede
  • Bella (femenina estadounidense) — af_bella
  • Jessica (femenina estadounidense) — af_jessica
  • Kore (femenina estadounidense) — af_kore
  • Nicole (femenina estadounidense) — af_nicole
  • Nova (femenina estadounidense) — af_nova
  • River (femenina estadounidense) — af_river
  • Sarah (femenina estadounidense) — af_sarah
  • Sky (femenina estadounidense) — af_sky
  • Adam (masculina estadounidense) — am_adam
  • Echo (masculina estadounidense) — am_echo
  • Eric (masculina estadounidense) — am_eric
  • Fenrir (masculina estadounidense) — am_fenrir
  • Liam (masculina estadounidense) — am_liam
  • Michael (masculina estadounidense) — am_michael
  • Onyx (masculina estadounidense) — am_onyx
  • Puck (masculina estadounidense) — am_puck
  • Santa (masculina estadounidense) — am_santa
  • Emma (femenina británica) — bf_emma
  • Isabella (femenina británica) — bf_isabella
  • George (masculina británica) — bm_george
  • Lewis (masculina británica) — bm_lewis
  • Alice (femenina británica) — bf_alice
  • Lily (femenina británica) — bf_lily
  • Daniel (masculina británica) — bm_daniel
  • Fable (masculina británica) — bm_fable
  • Dora (español) - ef_dora
  • Alex (español) - em_alex
  • Santa (español) - em_santa
  • Dora (portugués de Brasil) - pf_dora
  • Alex (portugués de Brasil) - pm_alex
  • Santa (portugués de Brasil) - pm_santa
Kitten

Ocho voces en inglés: variantes masculinas y femeninas numeradas 2, 3, 4 y 5. La muestra utiliza Voz 4 (femenina).

Ajustes reales del proveedor Kitten de SSN
Nombres de voces y valores de URL
  • Voz 2 (masculina) — expr-voice-2-m
  • Voz 2 (femenina) — expr-voice-2-f
  • Voz 3 (masculina) — expr-voice-3-m
  • Voz 3 (femenina) — expr-voice-3-f
  • Voz 4 (masculina) — expr-voice-4-m
  • Voz 4 (femenina) — expr-voice-4-f
  • Voz 5 (masculina) — expr-voice-5-m
  • Voz 5 (femenina) — expr-voice-5-f
Piper

Elige un idioma y modelo compatibles entre sí. La muestra utiliza HFC medium. Un ajuste de idioma por sí solo no traduce una voz.

Ajustes reales del proveedor Piper de SSN
Nombres de voces y valores de URL
  • Inglés de Estados Unidos, femenina (HFC) - Media — en_US-hfc_female-medium
  • Español de España (DaveFX) - Media — es_ES-davefx-medium
  • Español de México (Ald) - Media — es_MX-ald-medium
  • Portugués de Brasil (Faber) - Media — pt_BR-faber-medium
  • Portugués de Brasil (Edresson) - Baja — pt_BR-edresson-low
  • Portugués de Portugal (Tugao) - Media — pt_PT-tugão-medium
eSpeak

Elige una voz del idioma y ajusta opcionalmente la velocidad de lectura. Este motor suena robótico por diseño.

Ajustes reales del proveedor eSpeak de SSN
Nombres de voces y valores de URL
  • Inglés — en
  • Español — es
  • Portugués de Brasil — pt-br
  • Portugués de Portugal — pt-pt
ElevenLabs

Introduce tu clave de API y luego utiliza Mostrar mis voces disponibles (List My Available Voices) para encontrar un ID de voz que tu cuenta pueda utilizar. Referencia de proveedores.

Ajustes reales del proveedor ElevenLabs de SSN
Google Cloud

Introduce una clave de API de Google Cloud TTS y el nombre exacto de la voz, con su idioma correspondiente. Nombres de voces y controles compatibles.

Ajustes reales del proveedor Google Cloud de SSN
Gemini

Selecciona un modelo TTS y una voz compatibles; las instrucciones de estilo cambian la forma de hablar. Estos son ajustes de Gemini API, independientes de Google Cloud TTS. Ejemplos de voces y requisitos.

Ajustes reales del proveedor Gemini de SSN
Fish Audio

Selecciona Fish Audio en el menú de proveedores TTS del panel de chat, la superposición de mensajes destacados, la página TTS o Flow Actions. Introduce tu propia Clave de API de Fish Audio, luego utiliza el botón Probar TTS existente. Un ID de voz opcional selecciona una voz de Fish Audio; copia el ID del modelo de voz, no su nombre ni la URL de su página. Déjalo vacío para utilizar la voz predeterminada del servicio.

Las opciones avanzadas incluyen el modelo y la velocidad de lectura (0,5–2). SSN utiliza de forma predeterminada s2.1-pro-free; Fish Audio controla la disponibilidad del plan gratuito y las condiciones de uso razonable. Los modelos de pago requieren crédito en la cuenta. SSN no reintenta una solicitud gratuita fallida con un modelo de pago. Utiliza Más opciones de TTS para el volumen de los espectadores. El texto se envía a Fish Audio y el servicio detecta el idioma.

Configuración de OBS / navegador: Ejecuta el puente TTS local existente de SSN en modo Fish en la computadora con OBS. Asigna a la variable de entorno SSN_TTS_TARGET_BEARER tu clave de API de Fish e inicia node scripts/local-tts-bridge.cjs --mode fish. En el panel de Fish Audio, configura URL del puente para OBS / navegador a http://127.0.0.1:8124/v1/audio/speech; pega el token del puente local mostrado en la terminal en el campo de la ventana emergente Clave de API . El token cambia al reiniciar salvo que configures SSN_TTS_BRIDGE_TOKEN con un secreto aleatorio largo; mantén privados los enlaces de superposición que contengan el token. Deja el puente en ejecución, prueba la voz y utiliza la URL de superposición generada en OBS. Activa Controlar audio mediante OBS en los ajustes de la fuente de navegador si quieres su audio en el mezclador de OBS. Las solicitudes directas de Fish desde páginas alojadas carecen de permiso CORS; el puente proporciona una respuesta de audio accesible para el navegador.

Con el puente, añade &fishendpoint=http%3A%2F%2F127.0.0.1%3A8124%2Fv1%2Faudio%2Fspeech a la URL y omite fishkey cuando el puente guarde la clave.

Parámetros de URL: &ttsprovider=fish&fishkey=YOUR_KEY&voicefish=VOICE_ID&fishmodel=s2.1-pro-free&fishspeed=1. Activa TTS con los controles habituales. Mantén privadas las URL generadas que contengan tu clave. La opción existente de voz de la acción Leer texto (Speak Text) de Event Flow acepta un ID de voz de Fish cuando la página receptora utiliza Fish Audio.

Referencia de API de Fish Audio · Anuncio y condiciones del modelo gratuito

Speechify

Guía paso a paso de Speechify: clave de API, voces, velocidad y volumen para espectadores.

Introduce la clave de API y el ID de voz de tu cuenta de API de Speechify. Configuración del proveedor.

Ajustes reales del proveedor Speechify de SSN
OpenAI

Elige una voz/modelo compatible e introduce una clave de API. Una suscripción de ChatGPT no proporciona créditos de API. Mantén el endpoint predeterminado para OpenAI.

Ajustes reales del proveedor OpenAI de SSN
TTS personalizado / local

Esta opción reutiliza los controles compatibles con OpenAI, así que el encabezado sigue diciendo OpenAI. Introduce el endpoint de tu servidor y una voz/modelo que admita; la autenticación depende de tu servidor. Consulta la guía de servidor local.

Ajustes reales del proveedor TTS personalizado/local de SSN
Avanzado: editar manualmente una URL de TTS

Buenas primeras pruebas:

dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=kokoro
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=piper
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=kitten

Para portugués o español, empieza por una de estas voces:

dock.html?session=YOUR_SESSION&speech=pt-BR&ttsprovider=piper&pipervoice=pt_BR-faber-medium
dock.html?session=YOUR_SESSION&speech=pt-BR&ttsprovider=espeak&espeakvoice=pt-br
dock.html?session=YOUR_SESSION&speech=es-ES&ttsprovider=piper&pipervoice=es_ES-davefx-medium
dock.html?session=YOUR_SESSION&speech=es-ES&ttsprovider=espeak&espeakvoice=es

Referencia completa de TTS · Guía de servidor TTS local

Avanzado: ejecutar tu propio servidor TTS local

Un servidor TTS local es útil cuando quieres voces privadas, un modelo de voz concreto o un servidor como Kokoro-FastAPI u openedai-speech. La página que reproduce TTS debe poder acceder al endpoint.

Diagrama que muestra una fuente de navegador de OBS enviando solicitudes TTS mediante el puente TTS local de Social Stream Ninja a un servidor TTS
Para OBS, el puente local suele funcionar mejor cuando se ejecuta en la misma computadora que OBS.
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=customtts&openaiendpoint=http://127.0.0.1:8124/v1/audio/speech&voiceopenai=af_bella

localhost significa la computadora que ejecuta la página. Si tu servidor TTS está en otra computadora, utiliza su IP de la red local o ejecuta el puente en la computadora con OBS.