Lee tu chat en vivo en voz alta con voces de IA locales. Empieza por la opción sin instalación y utiliza un servidor local solo si lo necesitas.
Social Stream Ninja puede leer los mensajes del chat en voz alta mediante texto a voz con IA local. «Local» puede significar dos cosas: la voz se ejecuta dentro del navegador, o ejecutas un pequeño servidor TTS en tu propia computadora.
Hay dos enfoques:
Varias voces de IA de alta calidad están integradas directamente en Social Stream Ninja. Se ejecutan en tu navegador con WebAssembly u ONNX: sin servidor, sin Docker y sin instalación.
Solo tienes que añadir un parámetro a la URL y empezar.
Ejecuta un servidor TTS local en tu computadora y conecta Social Stream Ninja a él. Te ofrece más voces, clonación de voz y control desde el servidor.
Utiliza la compatibilidad integrada de Social Stream con Endpoint compatible con OpenAI .
Este es el camino más corto para la mayoría de los streamers:
&speech=en-US&ttsprovider=kokoro o &speech=en-US&ttsprovider=kitten a tu dock.html URL.Testing local TTS. Espera a que se descarguen los modelos la primera vez si utilizas Kokoro o Piper.Este es el error más común al usar TTS local.
localhost y 127.0.0.1 siempre significan «esta misma computadora». Si OBS está en una computadora y Kokoro en otra, 127.0.0.1 dentro de la URL de OBS apunta a la computadora con OBS, no a la computadora con Kokoro.
127.0.0.1 solo cuando el servidor TTS esté en la misma computadora que la página que reproduce el audio. Si el servidor está en otra computadora, utiliza la dirección IP de su red local.| Tu configuración | Endpoint que debes utilizar |
|---|---|
| OBS y Kokoro se ejecutan en la misma computadora | http://127.0.0.1:8880/v1/audio/speech |
| Kokoro se ejecuta en otra computadora de tu red doméstica | http://192.168.x.x:8880/v1/audio/speech, usando la IP de la red local de la computadora con Kokoro |
| El botón de prueba de la aplicación de escritorio SSN funciona, pero OBS no tiene sonido | OBS sigue necesitando su propio endpoint operativo. La prueba de la aplicación no demuestra que OBS pueda acceder al servidor. |
En Linux, macOS y Windows, comprueba también que el firewall permita el puerto y que Docker lo haya publicado con -p 8880:8880.
En la ventana emergente de la extensión, abre el selector de proveedor TTS y elige Endpoint TTS personalizado / local. Esto muestra los campos del endpoint local compatible con OpenAI y el enlace a esta guía.
SSN trata un servidor TTS local/propio como un endpoint de voz compatible con OpenAI. El flujo básico es:
Para ttsprovider=customtts, localtts, o openai, SSN envía una solicitud POST con JSON al endpoint configurado:
CORS es una comprobación de permisos del navegador. En términos sencillos: el servidor TTS debe decirle al navegador «sí, esta página tiene permiso para pedirme audio». Si falta ese permiso, la solicitud puede bloquearse antes de que Kokoro u otro servidor TTS la reciba.
dock.html en Chrome u OBS, CORS puede importar.https://beta.socialstream.ninja/dock.html, Chrome también puede bloquear las solicitudes a direcciones HTTP locales o privadas.Si el servidor no permite solicitudes del navegador, ejecuta el puente TTS local de SSN y dirige SSN a http://127.0.0.1:8124/v1/audio/speech. Para OBS, lo más sencillo es ejecutar el puente en la misma computadora que OBS.
| Respuesta | Compatibilidad con SSN | Notas |
|---|---|---|
| Audio binario | Sí | Mejor opción. Devuelve audio/mpeg, audio/wav, audio/ogg, audio/aac, u otro formato de audio que el navegador pueda reproducir. |
| JSON con URL de audio | Sí | SSN comprueba url, audio_url, output_url, campos anidados como data.url, y el primer elemento de data[] . |
| JSON con audio en base64 | Sí | SSN comprueba audio, audio_data, audioContent, b64_json, campos anidados como data y URL de datos. |
| PCM sin procesar | Solo si está encapsulado | Devuelve PCM como archivo WAV o WAV en base64. Un elemento de audio del navegador no puede reproducir de forma fiable bytes PCM sin procesar directamente. |
mp3 para archivos pequeños y amplia compatibilidad con navegadores, wav para servidores locales de clonación y pruebas del puente, y opus solo cuando tanto el servidor como el navegador lo admitan.
SSN actualmente no ofrece reproducción progresiva para endpoints TTS personalizados/locales. Espera el blob de respuesta o los datos de audio JSON y luego los reproduce. Algunos servidores ofrecen endpoints de streaming, pero la vía actual compatible con OpenAI de SSN almacena el audio antes de reproducirlo.
Consecuencia práctica: utiliza fragmentos cortos para el TTS del chat. La reproducción en streaming necesitaría una vía de reproducción independiente con fragmentos WAV/MP3 transmitidos, MediaSource, WebCodecs o un mezclador en el servidor.
Estos motores vienen incluidos en Social Stream Ninja y no requieren instalación. Se ejecutan en el navegador con WebAssembly (WASM) u ONNX Runtime.
| Proveedor | Calidad | Uso de CPU | GPU/WebGPU | Parámetro de URL |
|---|---|---|---|---|
| Kokoro TTS | ⭐⭐⭐⭐⭐ Excelente | Medio | Más rápido con GPU | ?ttsprovider=kokoro |
| Piper TTS | ⭐⭐⭐⭐ Muy buena | Bajo | Solo CPU | ?ttsprovider=piper |
| Kitten TTS | ⭐⭐⭐ Buena | Muy bajo | Solo CPU | ?ttsprovider=kitten |
| eSpeak-NG | ⭐⭐ Robótica | Mínimo | Solo CPU | ?ttsprovider=espeak |
Añade &ttsprovider= y &speech= a tu Social Stream dock.html URL:
SSN incluye actualmente 28 voces de Kokoro en inglés, tres en español y tres en portugués de Brasil. Especifica una con &voicekokoro=:
Ejemplo en español:
Ejemplo en portugués:
Especifica un modelo de voz con &pipervoice=:
Hay voces Piper en portugués y español:
La extensión de Chrome, la fuente de navegador de OBS y la aplicación de escritorio independiente de Social Stream Ninja utilizan los mismos dock.html parámetros de URL para TTS. La diferencia importante es dónde se produce el sonido.
| Entorno | Comportamiento de TTS local | Captura de audio |
|---|---|---|
| Extensión de Chrome / fuente de navegador de OBS | Las solicitudes del navegador requieren que el servidor local permita CORS, salvo que utilices el puente de SSN. | Utiliza una fuente de navegador de OBS con «Controlar audio mediante OBS» (Control audio via OBS). |
| Aplicación de escritorio independiente | Utiliza los mismos ajustes del proveedor. Las ventanas de archivos locales de la aplicación tienen menos restricciones CORS, pero el puente sigue siendo la vía más segura para servidores que rechazan solicitudes de tipo navegador. | Captura el audio del escritorio o de la aplicación, o dirige la aplicación a un cable de audio virtual. |
| Kokoro integrado en la aplicación de escritorio | La aplicación puede utilizar su vía local ninjafy.tts para Kokoro en vez de depender únicamente de la carga del modelo en el navegador. |
El audio se reproduce desde la aplicación, así que utiliza la captura de audio del escritorio o de la aplicación. |
dock.html URL en OBS, es OBS quien debe acceder al servidor TTS y reproducir el audio.
Si quieres más voces, clonación de voz o un servidor dedicado que puedas reutilizar con otras herramientas, puedes ejecutar un servidor TTS local. Social Stream Ninja se conecta a él mediante su función integrada Endpoint TTS compatible con OpenAI ; no se necesita clave de API para servidores locales.
Tres opciones recomendadas:
| Servidor | Modelo | GPU | Disco | Puerto predeterminado |
|---|---|---|---|---|
| Kokoro-FastAPI Recomendado | Kokoro 82M | Opcional | ~2 GB | 8880 |
| openedai-speech (Piper) Ligero | Piper TTS | Solo CPU | <1 GB | 8000 |
| kokoro-web | Kokoro 82M | Opcional | ~2 GB | 3000 |
| Paquete | Ventaja principal | Desventaja |
|---|---|---|
| Kokoro integrado | Mejor primera opción: sin servidor, buena calidad, privado y funciona en el navegador y la aplicación de escritorio. | Sin clonación de voz. |
| Kokoro-FastAPI | Servidor compatible con OpenAI, configuración sencilla con Docker, CPU o GPU y muchas voces de Kokoro. | No ofrece clonación de voz real; la mezcla de voces y las funciones de voz personalizada dependen de la versión del servidor. |
| openedai-speech | Endpoint ligero compatible con OpenAI; Piper funciona bien con CPU y XTTS añade clonación con unos 4 GB de VRAM. | El repositorio indica que está mayormente obsoleto, así que considéralo útil, pero sin garantía de continuidad. |
| Servidores Chatterbox | Clonación de voz, opciones de interfaz web, API compatibles con OpenAI y herramientas para textos largos. | La compatibilidad con CUDA/GPU es más fluida que con CPU en algunas versiones; la configuración depende de la variante del servidor. |
| GPT-SoVITS | Clonación y control avanzados con referencias cortas y compatibilidad con transcripciones. | No es compatible con OpenAI de forma predeterminada; utiliza el modo de puente de SSN. |
| F5-TTS | Clonación natural sin entrenamiento previo con WAV de referencia + transcripción. | El proyecto oficial no es un simple endpoint de OpenAI; utiliza un adaptador o el modo de puente. |
| Qwen3-TTS | Funciones modernas de clonación y diseño de voces, incluidos modelos más pequeños de 0.6B/1.7B. | Orientado primero a la biblioteca/demo; necesita un adaptador para SSN. |
| MisoTTS | Generación avanzada de voz mediante instrucciones. | No es adecuado para uso local con 6 GB de VRAM; utiliza alojamiento remoto o personalizado si lo necesitas. |
La clonación de voz no es un modo independiente de SSN. Es una función de algunos servidores TTS locales. SSN envía el texto del chat a un endpoint local; el servidor elige la voz clonada a partir de un archivo de audio de referencia guardado, un perfil de voz o la configuración del puente.
ttsprovider=customtts.Para 6 GB de VRAM o menos, empieza por modelos pequeños de clonación sin entrenamiento previo y servidores compatibles con OpenAI. Los modelos grandes también pueden funcionar mediante el mismo endpoint de SSN si el usuario los aloja en otro equipo.
| Opción | Clonación de voz | Compatible con 6 GB de VRAM | Ruta de la API para SSN |
|---|---|---|---|
| Qwen3-TTS 0.6B Base | Audio de referencia de 3 segundos | Probable | Utiliza un adaptador compatible con OpenAI y luego ttsprovider=customtts |
| XTTS-v2 / openedai-speech | Voces de referencia WAV cortas | Sí, unos 4 GB según openedai-speech | /v1/audio/speech |
| Chatterbox Turbo / Server | Clonación con audio de referencia | Probable si se usa Turbo / fragmentos pequeños | Versiones de servidor compatibles con OpenAI, o el puente |
| GPT-SoVITS | 5 segundos sin entrenamiento previo; 1 minuto con pocos ejemplos | Probable con fp16 / instalación ligera | Usa scripts/local-tts-bridge.cjs --mode gptsovits |
| F5-TTS | WAV de referencia + transcripción | Tal vez; depende de la versión y del vocoder | Utiliza un adaptador compatible con OpenAI, o --mode f5 para adaptadores de servidor F5-TTS |
| MisoTTS 8B | Contexto de audio de referencia | No; el proyecto recomienda 24 GB de VRAM | Solo endpoint remoto/personalizado |
POST /v1/audio/speech con { model, input, voice, response_format, speed } y devolver un archivo de audio reproducible. Esto incluye OpenAI, Coqui/XTTS, adaptadores de Kokoro, adaptadores de Qwen y la mayoría de los servicios proxy.
Estos son puntos de partida prácticos, no garantías estrictas. La versión del modelo, la cuantización, la longitud del texto, la imagen de Docker y las aplicaciones en segundo plano pueden cambiar el uso de memoria.
| Opción | Computadora mínima recomendada | Buen candidato | Notas |
|---|---|---|---|
| Voz del sistema / eSpeak | Cualquier PC moderno | Cualquier PC | Rápido, de baja calidad y sin clonación. |
| Kitten integrado | CPU básica, 4 GB de RAM | CPU de portátil moderno, 8 GB de RAM | Modelo ONNX pequeño, inicio rápido. |
| Piper integrado | CPU moderna, 4–8 GB de RAM | CPU moderna, 8 GB de RAM | Buena opción de voz neuronal que consume pocos recursos. |
| Kokoro integrado | CPU moderna, 8 GB de RAM | GPU compatible con WebGPU o CPU rápida, 8–16 GB de RAM | La mejor calidad sin configuración. La primera carga descarga los archivos del modelo. |
| Kokoro-FastAPI | Servidor Docker con CPU, 8 GB de RAM | GPU NVIDIA opcional, 8–16 GB de RAM | Buen servidor local cuando cargar el modelo en el navegador no resulta ideal. |
| openedai-speech Piper | CPU, 4–8 GB de RAM | CPU, 8 GB de RAM | Servidor ligero compatible con OpenAI. |
| openedai-speech XTTS | GPU NVIDIA con unos 4 GB de VRAM, 8–16 GB de RAM | GPU NVIDIA con 6 GB o más; 16 GB de RAM | Vía de clonación de voz; es posible usar CPU, pero es lento. |
| Servidores Chatterbox | La CPU puede funcionar en algunas versiones, pero es lenta | GPU NVIDIA con 6 GB o más; 16 GB de RAM | Utiliza GPU para clonar voces o procesar textos largos. |
| GPT-SoVITS / F5-TTS / Qwen3-TTS | Solo para pruebas con CPU; lento | GPU NVIDIA con 6 GB o más para modelos pequeños u optimizados; 16 GB de RAM | La elección del adaptador y el tamaño del modelo importan. Necesitarás más configuración. |
| MisoTTS 8B | No se recomienda localmente con 6 GB de VRAM | 24 GB de VRAM o servidor remoto | El repositorio recomienda GPU con mucha VRAM para el uso interactivo. |
Estas son las opciones de clonación de voz en servidores propios cuya compatibilidad con SSN se comprobó. La vía del endpoint local se probó con ambos dock.html y featured.html.
SSN acepta respuestas directas de audio binario, respuestas JSON con audio en base64 y respuestas JSON con una URL de audio. La reproducción personalizada/local actual almacena el audio devuelto antes de reproducirlo; todavía no admite reproducción progresiva en streaming.
| Servidor | Vía de conexión de SSN | Notas |
|---|---|---|
| openedai-speech | Directo o mediante puente | Compatible con OpenAI /v1/audio/speech. El modo Piper se probó con síntesis real en CPU desde dock.html y featured.html, directamente y a través del puente. Si ejecutas el código fuente en Windows, asegúrate de que la carpeta Scripts del entorno virtual esté en PATH para que piper.exe y ffmpeg.exe se puedan encontrar. |
| chatterbox-tts-api | Directo o mediante puente | Compatible con OpenAI /v1/audio/speech. Utiliza el audio de referencia configurado para la clonación. Se probó el formato de la API directamente y a través del puente. |
| Chatterbox-TTS-Server | Directo o mediante puente | Endpoint compatible con OpenAI e interfaz web. Probado con síntesis real en CPU utilizando Emily.wav desde dock.html y featured.html, directamente y a través del puente. |
| GPT-SoVITS | Modo del puente | Ejecuta el puente de SSN con --mode gptsovits; el servidor de destino es /tts, no compatible con OpenAI. |
| F5-TTS_server | Modo del puente | Ejecuta el puente de SSN con --mode f5; el servidor de destino utiliza GET /synthesize_speech/. |
| F5-TTS oficial | Necesita adaptador | Orientado primero a CLI, Gradio y servidor de sockets. Utiliza un adaptador compatible con OpenAI o el modo de puente F5 con un adaptador. |
| Qwen3-TTS | Necesita adaptador | Orientado primero a la biblioteca y la demo de Gradio. Buen candidato para un pequeño adaptador compatible con OpenAI alrededor de generate_voice_clone. |
| MisoTTS | Solo remoto/personalizado | Admite clonación de voz, pero el modelo 8B no es adecuado para 6 GB de VRAM y no tiene un endpoint REST local en el repositorio. |
Kokoro-FastAPI ejecuta el modelo Kokoro 82M como servidor local con una API compatible con OpenAI. Funciona con CPU (no requiere GPU) y tiene una calidad de voz excelente.
Abre una terminal (Símbolo del sistema, PowerShell o Terminal) y ejecuta uno de los siguientes comandos:
Abre tu navegador y ve a http://localhost:8880/web/: deberías ver una interfaz web donde puedes probar las voces.
Más de 67 voces disponibles. Algunas destacadas:
Explora y prueba todas las voces en http://localhost:8880/web/ una vez que el servidor esté en ejecución.
Si Kokoro-FastAPI está en la misma computadora que OBS:
Si Kokoro-FastAPI está en otra computadora, sustituye 192.168.x.x por la dirección IP de la red local de esa computadora:
af_bella, af_sarah, am_adam, o bf_emma. Nombres como echo, nova, y alloy son nombres del estilo de OpenAI/openedai-speech y podrían no funcionar con Kokoro.
Para mantener Kokoro-FastAPI en ejecución automáticamente en segundo plano, utiliza la opción de reinicio de Docker:
Ahora se iniciará automáticamente con Docker Desktop cada vez que reinicies.
openedai-speech ofrece el endpoint compatible con OpenAI /v1/audio/speech que necesita Social Stream. Su imagen pequeña ejecuta Piper en la CPU; su imagen completa puede ejecutar la clonación de voz con XTTS-v2 en una GPU compatible.
Utiliza esta opción para un servidor TTS de solo CPU que ocupe menos de 1 GB. No incluye XTTS-v2 ni clonación de voz.
docker-compose.min.yml. También puedes ejecutar directamente los siguientes comandos.
Si ejecutas openedai-speech desde una copia local del código en vez de Docker, añade la carpeta de scripts de su entorno virtual a PATH antes de iniciar el servidor. Sin esto, las solicitudes pueden devolver HTTP 500 porque el servidor no puede encontrar piper.exe o ffmpeg.exe.
openedai-speech utiliza nombres de voz del estilo de OpenAI asociados a voces Piper:
XTTS-v2 en sí es un modelo, no una API web. Utiliza el servidor completo de openedai-speech para cargar el modelo, seleccionar una voz de referencia guardada, aceptar texto de chat de SSN y devolver audio reproducible. El servidor indica como objetivo práctico unos 4 GB de VRAM de GPU; la inferencia con CPU es posible, pero lenta.
openedai-speech-min para XTTS-v2. La imagen mínima solo incluye Piper. XTTS-v2 requiere la instalación completa y model=tts-1-hd en cada solicitud de voz.
En macOS o Linux, utiliza cp sample.env speech.env en vez de Copy-Item. Docker debe tener acceso a una GPU compatible. El modelo se descarga la primera vez que se usa.
tts-1-hd en config/voice_to_speaker.yaml:Conserva las voces existentes que ya aparezcan en tts-1-hd. Cambia me por el nombre de voz que quieras que envíe SSN y utiliza el código de idioma de XTTS correcto cuando sea necesario.
openaimodel=tts-1-hd es necesario para XTTS-v2. Si se omite, Social Stream envía su valor predeterminado tts-1, y openedai-speech selecciona Piper en su lugar. El valor de voiceopenai debe coincidir con el nombre de la voz clonada en voice_to_speaker.yaml.
Si el navegador u OBS bloquean la solicitud directa, ejecuta el Puente TTS local en la computadora con OBS y conserva los mismos parámetros de modelo y voz al cambiar openaiendpoint a http://127.0.0.1:8124/v1/audio/speech.
El puente es una pequeña herramienta local. Acepta la solicitud del navegador desde SSN, se comunica con tu servidor TTS y devuelve el audio a SSN con encabezados compatibles con el navegador.
http://127.0.0.1:8124/v1/audio/speech, aunque el servidor TTS real esté en otra computadora.
La carpeta de inicio independiente es local-tts-bridge/; consulta el README del puente para ver todas las opciones de inicio.
Windows PowerShell, cuando el servidor TTS está en esta misma computadora:
Windows PowerShell, cuando el servidor TTS está en otra computadora:
Terminal de macOS/Linux:
Luego dirige la URL de OBS dock.html al puente:
GPT-SoVITS utiliza su propio formato JSON para /tts , por lo que el puente puede convertir la solicitud de SSN compatible con OpenAI en el cuerpo de solicitud de GPT-SoVITS.
Algunos adaptadores de servidor F5-TTS ofrecen /synthesize_speech/?text=...&voice=... en vez de un endpoint compatible con OpenAI. El puente puede convertir la solicitud de SSN a ese formato de consulta.
http://127.0.0.1:8124/v1/audio/speech. Cambia el puerto con SSN_TTS_BRIDGE_PORT=8125 si es necesario.
Todos los servidores propios anteriores utilizan el mismo método de conexión: la función integrada de Social Stream Endpoint TTS de OpenAI con una URL local personalizada.
| Parámetro | Valor | Descripción |
|---|---|---|
ttsprovider |
customtts o openai |
Utiliza la vía TTS compatible con OpenAI. Usa customtts para endpoints locales/propios. |
openaiendpoint |
http://localhost:8880/v1/audio/speech |
URL de tu servidor local (cambia el puerto según sea necesario) |
speech |
en-US |
Activa TTS en inglés |
voiceopenai |
af_bella |
Nombre de voz (depende del servidor) |
openaiformat |
mp3 |
Formato de audio: mp3, wav, opus, flac |
openaispeed |
1.0 |
Velocidad de lectura (0,5–2,0) |
customttsendpoint y localttsendpoint también funcionan. customttsvoice, localttsvoice, customttsmodel, localttsmodel, customttsformat, y localttsformat son alias aceptados para los campos del estilo de OpenAI.
openaiendpoint debe ser accesible desde la página que reproduce TTS, y voiceopenai debe ser una voz admitida por tu servidor. Kokoro-FastAPI utiliza nombres como af_bella; openedai-speech suele usar nombres como nova o echo.
Estas opciones funcionan con cualquier proveedor TTS, incluidos los servidores locales:
| Parámetro | Ejemplo | Descripción |
|---|---|---|
simpletts |
&simpletts |
Omitir «dice»: leer solo el mensaje |
simpletts2 |
&simpletts2 |
Omitir completamente los nombres de usuario |
volume |
&volume=0.8 |
Nivel de volumen (0,0–1,0) |
skipmessages |
&skipmessages=3 |
Leer solo uno de cada 3 mensajes |
ttscommand |
&ttscommand=!say |
Leer solo los mensajes que empiecen por !say |
readevents |
&readevents |
Leer también suscripciones, donaciones, etc. |
ttsquick |
&ttsquick=100 |
Recorta deliberadamente la lectura después de este número de caracteres. Elimínalo si los mensajes se cortan. |
SSN ya admite en el sistema operativo/navegador speechSynthesis, Kokoro integrado, Piper, Kitten y eSpeak. Las incorporaciones futuras más útiles para el navegador serían un selector de dispositivo de salida de audio cuando setSinkId esté disponible, más opciones de voces Piper y una vía dedicada de reproducción progresiva en streaming para servidores capaces de transmitir fragmentos de audio.
La forma de capturar el audio TTS en OBS depende de cómo ejecutes Social Stream Ninja.
Este es el método más sencillo y funciona para todos los proveedores TTS (integrado y servidor propio).
dock.html URL con parámetros TTSSi utilizas la aplicación de escritorio independiente de Social Stream Ninja (no una fuente de navegador de OBS):
Audio Router puede dirigir una aplicación a un cable virtual, pero es un programa antiguo. Prefiere el enrutamiento por aplicación de Windows cuando funcione.
Voicemeeter es la mejor opción cuando necesitas escuchar TTS localmente, enviarlo a OBS y mantenerlo separado de la música o el audio del juego.
?speech=en-US sin un proveedor) depende de las voces que ofrezca el navegador. OBS puede no ofrecer voces, o puede enumerar voces sin producir audio que se pueda capturar. Prueba la voz y la grabación de OBS por separado. Utiliza uno de los proveedores anteriores (kokoro, piper, etc.) en su lugar.
| Opción | Configuración | Calidad | Privado | OBS (fuente de navegador) | Requiere GPU | Costo |
|---|---|---|---|---|---|---|
| Kokoro integrado | Ninguno | ⭐⭐⭐⭐⭐ | Sí | Sí | No (más rápido con GPU) | Gratis |
| Piper integrado | Ninguno | ⭐⭐⭐⭐ | Sí | Sí | No | Gratis |
| Kitten integrado | Ninguno | ⭐⭐⭐ | Sí | Sí | No | Gratis |
| eSpeak integrado | Ninguno | ⭐⭐ | Sí | Sí | No | Gratis |
| Kokoro-FastAPI | Docker | ⭐⭐⭐⭐⭐ | Sí | Sí | No (opcional) | Gratis |
| openedai-speech | Docker | ⭐⭐⭐⭐ | Sí | Sí | No | Gratis |
| ElevenLabs | Clave de API | ⭐⭐⭐⭐⭐ | No | Sí | No | Planes de pago |
| TTS del sistema | Ninguno | ⭐⭐ | Sí | No* | No | Gratis |
* La voz del sistema requiere un cable de audio virtual para capturarla en OBS.
La prueba de la aplicación solo demuestra que la aplicación puede acceder al servidor. La fuente de navegador de OBS todavía debe acceder al endpoint y reproducir el audio.
127.0.0.1 por la IP de la red local de la computadora del servidor TTS.ttsquick. Esa opción recorta deliberadamente el texto leído.&ttsquick=14 u otro número pequeño, elimínalo y actualiza la fuente de navegador de OBS.typewriter=, quítalo temporalmente durante las pruebas. TTS normalmente utiliza el mensaje original, pero eliminar los efectos visuales permite descartar rápidamente problemas de sincronización.http://127.0.0.1:8880/web/ para Kokoro-FastAPI, o el puerto correspondiente de tu servidor.http://SERVER_LAN_IP:8880/web/. Si no carga, OBS tampoco podrá utilizar ese servidor.Si el navegador indica que la solicitud se bloqueó por CORS, acceso a la red local, acceso a una red privada o un error de fetch, es posible que el servidor TTS nunca la reciba.
npm run local-tts-bridge en la computadora con OBS y dirige SSN a http://127.0.0.1:8124/v1/audio/speech.af_bella, af_sarah, am_adam, u otra voz de la interfaz web de Kokoro.nova, echo, y alloy pueden ser válidas.?speech=en-US sin &ttsprovider=). La voz del sistema puede necesitar captura de audio del escritorio o de un cable virtual.Las etiquetas de las imágenes de Docker pueden cambiar. Si un comando de esta guía deja de funcionar, consulta la etiqueta actual en la página del proyecto: