Leia seu chat ao vivo em voz alta com vozes locais de IA. Comece pela opção sem instalação e use um servidor local somente se precisar.
O Social Stream Ninja pode ler mensagens do chat em voz alta usando síntese de voz local com IA. "Local" pode significar duas coisas: a voz é executada dentro do navegador ou você executa um pequeno servidor de TTS no seu próprio computador.
Há duas abordagens:
Várias vozes de IA de alta qualidade estão integradas diretamente ao Social Stream Ninja. Elas são executadas no navegador usando WebAssembly ou ONNX — sem servidor, Docker ou instalação.
Basta adicionar um parâmetro à URL e usar.
Execute um servidor local de TTS na sua máquina e aponte o Social Stream Ninja para ele. Oferece mais opções de voz, clonagem de voz e controle no servidor.
Usa o suporte integrado do Social Stream para Endpoint compatível com OpenAI .
Este é o caminho mais curto para a maioria dos streamers:
&speech=en-US&ttsprovider=kokoro ou &speech=en-US&ttsprovider=kitten ao seu dock.html URL.Testing local TTS. Aguarde os downloads iniciais dos modelos ao usar Kokoro ou Piper.Este é o erro mais comum com TTS local.
localhost e 127.0.0.1 sempre significam "este mesmo computador". Se o OBS estiver em um computador e o Kokoro em outro, 127.0.0.1 dentro da URL do OBS aponta para o computador do OBS, e não para o computador com Kokoro.
127.0.0.1 somente quando o servidor de TTS estiver no mesmo computador da página que reproduz áudio. Se o servidor estiver em outro computador, use o endereço IP dele na rede local.| Sua configuração | Endpoint a usar |
|---|---|
| OBS e Kokoro são executados no mesmo computador | http://127.0.0.1:8880/v1/audio/speech |
| O Kokoro é executado em outro computador na sua rede doméstica | http://192.168.x.x:8880/v1/audio/speech, usando o IP de rede local do computador com Kokoro |
| O botão de teste do aplicativo SSN para desktop funciona, mas o OBS está sem som | O OBS ainda precisa de um endpoint próprio que funcione. O teste no aplicativo não prova que o OBS consegue acessar o servidor. |
No Linux, macOS e Windows, verifique também se o firewall permite a porta e se o Docker publicou a porta com -p 8880:8880.
No popup da extensão, abra o seletor de provedor de TTS e escolha Endpoint de TTS personalizado / local. Isso mostra os campos do endpoint local compatível com OpenAI e o link de volta para este guia.
O SSN trata um servidor de TTS local/próprio como um endpoint de fala compatível com OpenAI. O fluxo principal é:
Para ttsprovider=customtts, localtts, ou openai, o SSN envia um POST JSON para o endpoint configurado:
CORS é uma verificação de permissão do navegador. Em termos simples: o servidor de TTS precisa dizer ao navegador: "sim, esta página pode me pedir áudio". Sem essa permissão, a solicitação pode ser bloqueada antes de chegar ao Kokoro ou a outro servidor de TTS.
dock.html no Chrome ou no OBS, CORS pode ser relevante.https://beta.socialstream.ninja/dock.html, o Chrome também pode bloquear chamadas para endereços HTTP locais ou privados.Se o servidor não permitir solicitações do navegador, execute a Ponte local de TTS do SSN e aponte o SSN para http://127.0.0.1:8124/v1/audio/speech. Para o OBS, a configuração mais fácil é executar a ponte no mesmo computador do OBS.
| Resposta | Suporte no SSN | Notas |
|---|---|---|
| Áudio binário | Sim | Melhor opção. Retorne audio/mpeg, audio/wav, audio/ogg, audio/aac, ou outro tipo de áudio que o navegador possa reproduzir. |
| JSON com URL de áudio | Sim | O SSN verifica url, audio_url, output_url, campos aninhados como data.url, e o primeiro item de data[] . |
| JSON com áudio em base64 | Sim | O SSN verifica audio, audio_data, audioContent, b64_json, campos aninhados como data e URLs de dados. |
| PCM bruto | Somente se encapsulado | Retorne PCM como arquivo WAV ou WAV em base64. Um elemento de áudio do navegador não consegue reproduzir bytes PCM brutos diretamente de forma confiável. |
mp3 para arquivos pequenos e amplo suporte nos navegadores, wav para servidores locais de clonagem e testes da ponte, e opus somente quando o servidor e o navegador oferecerem suporte.
O SSN atualmente não faz reprodução progressiva para endpoints de TTS personalizados/locais. Ele espera o blob de resposta ou o payload de áudio JSON e depois reproduz. Alguns servidores de origem oferecem endpoints de streaming, mas o caminho atual compatível com OpenAI do SSN armazena o áudio antes de reproduzir.
Resultado prático: mantenha curtos os trechos de TTS do chat. O suporte a streaming precisaria de um caminho separado de reprodução com trechos WAV/MP3 transmitidos, MediaSource, WebCodecs ou um mixer no servidor.
Esses mecanismos estão incluídos no Social Stream Ninja e não exigem instalação. Eles são executados no navegador usando WebAssembly (WASM) ou ONNX Runtime.
| Provedor | Qualidade | Uso de CPU | GPU/WebGPU | Parâmetro de URL |
|---|---|---|---|---|
| TTS Kokoro | ⭐⭐⭐⭐⭐ Excelente | Médio | Mais rápido com GPU | ?ttsprovider=kokoro |
| Piper TTS | ⭐⭐⭐⭐ Muito bom | Baixo | Somente CPU | ?ttsprovider=piper |
| Kitten TTS | ⭐⭐⭐ Bom | Muito baixo | Somente CPU | ?ttsprovider=kitten |
| eSpeak-NG | ⭐⭐ Robótico | Mínimo | Somente CPU | ?ttsprovider=espeak |
Adicione &ttsprovider= e &speech= ao seu Social Stream dock.html URL:
O SSN lista atualmente 28 vozes Kokoro em inglês, três em espanhol e três em português do Brasil. Especifique uma com &voicekokoro=:
Exemplo em espanhol:
Exemplo em português:
Especifique um modelo de voz com &pipervoice=:
Há vozes Piper disponíveis em português e espanhol:
A extensão do Chrome, a fonte de navegador do OBS e o aplicativo independente para desktop do Social Stream Ninja usam os mesmos dock.html parâmetros de URL para TTS. A diferença importante é onde o som é produzido.
| Ambiente | Comportamento do TTS local | Captura de áudio |
|---|---|---|
| Extensão do Chrome / fonte de navegador do OBS | O fetch do navegador exige CORS do servidor local, a menos que você use a ponte do SSN. | Use uma fonte de navegador do OBS com "Control audio via OBS". |
| Aplicativo independente para desktop | Usa as mesmas configurações de provedor. As janelas de arquivos locais do aplicativo têm menos restrições de CORS, mas a ponte ainda é o caminho mais seguro para servidores que rejeitam solicitações no estilo do navegador. | Capture o áudio do desktop/aplicativo ou direcione o aplicativo para um cabo de áudio virtual. |
| Kokoro integrado no aplicativo para desktop | O aplicativo pode usar seu caminho local ninjafy.tts para Kokoro, em vez de depender apenas do carregamento do modelo no navegador. |
O áudio toca pelo aplicativo, então use a captura de áudio do desktop/aplicativo. |
dock.html no OBS, é o OBS que precisa acessar o servidor de TTS e reproduzir o áudio.
Se quiser mais opções de voz, clonagem de voz ou um servidor dedicado que possa reutilizar em várias ferramentas, você pode executar um servidor local de TTS. O Social Stream Ninja se conecta a ele usando seu recurso integrado Endpoint de TTS compatível com OpenAI — sem necessidade de chave de API para servidores locais.
Três opções recomendadas:
| Servidor | Modelo | GPU | Disco | Porta padrão |
|---|---|---|---|---|
| Kokoro-FastAPI Recomendado | Kokoro 82M | Opcional | ~2 GB | 8880 |
| openedai-speech (Piper) Leve | Piper TTS | Somente CPU | <1 GB | 8000 |
| kokoro-web | Kokoro 82M | Opcional | ~2 GB | 3000 |
| Pacote | Principal benefício | Limitação |
|---|---|---|
| Kokoro integrado | Melhor primeira escolha: sem servidor, ótima qualidade, privado, funciona no navegador e no aplicativo para desktop. | Sem clonagem de voz. |
| Kokoro-FastAPI | Servidor compatível com OpenAI, configuração fácil via Docker, CPU ou GPU e muitas vozes Kokoro. | Sem clonagem real de voz; a combinação de vozes e os recursos de voz personalizada dependem da versão do servidor. |
| openedai-speech | Endpoint leve compatível com OpenAI; Piper funciona bem em CPU e XTTS adiciona clonagem com cerca de 4 GB de VRAM. | O repositório informa que o projeto está em grande parte obsoleto, então considere-o útil, mas sem garantia de continuidade. |
| Servidores Chatterbox | Clonagem de voz, opções de interface web, APIs compatíveis com OpenAI e ferramentas para textos longos. | O suporte a CUDA/GPU é mais simples que o de CPU em algumas versões; a configuração varia conforme o fork do servidor. |
| GPT-SoVITS | Clonagem e controle avançados com referências curtas e suporte a transcrição. | Não é compatível com OpenAI por padrão; use o modo de ponte do SSN. |
| F5-TTS | Clonagem natural zero-shot com WAV de referência e transcrição. | O projeto oficial não é um simples endpoint OpenAI; use um wrapper ou modo de ponte. |
| Qwen3-TTS | Recursos modernos de clonagem e criação de voz, incluindo modelos menores de 0.6B/1.7B. | Prioriza biblioteca/demonstração; precisa de um wrapper para SSN. |
| MisoTTS | Geração avançada de fala orientada por prompts. | Não é adequado para execução local com 6 GB de VRAM; use hospedagem remota/personalizada, se necessário. |
Clonagem de voz não é um modo separado do SSN. É um recurso de alguns servidores locais de TTS. O SSN envia o texto do chat a um endpoint local; o servidor escolhe a voz clonada a partir de um arquivo de áudio de referência salvo, um perfil de voz ou a configuração da ponte.
ttsprovider=customtts.Para 6 GB de VRAM ou menos, priorize modelos pequenos de clonagem zero-shot e servidores compatíveis com OpenAI. Modelos maiores também podem funcionar pelo mesmo endpoint do SSN se o usuário hospedá-los em outro lugar.
| Opção | Clonagem de voz | Cabe em 6 GB de VRAM | Caminho da API para SSN |
|---|---|---|---|
| Qwen3-TTS 0.6B Base | Áudio de referência de 3 segundos | Provavelmente | Use um wrapper compatível com OpenAI e depois ttsprovider=customtts |
| XTTS-v2 / openedai-speech | Vozes de referência em WAV curto | Sim, cerca de 4 GB informados pelo openedai-speech | /v1/audio/speech |
| Chatterbox Turbo / Server | Clonagem com áudio de referência | Provavelmente com Turbo / trechos pequenos | Versões de servidor compatíveis com OpenAI ou a ponte |
| GPT-SoVITS | 5 segundos para zero-shot, 1 minuto para few-shot | Provavelmente com fp16 / instalação leve | Use scripts/local-tts-bridge.cjs --mode gptsovits |
| F5-TTS | WAV de referência + transcrição | Talvez; depende da versão e do vocoder | Use um wrapper compatível com OpenAI ou --mode f5 para wrappers de servidor F5-TTS |
| MisoTTS 8B | Contexto de áudio por prompt | Não; o projeto recomenda 24 GB de VRAM | Somente endpoint remoto/personalizado |
POST /v1/audio/speech com { model, input, voice, response_format, speed } e retornar um arquivo de áudio reproduzível. Isso abrange OpenAI, Coqui/XTTS, wrappers Kokoro, wrappers Qwen e a maioria dos serviços de proxy.
Estes são pontos de partida práticos, não garantias rígidas. A versão do modelo, quantização, tamanho do texto, imagem Docker e aplicativos em segundo plano podem alterar o uso de memória.
| Opção | Computador mínimo na prática | Bom destino | Notas |
|---|---|---|---|
| TTS do sistema / eSpeak | Qualquer PC moderno | Qualquer PC | Rápido, baixa qualidade, sem clonagem. |
| Kitten integrado | CPU simples, 4 GB de RAM | CPU de notebook moderna, 8 GB de RAM | Modelo ONNX pequeno, inicialização rápida. |
| Piper integrado | CPU moderna, 4–8 GB de RAM | CPU moderna, 8 GB de RAM | Boa opção de voz neural com baixo consumo de recursos. |
| Kokoro integrado | CPU moderna, 8 GB de RAM | GPU compatível com WebGPU ou CPU rápida, 8–16 GB de RAM | Melhor qualidade sem configuração. O primeiro carregamento baixa os arquivos do modelo. |
| Kokoro-FastAPI | Host Docker com CPU, 8 GB de RAM | GPU NVIDIA opcional, 8–16 GB de RAM | Bom servidor local quando carregar modelos no navegador não é ideal. |
| openedai-speech Piper | CPU, 4–8 GB de RAM | CPU, 8 GB de RAM | Servidor leve compatível com OpenAI. |
| openedai-speech XTTS | GPU NVIDIA com cerca de 4 GB de VRAM, 8–16 GB de RAM | GPU NVIDIA com 6 GB ou mais, 16 GB de RAM | Caminho para clonagem de voz; CPU é possível, mas lenta. |
| Servidores Chatterbox | CPU pode funcionar em algumas versões, mas é lenta | GPU NVIDIA com 6 GB ou mais, 16 GB de RAM | Use GPU ao clonar ou processar textos longos. |
| GPT-SoVITS / F5-TTS / Qwen3-TTS | Somente testes em CPU, lento | GPU NVIDIA com 6 GB ou mais para modelos menores/otimizados, 16 GB de RAM | A escolha do wrapper e o tamanho do modelo importam. Espere mais trabalho de configuração. |
| MisoTTS 8B | Não recomendado localmente com 6 GB de VRAM | 24 GB de VRAM ou host remoto | O repositório recomenda GPUs com muita VRAM para uso interativo. |
Estes são os destinos de clonagem de voz em servidor próprio cuja compatibilidade com SSN foi verificada. O caminho do endpoint local foi testado com ambos dock.html e featured.html.
O SSN aceita respostas diretas de áudio binário, respostas JSON com áudio em base64 e respostas JSON com uma URL de áudio. A reprodução personalizada/local atual armazena o áudio retornado antes de reproduzi-lo; a reprodução progressiva em streaming ainda não é compatível.
| Servidor | Caminho do SSN | Notas |
|---|---|---|
| openedai-speech | Direto ou pela ponte | Compatível com OpenAI /v1/audio/speech. O modo Piper foi testado com síntese real em CPU a partir de dock.html e featured.html, diretamente e pela ponte. Se executar a partir do código-fonte no Windows, verifique se a pasta Scripts do venv está em PATH para que piper.exe e ffmpeg.exe possam ser encontrados. |
| chatterbox-tts-api | Direto ou pela ponte | Compatível com OpenAI /v1/audio/speech. Usa o áudio de referência configurado para clonagem. O formato da API foi testado diretamente e pela ponte. |
| Chatterbox-TTS-Server | Direto ou pela ponte | Endpoint compatível com OpenAI e interface web. Testado com síntese real em CPU usando Emily.wav de dock.html e featured.html, diretamente e pela ponte. |
| GPT-SoVITS | Modo da ponte | Execute a ponte do SSN com --mode gptsovits; o servidor de destino é /tts, sem compatibilidade com OpenAI. |
| F5-TTS_server | Modo da ponte | Execute a ponte do SSN com --mode f5; o servidor de destino usa GET /synthesize_speech/. |
| F5-TTS oficial | Precisa de wrapper | Prioriza CLI, Gradio e servidor de socket. Use um wrapper compatível com OpenAI ou o modo de ponte F5 com um wrapper. |
| Qwen3-TTS | Precisa de wrapper | Prioriza biblioteca e demonstração Gradio. Bom candidato para um pequeno wrapper compatível com OpenAI em torno de generate_voice_clone. |
| MisoTTS | Somente remoto/personalizado | Há suporte a clonagem de voz, mas o modelo 8B não é adequado para 6 GB de VRAM e não tem endpoint REST local no repositório. |
Kokoro-FastAPI executa o modelo Kokoro 82M como servidor local com uma API compatível com OpenAI. Funciona em CPU (sem necessidade de GPU) e tem excelente qualidade de voz.
Abra um terminal (Prompt de Comando, PowerShell ou Terminal) e execute uma das opções a seguir:
Abra o navegador e acesse http://localhost:8880/web/— você deverá ver uma interface web onde pode testar vozes.
Mais de 67 vozes disponíveis. Alguns destaques:
Explore e teste todas as vozes em http://localhost:8880/web/ quando o servidor estiver em execução.
Se o Kokoro-FastAPI estiver no mesmo computador do OBS:
Se o Kokoro-FastAPI estiver em outro computador, substitua 192.168.x.x pelo endereço IP desse computador na rede local:
af_bella, af_sarah, am_adam, ou bf_emma. Nomes como echo, nova, e alloy são nomes no estilo OpenAI/openedai-speech e podem não funcionar com Kokoro.
Para manter o Kokoro-FastAPI em execução automática em segundo plano, use a opção de reinicialização do Docker:
Agora ele iniciará automaticamente com o Docker Desktop a cada reinicialização.
openedai-speech disponibiliza o endpoint compatível com OpenAI /v1/audio/speech de que o Social Stream precisa. Sua imagem pequena executa Piper na CPU; a imagem completa pode executar clonagem de voz XTTS-v2 em uma GPU compatível.
Use esta opção para um servidor de TTS somente em CPU com menos de 1 GB. Ela não inclui XTTS-v2 nem clonagem de voz.
docker-compose.min.yml. Como alternativa, execute diretamente os comandos abaixo.
Se executar o openedai-speech a partir de um checkout local em vez do Docker, adicione a pasta de scripts do ambiente virtual a PATH antes de iniciar o servidor. Sem isso, as solicitações podem retornar HTTP 500 porque o servidor não consegue encontrar piper.exe ou ffmpeg.exe.
O openedai-speech usa nomes de voz no estilo OpenAI associados a vozes Piper:
O XTTS-v2 em si é um modelo, e não uma API web. Use o servidor completo openedai-speech para carregar o modelo, selecionar uma voz de referência salva, receber o texto do chat do SSN e retornar áudio reproduzível. O servidor informa um alvo prático de cerca de 4 GB de VRAM de GPU; a inferência em CPU é possível, mas lenta.
openedai-speech-min para XTTS-v2. A imagem mínima contém somente Piper. XTTS-v2 exige a instalação completa e model=tts-1-hd em cada solicitação de fala.
No macOS ou Linux, use cp sample.env speech.env em vez de Copy-Item. O Docker precisa ter acesso a uma GPU compatível. O modelo é baixado no primeiro uso.
tts-1-hd em config/voice_to_speaker.yaml:Mantenha as vozes existentes já listadas em tts-1-hd. Altere me para o nome da voz que você quer que o SSN envie e use o código de idioma correto do XTTS quando necessário.
openaimodel=tts-1-hd é necessário para XTTS-v2. Se omitido, o Social Stream envia seu padrão tts-1, e o openedai-speech seleciona o Piper. O voiceopenai deve corresponder ao nome da voz clonada em voice_to_speaker.yaml.
Se o navegador ou o OBS bloquear a solicitação direta, execute a Ponte local de TTS no computador do OBS e mantenha os mesmos parâmetros de modelo e voz ao alterar openaiendpoint como http://127.0.0.1:8124/v1/audio/speech.
A ponte é um pequeno auxiliar local. Ela aceita a solicitação do navegador enviada pelo SSN, se comunica com seu servidor de TTS e devolve o áudio ao SSN com cabeçalhos compatíveis com o navegador.
http://127.0.0.1:8124/v1/audio/speech, mesmo que o servidor de TTS esteja em outro computador.
A pasta inicial independente é local-tts-bridge/; consulte o README da ponte para todas as opções de inicialização.
Windows PowerShell, quando o servidor de TTS está neste mesmo computador:
Windows PowerShell, quando o servidor de TTS está em outro computador:
Terminal do macOS/Linux:
Depois, aponte a URL do OBS dock.html para a ponte:
O GPT-SoVITS usa seu próprio formato JSON para /tts , de modo que a ponte pode converter a solicitação compatível com OpenAI do SSN no corpo de solicitação do GPT-SoVITS.
Alguns wrappers de servidor F5-TTS disponibilizam /synthesize_speech/?text=...&voice=... em vez de um endpoint compatível com OpenAI. A ponte pode converter a solicitação do SSN nesse formato de consulta.
http://127.0.0.1:8124/v1/audio/speech. Altere a porta com SSN_TTS_BRIDGE_PORT=8125 se necessário.
Todos os servidores próprios acima usam o mesmo método de conexão — o recurso integrado do Social Stream Endpoint de TTS OpenAI com uma URL local personalizada.
| Parâmetro | Valor | Descrição |
|---|---|---|
ttsprovider |
customtts ou openai |
Use o caminho de TTS compatível com OpenAI. Use customtts para endpoints locais/próprios. |
openaiendpoint |
http://localhost:8880/v1/audio/speech |
URL do seu servidor local (altere a porta conforme necessário) |
speech |
en-US |
Ativa TTS para inglês |
voiceopenai |
af_bella |
Nome da voz (depende do servidor) |
openaiformat |
mp3 |
Formato de áudio: mp3, wav, opus, flac |
openaispeed |
1.0 |
Velocidade da fala (0.5–2.0) |
customttsendpoint e localttsendpoint também funcionam. customttsvoice, localttsvoice, customttsmodel, localttsmodel, customttsformat, e localttsformat são aliases aceitos para os campos no estilo OpenAI.
openaiendpoint deve ser acessível a partir da página que reproduz o TTS, e voiceopenai deve ser uma voz compatível com seu servidor. O Kokoro-FastAPI usa nomes como af_bella; o openedai-speech costuma usar nomes como nova ou echo.
Estes funcionam com qualquer provedor de TTS, incluindo servidores locais:
| Parâmetro | Exemplo | Descrição |
|---|---|---|
simpletts |
&simpletts |
Pular "diz" — lê apenas a mensagem |
simpletts2 |
&simpletts2 |
Pular os nomes de usuário completamente |
volume |
&volume=0.8 |
Nível de volume (0.0–1.0) |
skipmessages |
&skipmessages=3 |
Ler apenas uma a cada 3 mensagens |
ttscommand |
&ttscommand=!say |
Ler apenas mensagens que começam com !say |
readevents |
&readevents |
Ler também inscrições, doações etc. |
ttsquick |
&ttsquick=100 |
Corta intencionalmente a fala após essa quantidade de caracteres. Remova se as mensagens estiverem sendo cortadas. |
O SSN já oferece suporte a speechSynthesis, Kokoro integrado, Piper, Kitten e eSpeak. As adições futuras mais úteis no navegador seriam um seletor de dispositivo de saída de áudio onde setSinkId estiver disponível, mais opções de vozes Piper e um caminho dedicado de reprodução progressiva em streaming para servidores que possam transmitir trechos de áudio.
A forma de capturar áudio de TTS no OBS depende de como você está executando o Social Stream Ninja.
Este é o método mais simples e funciona para todos os provedores de TTS (integrado e servidor próprio).
dock.html URL com parâmetros de TTSSe você estiver usando o aplicativo independente para desktop do Social Stream Ninja (e não uma fonte de navegador do OBS):
Audio Router pode direcionar um aplicativo a um cabo virtual, mas é um software antigo. Prefira o roteamento por aplicativo do Windows quando funcionar.
Voicemeeter é melhor quando você precisa ouvir o TTS localmente, encaminhá-lo ao OBS e mantê-lo separado do áudio de músicas/jogos.
?speech=en-US sem um provedor) depende das vozes disponibilizadas pelo navegador. O OBS pode não disponibilizar vozes ou pode listar vozes sem produzir áudio capturável. Teste a fala e a gravação do OBS separadamente. Use um dos provedores acima (kokoro, piper, etc.).
| Opção | Configuração | Qualidade | Privado | OBS (fonte de navegador) | GPU necessária | Custo |
|---|---|---|---|---|---|---|
| Kokoro integrado | Nenhum | ⭐⭐⭐⭐⭐ | Sim | Sim | Não (mais rápido com) | Gratuito |
| Piper integrado | Nenhum | ⭐⭐⭐⭐ | Sim | Sim | Não | Gratuito |
| Kitten integrado | Nenhum | ⭐⭐⭐ | Sim | Sim | Não | Gratuito |
| eSpeak integrado | Nenhum | ⭐⭐ | Sim | Sim | Não | Gratuito |
| Kokoro-FastAPI | Docker | ⭐⭐⭐⭐⭐ | Sim | Sim | Não (opcional) | Gratuito |
| openedai-speech | Docker | ⭐⭐⭐⭐ | Sim | Sim | Não | Gratuito |
| ElevenLabs | Chave de API | ⭐⭐⭐⭐⭐ | Não | Sim | Não | Planos pagos |
| Síntese de voz do sistema | Nenhum | ⭐⭐ | Sim | Não* | Não | Gratuito |
* O TTS do sistema exige roteamento por cabo de áudio virtual para captura no OBS.
O teste no aplicativo só prova que ele consegue acessar o servidor. A fonte de navegador do OBS ainda precisa acessar o endpoint e reproduzir o áudio.
127.0.0.1 pelo IP de rede local do computador do servidor de TTS.ttsquick. Essa opção corta intencionalmente o texto falado.&ttsquick=14 ou outro número pequeno, remova-o e atualize a fonte de navegador do OBS.typewriter=, remova temporariamente durante o teste. O TTS normalmente usa a mensagem original, mas remover efeitos visuais é uma maneira rápida de descartar problemas de temporização.http://127.0.0.1:8880/web/ para Kokoro-FastAPI, ou a porta correspondente do seu servidor.http://SERVER_LAN_IP:8880/web/. Se isso não carregar, o OBS também não conseguirá usar esse servidor.Se o navegador informar que a solicitação foi bloqueada por CORS, acesso à rede local, acesso à rede privada ou falha de fetch, o servidor de TTS talvez nunca receba a solicitação.
npm run local-tts-bridge no computador do OBS e aponte o SSN para http://127.0.0.1:8124/v1/audio/speech.af_bella, af_sarah, am_adam, ou outra voz da interface web do Kokoro.nova, echo, e alloy podem ser válidas.?speech=en-US sem &ttsprovider=). O TTS do sistema pode precisar de captura do áudio do desktop ou de cabo virtual.As tags de imagens Docker podem mudar. Se um comando deste guia parar de funcionar, consulte a página do projeto para ver a tag atual: