Leggi ad alta voce la chat dal vivo con voci IA locali. Inizia dall'opzione senza installazione, poi usa un server locale solo se necessario.
Social Stream Ninja può leggere ad alta voce i messaggi chat usando la sintesi vocale IA locale. “Locale” può significare due cose: la voce funziona nel browser oppure esegui un piccolo server TTS sul tuo computer.
Ci sono due approcci:
Diverse voci IA di alta qualità sono integrate direttamente in Social Stream Ninja. Funzionano nel browser usando WebAssembly o ONNX: nessun server, Docker o installazione.
Basta aggiungere un parametro URL per iniziare.
Esegui un server TTS locale sul tuo computer e indirizza Social Stream Ninja verso di esso. Offre più opzioni vocali, clonazione vocale e controllo lato server.
Usa il supporto integrato di Social Stream per Endpoint compatibile con OpenAI .
È il percorso più breve per la maggior parte degli streamer:
&speech=en-US&ttsprovider=kokoro oppure &speech=en-US&ttsprovider=kitten al tuo dock.html URL.Testing local TTS. Attendi il primo download dei modelli se usi Kokoro o Piper.È l'errore più comune con il TTS locale.
localhost e 127.0.0.1 significano sempre “questo stesso computer”. Se OBS è su un computer e Kokoro su un altro, 127.0.0.1 nell'URL OBS punta al computer OBS, non al computer Kokoro.
127.0.0.1 solo quando il server TTS è sullo stesso computer della pagina che riproduce l'audio. Se il server è su un altro computer, usa l'indirizzo IP LAN di quel computer.| La tua configurazione | Endpoint da usare |
|---|---|
| OBS e Kokoro vengono eseguiti sullo stesso computer | http://127.0.0.1:8880/v1/audio/speech |
| Kokoro viene eseguito su un altro computer della rete domestica | http://192.168.x.x:8880/v1/audio/speech, usando l'IP LAN del computer Kokoro |
| Il pulsante di test dell'app desktop SSN funziona, ma OBS è silenzioso | OBS richiede comunque un proprio endpoint funzionante. Il test nell'app non dimostra che OBS possa raggiungere il server. |
Su Linux, macOS e Windows, assicurati anche che il firewall consenta la porta e che Docker abbia pubblicato la porta con -p 8880:8880.
Nel popup dell'estensione, apri il selettore del provider TTS e scegli Endpoint TTS personalizzato / locale. Mostra i campi dell'endpoint locale compatibile con OpenAI e il link a questa guida.
SSN tratta un server TTS locale/ospitato autonomamente come un endpoint vocale compatibile con OpenAI. Il flusso principale è:
Per ttsprovider=customtts, localtts, oppure openai, SSN invia un POST JSON all'endpoint configurato:
CORS è un controllo dei permessi del browser. In parole semplici, il server TTS deve dire al browser: “sì, questa pagina può chiedermi dell'audio”. Se manca quel permesso, la richiesta può essere bloccata prima ancora che Kokoro o un altro server TTS la vedano.
dock.html in Chrome o OBS, CORS può essere rilevante.https://beta.socialstream.ninja/dock.html, Chrome potrebbe anche bloccare le chiamate a indirizzi HTTP locali o privati.Se il server non consente le richieste del browser, esegui il bridge TTS locale SSN e indirizza SSN a http://127.0.0.1:8124/v1/audio/speech. Per OBS, la configurazione più semplice è eseguire il bridge sullo stesso computer di OBS.
| Risposta | Supporto SSN | Note |
|---|---|---|
| Audio binario | Sì | Opzione migliore. Restituisci audio/mpeg, audio/wav, audio/ogg, audio/aac, oppure un altro tipo di audio riproducibile dal browser. |
| JSON con URL audio | Sì | SSN controlla url, audio_url, output_url, campi annidati come data.url, e il primo elemento di data[] . |
| JSON con audio base64 | Sì | SSN controlla audio, audio_data, audioContent, b64_json, campi annidati come data e URL dati. |
| PCM grezzo | Solo se incapsulato | Restituisci il PCM come file WAV o WAV base64. Un elemento audio del browser non può riprodurre direttamente byte PCM grezzi in modo affidabile. |
mp3 per file piccoli e ampio supporto dei browser, wav per i server di clonazione locali e i test del bridge, e opus solo quando sia il server sia il browser lo supportano.
SSN attualmente non esegue la riproduzione progressiva per gli endpoint TTS personalizzati/locali. Attende il blob della risposta o il payload audio JSON, poi lo riproduce. Alcuni server a monte espongono endpoint streaming, ma il percorso attuale compatibile con OpenAI di SSN carica l'audio prima della riproduzione.
Risultato pratico: mantieni brevi i frammenti TTS della chat. Il supporto streaming richiederebbe un percorso di riproduzione separato con blocchi WAV/MP3 in streaming, MediaSource, WebCodecs o un mixer lato server.
Questi motori sono inclusi in Social Stream Ninja e non richiedono installazione. Funzionano nel browser usando WebAssembly (WASM) o ONNX Runtime.
| Provider | Qualità | Uso della CPU | GPU/WebGPU | Parametro URL |
|---|---|---|---|---|
| Kokoro TTS | ⭐⭐⭐⭐⭐ Eccellente | Medio | Più veloce con GPU | ?ttsprovider=kokoro |
| Piper TTS | ⭐⭐⭐⭐ Molto buono | Basso | Solo CPU | ?ttsprovider=piper |
| Kitten TTS | ⭐⭐⭐ Buono | Molto basso | Solo CPU | ?ttsprovider=kitten |
| eSpeak-NG | ⭐⭐ Robotico | Minimo | Solo CPU | ?ttsprovider=espeak |
Aggiungi &ttsprovider= e &speech= al tuo Social Stream dock.html URL:
SSN elenca attualmente 28 voci Kokoro in inglese, tre in spagnolo e tre in portoghese brasiliano. Specificane una con &voicekokoro=:
Esempio in spagnolo:
Esempio in portoghese:
Specifica un modello vocale con &pipervoice=:
Sono disponibili voci Piper in portoghese e spagnolo:
L'estensione Chrome, la sorgente browser OBS e l'app desktop autonoma Social Stream Ninja usano tutti gli stessi dock.html parametri URL per la sintesi vocale. La differenza importante è dove viene prodotto il suono.
| Interfaccia | Comportamento del TTS locale | Acquisizione audio |
|---|---|---|
| Estensione Chrome / sorgente browser OBS | Il fetch nel browser richiede CORS dal server locale, a meno che tu usi il bridge SSN. | Usa la sorgente browser OBS con “Controlla l'audio tramite OBS”. |
| App desktop autonoma | Usa le stesse impostazioni del provider. Le finestre con file locali dell'app hanno meno vincoli CORS, ma il bridge resta il percorso più sicuro per i server che rifiutano richieste in stile browser. | Acquisisci l'audio desktop/app oppure instrada l'app verso un cavo audio virtuale. |
| Kokoro integrato nell'app desktop | L'app può usare il proprio percorso locale ninjafy.tts per Kokoro invece di affidarsi solo al caricamento del modello nel browser. |
L'audio viene riprodotto dall'app, quindi usa l'acquisizione audio desktop/app. |
dock.html in OBS, è OBS che deve raggiungere il server TTS e riprodurre l'audio.
Se vuoi più opzioni vocali, clonazione vocale o un server dedicato da riutilizzare con più strumenti, puoi eseguire un server TTS locale. Social Stream Ninja vi si connette usando la funzione integrata Endpoint TTS compatibile con OpenAI senza bisogno di chiave API per i server locali.
Tre opzioni consigliate:
| Server | Modello | GPU | Disco | Porta predefinita |
|---|---|---|---|---|
| Kokoro-FastAPI Consigliato | Kokoro 82M | Facoltativo | ~2 GB | 8880 |
| openedai-speech (Piper) Leggero | Piper TTS | Solo CPU | <1 GB | 8000 |
| kokoro-web | Kokoro 82M | Facoltativo | ~2 GB | 3000 |
| Pacchetto | Vantaggio principale | Compromesso |
|---|---|---|
| Kokoro integrato | Migliore prima scelta: nessun server, ottima qualità, privato, funziona nel browser e nell'app desktop. | Nessuna clonazione vocale. |
| Kokoro-FastAPI | Server compatibile con OpenAI, configurazione Docker semplice, CPU o GPU, molte voci Kokoro. | Nessuna vera clonazione vocale; la fusione delle voci e le funzionalità vocali personalizzate dipendono dalla build del server. |
| openedai-speech | Endpoint leggero compatibile con OpenAI; Piper è adatto alla CPU e XTTS aggiunge la clonazione puntando a circa 4 GB di VRAM. | Il repository dichiara di essere perlopiù obsoleto, quindi consideralo utile ma senza garanzie per il futuro. |
| Server Chatterbox | Clonazione vocale, opzioni dell'interfaccia web, API compatibili con OpenAI e strumenti per testi lunghi. | Il supporto CUDA/GPU è più fluido di quello CPU per alcune build; la configurazione varia in base al fork del server. |
| GPT-SoVITS | Buona clonazione/controllo con brevi riferimenti e supporto delle trascrizioni. | Non compatibile con OpenAI per impostazione predefinita; usa la modalità bridge SSN. |
| F5-TTS | Clonazione zero-shot naturale con WAV di riferimento + trascrizione. | Il progetto ufficiale non è un semplice endpoint OpenAI; usa un wrapper o la modalità bridge. |
| Qwen3-TTS | Funzioni moderne di clonazione e progettazione vocale, inclusi modelli più piccoli da 0.6B/1.7B. | Pensato prima come libreria/demo; richiede un wrapper per SSN. |
| MisoTTS | Generazione vocale avanzata tramite prompt. | Non adatto localmente a 6 GB di VRAM; se necessario, usa hosting remoto/personalizzato. |
La clonazione vocale non è una modalità SSN separata. È una funzionalità di alcuni server TTS locali. SSN invia il testo della chat a un endpoint locale; il server sceglie la voce clonata da un file audio di riferimento salvato, un profilo vocale o la configurazione del bridge.
ttsprovider=customtts.Con 6 GB di VRAM o meno, punta prima su piccoli modelli di clonazione zero-shot e server compatibili con OpenAI. I modelli più grandi possono comunque funzionare tramite lo stesso endpoint SSN se l'utente li ospita altrove.
| Opzione | Clonazione vocale | Compatibile con 6 GB di VRAM | Percorso API per SSN |
|---|---|---|---|
| Qwen3-TTS 0.6B Base | Audio di riferimento di 3 secondi | Probabile | Usa un wrapper compatibile con OpenAI, poi ttsprovider=customtts |
| XTTS-v2 / openedai-speech | Voci da brevi riferimenti WAV | Sì, circa 4 GB secondo openedai-speech | /v1/audio/speech |
| Chatterbox Turbo / Server | Clonazione da audio di riferimento | Probabile con Turbo / piccoli blocchi | Build server compatibili con OpenAI, oppure il bridge |
| GPT-SoVITS | Zero-shot con 5 secondi, few-shot con 1 minuto | Probabile con fp16 / installazione leggera | Usa scripts/local-tts-bridge.cjs --mode gptsovits |
| F5-TTS | WAV di riferimento + trascrizione | Forse; dipende dalla build e dal vocoder | Usa un wrapper compatibile con OpenAI, oppure --mode f5 per i wrapper server F5-TTS |
| MisoTTS 8B | Contesto audio fornito come prompt | No; il progetto consiglia 24 GB di VRAM | Solo endpoint remoto/personalizzato |
POST /v1/audio/speech con { model, input, voice, response_format, speed } e restituire un file audio riproducibile. Questo copre OpenAI, Coqui/XTTS, wrapper Kokoro, wrapper Qwen e la maggior parte dei servizi proxy.
Sono punti di partenza pratici, non garanzie assolute. Versione del modello, quantizzazione, lunghezza del testo, immagine Docker e app in background possono cambiare l'uso della memoria.
| Opzione | Computer minimo pratico | Buona destinazione | Note |
|---|---|---|---|
| Sintesi vocale di sistema / eSpeak | Qualsiasi PC moderno | Qualsiasi PC | Veloce, qualità bassa, senza clonazione. |
| Kitten integrato | CPU di fascia bassa, 4 GB di RAM | CPU moderna per portatili, 8 GB di RAM | Piccolo modello ONNX, avvio rapido. |
| Piper integrato | CPU moderna, 4-8 GB di RAM | CPU moderna, 8 GB di RAM | Buona opzione di voce neurale con poche risorse. |
| Kokoro integrato | CPU moderna, 8 GB di RAM | GPU compatibile con WebGPU o CPU veloce, 8-16 GB di RAM | Migliore qualità senza configurazione. Il primo caricamento scarica le risorse del modello. |
| Kokoro-FastAPI | Host Docker su CPU, 8 GB di RAM | GPU NVIDIA facoltativa, 8-16 GB di RAM | Buon server locale quando il caricamento del modello nel browser non è ideale. |
| openedai-speech Piper | CPU, 4-8 GB di RAM | CPU, 8 GB di RAM | Server leggero compatibile con OpenAI. |
| openedai-speech XTTS | GPU NVIDIA con circa 4 GB di VRAM, 8-16 GB di RAM | GPU NVIDIA da almeno 6 GB, 16 GB di RAM | Percorso di clonazione vocale; la CPU è possibile ma lenta. |
| Server Chatterbox | La CPU può funzionare per alcune build ma è lenta | GPU NVIDIA da almeno 6 GB, 16 GB di RAM | Usa una GPU per la clonazione o l'elaborazione di testi lunghi. |
| GPT-SoVITS / F5-TTS / Qwen3-TTS | Solo test su CPU, lento | GPU NVIDIA da almeno 6 GB per modelli piccoli/ottimizzati, 16 GB di RAM | La scelta del wrapper e la dimensione del modello contano. Prevedi più configurazione. |
| MisoTTS 8B | Non consigliato localmente con 6 GB di VRAM | 24 GB di VRAM o host remoto | Il repository consiglia GPU con molta VRAM per l'uso interattivo. |
Queste sono le soluzioni di clonazione vocale ospitate autonomamente controllate per la compatibilità SSN. Il percorso dell'endpoint locale è stato testato con entrambi dock.html e featured.html.
SSN accetta risposte audio binarie dirette, risposte JSON con audio base64 e risposte JSON con URL audio. L'attuale riproduzione personalizzata/locale carica in memoria l'audio restituito prima di riprodurlo; la riproduzione progressiva in streaming non è ancora supportata.
| Server | Percorso SSN | Note |
|---|---|---|
| openedai-speech | Diretto o tramite bridge | Compatibile con OpenAI /v1/audio/speech. La modalità Piper è stata testata con sintesi reale su CPU da dock.html e featured.html, direttamente e tramite il bridge. Se esegui dai sorgenti su Windows, assicurati che la cartella Scripts dell'ambiente virtuale sia in PATH affinché piper.exe e ffmpeg.exe possano essere trovati. |
| chatterbox-tts-api | Diretto o tramite bridge | Compatibile con OpenAI /v1/audio/speech. Usa l'audio di riferimento configurato per la clonazione. La struttura API è stata testata direttamente e tramite il bridge. |
| Chatterbox-TTS-Server | Diretto o tramite bridge | Endpoint compatibile con OpenAI e interfaccia web. Testato con sintesi reale su CPU usando Emily.wav da dock.html e featured.html, direttamente e tramite il bridge. |
| GPT-SoVITS | Modalità bridge | Esegui il bridge SSN con --mode gptsovits; il server di destinazione è /tts, non compatibile con OpenAI. |
| F5-TTS_server | Modalità bridge | Esegui il bridge SSN con --mode f5; il server di destinazione usa GET /synthesize_speech/. |
| F5-TTS ufficiale | Richiede wrapper | Pensato prima per CLI, Gradio e server socket. Usa un wrapper compatibile con OpenAI oppure la modalità bridge F5 con un wrapper. |
| Qwen3-TTS | Richiede wrapper | Pensato prima come libreria e demo Gradio. Buon candidato per un piccolo wrapper compatibile con OpenAI intorno a generate_voice_clone. |
| MisoTTS | Solo remoto/personalizzato | La clonazione vocale è supportata, ma il modello 8B non è adatto a 6 GB di VRAM e il repository non ha un endpoint REST locale. |
Kokoro-FastAPI esegue il modello Kokoro 82M come server locale con API compatibile con OpenAI. Funziona sulla CPU (nessuna GPU richiesta) e offre un'eccellente qualità vocale.
Apri un terminale (Prompt dei comandi, PowerShell o Terminale) ed esegui uno dei seguenti comandi:
Apri il browser e vai a http://localhost:8880/web/— dovresti vedere un'interfaccia web in cui provare le voci.
Oltre 67 voci disponibili. Alcune in evidenza:
Esplora e prova tutte le voci su http://localhost:8880/web/ una volta avviato il server.
Se Kokoro-FastAPI è sullo stesso computer di OBS:
Se Kokoro-FastAPI è su un altro computer, sostituisci 192.168.x.x con l'indirizzo IP LAN di quel computer:
af_bella, af_sarah, am_adam, oppure bf_emma. Nomi come echo, nova, e alloy sono nomi in stile OpenAI/openedai-speech e potrebbero non funzionare con Kokoro.
Per mantenere Kokoro-FastAPI in esecuzione automatica in background, usa il parametro di riavvio di Docker:
Ora partirà automaticamente con Docker Desktop a ogni riavvio.
openedai-speech espone l'endpoint compatibile con OpenAI /v1/audio/speech richiesto da Social Stream. L'immagine piccola esegue Piper sulla CPU; l'immagine completa può eseguire la clonazione vocale XTTS-v2 su una GPU supportata.
Usa questa opzione per un server TTS solo CPU sotto 1 GB. Non include XTTS-v2 o clonazione vocale.
docker-compose.min.yml. In alternativa, esegui direttamente i comandi sotto.
Se esegui openedai-speech da un checkout locale anziché da Docker, aggiungi la cartella degli script del suo ambiente virtuale a PATH prima di avviare il server. In sua assenza, le richieste possono restituire HTTP 500 perché il server non trova piper.exe oppure ffmpeg.exe.
openedai-speech usa nomi vocali in stile OpenAI associati alle voci Piper:
XTTS-v2 è un modello, non un'API web. Usa il server openedai-speech completo per caricare il modello, selezionare una voce di riferimento salvata, accettare il testo chat da SSN e restituire audio riproducibile. Il server indica un obiettivo pratico di circa 4 GB di VRAM GPU; l'inferenza su CPU è possibile ma lenta.
openedai-speech-min per XTTS-v2. L'immagine minima include solo Piper. XTTS-v2 richiede l'installazione completa e model=tts-1-hd in ogni richiesta vocale.
Su macOS o Linux, usa cp sample.env speech.env invece di Copy-Item. Docker deve avere accesso a una GPU supportata. Il modello viene scaricato al primo utilizzo.
tts-1-hd in config/voice_to_speaker.yaml:Mantieni le eventuali voci già elencate sotto tts-1-hd. Modifica me nel nome voce che vuoi far inviare a SSN, e usa il codice lingua XTTS corretto quando necessario.
openaimodel=tts-1-hd è richiesto per XTTS-v2. Se viene omesso, Social Stream invia il suo valore predefinito tts-1, e openedai-speech seleziona invece Piper. Il valore di voiceopenai deve corrispondere al nome della voce clonata in voice_to_speaker.yaml.
Se il browser o OBS blocca la richiesta diretta, esegui il Bridge TTS locale sul computer OBS e mantieni gli stessi parametri di modello e voce mentre cambi openaiendpoint a http://127.0.0.1:8124/v1/audio/speech.
Il bridge è un piccolo strumento locale di supporto. Accetta la richiesta del browser da SSN, comunica con il server TTS e restituisce l'audio a SSN con intestazioni adatte al browser.
http://127.0.0.1:8124/v1/audio/speech, anche se il vero server TTS è su un altro computer.
La cartella iniziale autonoma è local-tts-bridge/; vedi il README del bridge per tutte le opzioni di avvio.
Windows PowerShell, quando il server TTS è su questo stesso computer:
Windows PowerShell, quando il server TTS è su un altro computer:
Terminale macOS/Linux:
Poi indirizza l'URL OBS dock.html verso il bridge:
GPT-SoVITS usa la propria struttura JSON per /tts , quindi il bridge può tradurre la richiesta compatibile con OpenAI di SSN nel corpo di richiesta GPT-SoVITS.
Alcuni wrapper server F5-TTS espongono /synthesize_speech/?text=...&voice=... invece di un endpoint compatibile con OpenAI. Il bridge può tradurre la richiesta SSN in quel formato di query.
http://127.0.0.1:8124/v1/audio/speech. Cambia la porta con SSN_TTS_BRIDGE_PORT=8125 se necessario.
Tutti i server ospitati autonomamente sopra usano lo stesso metodo di connessione: la funzione integrata di Social Stream Endpoint TTS OpenAI con un URL locale personalizzato.
| Parametro | Valore | Descrizione |
|---|---|---|
ttsprovider |
customtts oppure openai |
Usa il percorso TTS compatibile con OpenAI. Usa customtts per endpoint locali/ospitati autonomamente. |
openaiendpoint |
http://localhost:8880/v1/audio/speech |
URL del tuo server locale (cambia la porta se necessario) |
speech |
en-US |
Abilita la sintesi vocale in inglese |
voiceopenai |
af_bella |
Nome della voce (dipende dal server) |
openaiformat |
mp3 |
Formato audio: mp3, wav, opus, flac |
openaispeed |
1.0 |
Velocità di lettura (0.5–2.0) |
customttsendpoint e localttsendpoint funzionano anche. customttsvoice, localttsvoice, customttsmodel, localttsmodel, customttsformat, e localttsformat sono alias accettati dei campi in stile OpenAI.
openaiendpoint deve essere raggiungibile dalla pagina che riproduce il TTS, e voiceopenai deve essere una voce supportata dal server. Kokoro-FastAPI usa nomi come af_bella; openedai-speech usa spesso nomi come nova oppure echo.
Funzionano con qualsiasi provider TTS, inclusi i server locali:
| Parametro | Esempio | Descrizione |
|---|---|---|
simpletts |
&simpletts |
Salta “dice” — legge solo il messaggio |
simpletts2 |
&simpletts2 |
Salta completamente i nomi utente |
volume |
&volume=0.8 |
Livello del volume (0.0–1.0) |
skipmessages |
&skipmessages=3 |
Leggi solo un messaggio ogni 3 |
ttscommand |
&ttscommand=!say |
Leggi solo i messaggi che iniziano con !say |
readevents |
&readevents |
Leggi anche abbonamenti, donazioni, ecc. |
ttsquick |
&ttsquick=100 |
Interrompe intenzionalmente la lettura dopo questo numero di caratteri. Rimuovilo se i messaggi vengono troncati. |
SSN supporta già la funzionalità del sistema operativo/browser speechSynthesis, Kokoro integrato, Piper, Kitten ed eSpeak. Le aggiunte future più utili lato browser sarebbero un selettore del dispositivo di uscita audio dove setSinkId è disponibile, più scelte di voci Piper e un percorso dedicato di riproduzione progressiva in streaming per i server che possono trasmettere blocchi audio.
Il modo di acquisire l'audio TTS in OBS dipende da come esegui Social Stream Ninja.
È il metodo più semplice e funziona per tutti i provider TTS (integrato e server ospitato autonomamente).
dock.html URL con parametri TTSSe usi l'app desktop autonoma Social Stream Ninja (non una sorgente browser OBS):
Audio Router può instradare un'app verso un cavo virtuale, ma è un software datato. Preferisci l'instradamento per app di Windows quando funziona.
Voicemeeter è la scelta migliore quando devi sentire il TTS localmente, instradarlo verso OBS e mantenerlo separato dall'audio di musica/giochi.
?speech=en-US senza un provider) dipende dalle voci esposte dal browser. OBS potrebbe non esporre voci, oppure elencarle senza produrre audio acquisibile. Prova separatamente la voce e la registrazione OBS. Usa uno dei provider sopra (kokoro, piper, ecc.).
| Opzione | Configurazione | Qualità | Privato | OBS (sorgente browser) | GPU richiesta | Costo |
|---|---|---|---|---|---|---|
| Kokoro integrato | Nessuno | ⭐⭐⭐⭐⭐ | Sì | Sì | No (più veloce con) | Gratuito |
| Piper integrato | Nessuno | ⭐⭐⭐⭐ | Sì | Sì | No | Gratuito |
| Kitten integrato | Nessuno | ⭐⭐⭐ | Sì | Sì | No | Gratuito |
| eSpeak integrato | Nessuno | ⭐⭐ | Sì | Sì | No | Gratuito |
| Kokoro-FastAPI | Docker | ⭐⭐⭐⭐⭐ | Sì | Sì | No (facoltativa) | Gratuito |
| openedai-speech | Docker | ⭐⭐⭐⭐ | Sì | Sì | No | Gratuito |
| ElevenLabs | Chiave API | ⭐⭐⭐⭐⭐ | No | Sì | No | Piani a pagamento |
| TTS di sistema | Nessuno | ⭐⭐ | Sì | No* | No | Gratuito |
* La sintesi vocale di sistema richiede l'instradamento tramite cavo audio virtuale per l'acquisizione in OBS.
Il test nell'app dimostra solo che l'app può raggiungere il server. La sorgente browser OBS deve comunque raggiungere l'endpoint e riprodurre l'audio.
127.0.0.1 con l'IP LAN del computer del server TTS.ttsquick. Quell'opzione accorcia intenzionalmente il testo pronunciato.&ttsquick=14 oppure un altro numero piccolo, rimuovilo e aggiorna la sorgente browser OBS.typewriter=, rimuovilo temporaneamente durante i test. La sintesi vocale usa normalmente il messaggio originale, ma rimuovere gli effetti visivi è un modo rapido per escludere problemi di temporizzazione.http://127.0.0.1:8880/web/ per Kokoro-FastAPI, oppure la porta corrispondente del tuo server.http://SERVER_LAN_IP:8880/web/. Se non si carica, neppure OBS potrà usare quel server.Se il browser dice che la richiesta è stata bloccata da CORS, accesso alla rete locale, accesso alla rete privata o failed fetch, il server TTS potrebbe non ricevere mai la richiesta.
npm run local-tts-bridge sul computer OBS e indirizza SSN a http://127.0.0.1:8124/v1/audio/speech.af_bella, af_sarah, am_adam, oppure un'altra voce dall'interfaccia web di Kokoro.nova, echo, e alloy possono essere valide.?speech=en-US senza &ttsprovider=). La sintesi vocale di sistema potrebbe richiedere l'acquisizione dell'audio desktop o di un cavo virtuale.I tag delle immagini Docker possono cambiare. Se un comando di questa guida smette di funzionare, controlla il tag attuale nella pagina del progetto: