Nechte místní hlasy AI číst živý chat nahlas. Začněte možností bez instalace a místní server použijte pouze tehdy, pokud jej potřebujete.
Social Stream Ninja může číst zprávy chatu nahlas pomocí místního převodu textu na řeč s AI. „Místní“ může znamenat dvě věci: hlas běží uvnitř prohlížeče nebo provozujete malý server TTS na vlastním počítači.
Existují dva postupy:
Několik kvalitních hlasů AI je vestavěných přímo v Social Stream Ninja. Běží v prohlížeči pomocí WebAssembly nebo ONNX — bez serveru, Dockeru a instalace.
Stačí přidat parametr URL a začít.
Spusťte místní server TTS na svém počítači a nasměrujte na něj Social Stream Ninja. Získáte více hlasů, klonování hlasu a ovládání na straně serveru.
Používá podporu vestavěnou v Social Stream: Koncový bod kompatibilní s OpenAI .
Pro většinu streamerů je toto nejkratší cesta:
&speech=en-US&ttsprovider=kokoro nebo &speech=en-US&ttsprovider=kitten do svého dock.html URL.Testing local TTS. Při použití Kokoro nebo Piper počkejte na první stažení modelů.Toto je nejběžnější chyba místního TTS.
localhost a 127.0.0.1 vždy znamenají „tento stejný počítač“. Pokud je OBS na jednom počítači a Kokoro na jiném, 127.0.0.1 uvnitř URL OBS ukazuje na počítač OBS, nikoli na počítač Kokoro.
127.0.0.1 pouze tehdy, když server TTS běží na stejném počítači jako stránka přehrávající zvuk. Pokud server běží na jiném počítači, použijte jeho IP adresu v místní síti.| Vaše nastavení | Koncový bod k použití |
|---|---|
| OBS a Kokoro běží na stejném počítači | http://127.0.0.1:8880/v1/audio/speech |
| Kokoro běží na jiném počítači v domácí síti | http://192.168.x.x:8880/v1/audio/speech, s IP adresou počítače Kokoro v místní síti |
| Testovací tlačítko desktopové aplikace SSN funguje, ale OBS je tiché | OBS stále potřebuje vlastní funkční koncový bod. Test v aplikaci nedokazuje, že OBS dosáhne na server. |
Na Linuxu, macOS i Windows také ověřte, že firewall povoluje port a Docker jej zveřejnil pomocí -p 8880:8880.
Ve vyskakovacím okně rozšíření otevřete výběr poskytovatele TTS a vyberte Vlastní / místní koncový bod TTS. Tím se zobrazí pole místního koncového bodu kompatibilního s OpenAI a odkaz zpět na tohoto průvodce.
SSN se k místnímu/vlastnímu hostovanému serveru TTS chová jako ke koncovému bodu řeči kompatibilnímu s OpenAI. Základní postup je:
Pro ttsprovider=customtts, localtts, nebo openai, SSN odešle požadavek JSON POST na nakonfigurovaný koncový bod:
CORS je kontrola oprávnění prohlížeče. Jednoduše řečeno: server TTS musí prohlížeči říct „ano, tato stránka ode mě smí vyžadovat zvuk“. Pokud oprávnění chybí, požadavek může být zablokován dříve, než jej Kokoro nebo jiný server TTS vůbec uvidí.
dock.html v Chrome nebo OBS může CORS hrát roli.https://beta.socialstream.ninja/dock.html, Chrome může také blokovat volání na místní nebo soukromé adresy HTTP.Pokud server nepovoluje požadavky prohlížeče, spusťte Místní most TTS SSN a nasměrujte SSN na http://127.0.0.1:8124/v1/audio/speech. Pro OBS je nejsnazší spustit most na stejném počítači jako OBS.
| Odpověď | Podpora SSN | Poznámky |
|---|---|---|
| Binární zvuk | Ano | Nejlepší možnost. Vraťte audio/mpeg, audio/wav, audio/ogg, audio/aacnebo jiný typ zvuku přehratelný v prohlížeči. |
| JSON s URL zvuku | Ano | SSN kontroluje url, audio_url, output_url, vnořené data.urla první data[] položku. |
| JSON se zvukem v base64 | Ano | SSN kontroluje audio, audio_data, audioContent, b64_json, vnořené data pole a datové URL. |
| Nezpracované PCM | Pouze s obálkou | Vracejte PCM jako soubor WAV nebo WAV v base64. Zvukový prvek prohlížeče nedokáže spolehlivě přehrát nezpracované bajty PCM přímo. |
mp3 pro malé soubory a širokou podporu prohlížečů, wav pro místní klonovací servery a testování mostu a opus pouze pokud jej podporuje server i prohlížeč.
SSN v současnosti nepřehrává postupně z vlastních/místních koncových bodů TTS. Počká na blob odpovědi nebo zvuková data JSON a potom je přehraje. Některé zdrojové servery nabízejí streamovací koncové body, ale současná cesta SSN kompatibilní s OpenAI před přehráním načítá do vyrovnávací paměti.
Praktický závěr: úryvky TTS chatu udržujte krátké. Podpora streamování by potřebovala samostatnou cestu přehrávání využívající streamované úseky WAV/MP3, MediaSource, WebCodecs nebo serverový směšovač.
Tyto enginy jsou přibalené v Social Stream Ninja a nevyžadují instalaci. Běží v prohlížeči pomocí WebAssembly (WASM) nebo ONNX Runtime.
| Poskytovatel | Kvalita | Využití CPU | GPU/WebGPU | Parametr URL |
|---|---|---|---|---|
| Kokoro TTS | ⭐⭐⭐⭐⭐ Výborné | Střední | Rychlejší s GPU | ?ttsprovider=kokoro |
| Piper TTS | ⭐⭐⭐⭐ Velmi dobré | Nízké | Pouze CPU | ?ttsprovider=piper |
| Kitten TTS | ⭐⭐⭐ Dobré | Velmi nízké | Pouze CPU | ?ttsprovider=kitten |
| eSpeak-NG | ⭐⭐ Robotické | Minimální | Pouze CPU | ?ttsprovider=espeak |
Přidejte &ttsprovider= a &speech= do svého Social Stream dock.html URL:
SSN nyní nabízí 28 anglických, tři španělské a tři brazilské portugalské hlasy Kokoro. Hlas určíte parametrem &voicekokoro=:
Španělský příklad:
Portugalský příklad:
Určete hlasový model pomocí &pipervoice=:
K dispozici jsou portugalské a španělské hlasy Piper:
Rozšíření Chrome, zdroj Prohlížeč v OBS a samostatná desktopová aplikace Social Stream Ninja používají stejné dock.html parametry URL pro TTS. Důležitý rozdíl spočívá v tom, kde zvuk vzniká.
| Prostředí | Chování místního TTS | Zachytávání zvuku |
|---|---|---|
| Rozšíření Chrome / zdroj Prohlížeč v OBS | Načítání v prohlížeči vyžaduje CORS z místního serveru, pokud nepoužíváte most SSN. | Použijte zdroj Prohlížeč v OBS s volbou „Ovládat zvuk přes OBS“. |
| Samostatná desktopová aplikace | Používá stejná nastavení poskytovatele. Okna místních souborů aplikace mají menší omezení CORS, ale most je stále nejjistější cestou pro servery odmítající požadavky ve stylu prohlížeče. | Zachytávejte zvuk plochy/aplikace nebo aplikaci nasměrujte do virtuálního zvukového kabelu. |
| Vestavěné Kokoro v desktopové aplikaci | Aplikace může používat svou místní cestu ninjafy.tts pro Kokoro místo spoléhání pouze na načítání modelu v prohlížeči. |
Zvuk přehrává aplikace, proto použijte zachytávání zvuku plochy/aplikace. |
dock.html URL do OBS, právě OBS musí dosáhnout na server TTS a přehrát zvuk.
Pokud chcete více hlasů, klonování hlasu nebo vyhrazený server použitelný ve více nástrojích, můžete spustit místní server TTS. Social Stream Ninja se k němu připojuje pomocí vestavěné podpory: Koncový bod TTS kompatibilní s OpenAI — pro místní servery není potřeba klíč API.
Tři doporučené možnosti:
| Server | Model | GPU | Disk | Výchozí port |
|---|---|---|---|---|
| Kokoro-FastAPI Doporučeno | Kokoro 82M | Volitelné | ~2 GB | 8880 |
| openedai-speech (Piper) Nenáročné | Piper TTS | Pouze CPU | <1 GB | 8000 |
| kokoro-web | Kokoro 82M | Volitelné | ~2 GB | 3000 |
| Balíček | Hlavní výhoda | Kompromis |
|---|---|---|
| Vestavěné Kokoro | Nejlepší první volba: bez serveru, vysoká kvalita, soukromí, funguje v prohlížeči i desktopové aplikaci. | Bez klonování hlasu. |
| Kokoro-FastAPI | Server kompatibilní s OpenAI, snadné nastavení Dockeru, CPU nebo GPU, mnoho hlasů Kokoro. | Bez skutečného klonování hlasu; kombinování hlasů a vlastní hlasové funkce závisejí na sestavení serveru. |
| openedai-speech | Nenáročný koncový bod kompatibilní s OpenAI; Piper je vhodný pro CPU a XTTS přidává klonování s cílovými nároky přibližně 4 GB VRAM. | Repozitář uvádí, že je z velké části zastaralý, proto jej považujte za užitečný, ale bez záruky dlouhodobé použitelnosti. |
| Servery Chatterbox | Klonování hlasu, možnosti webového rozhraní, API kompatibilní s OpenAI, nástroje pro dlouhý text. | U některých sestavení je podpora CUDA/GPU plynulejší než CPU; nastavení se liší podle varianty serveru. |
| GPT-SoVITS | Silné klonování/ovládání s krátkými referencemi a podporou přepisu. | Ve výchozím stavu není kompatibilní s OpenAI; použijte režim mostu SSN. |
| F5-TTS | Přirozené klonování bez dotrénování pomocí referenčního WAV a přepisu. | Oficiální projekt není jednoduchý koncový bod OpenAI; použijte obálku nebo režim mostu. |
| Qwen3-TTS | Moderní funkce klonování a návrhu hlasu, včetně menších modelů 0.6B/1.7B. | Primárně knihovna/ukázka; pro SSN potřebuje obálku. |
| MisoTTS | Špičkové generování řeči podle zadání. | Není vhodné místně pro 6 GB VRAM; podle potřeby použijte vzdálený/vlastní hosting. |
Klonování hlasu není samostatný režim SSN. Je to funkce některých místních serverů TTS. SSN odesílá text chatu na místní koncový bod; server vybírá klonovaný hlas z uloženého referenčního zvukového souboru, hlasového profilu nebo konfigurace mostu.
ttsprovider=customtts.Pro 6 GB VRAM nebo méně nejprve volte malé modely klonování bez dotrénování a servery kompatibilní s OpenAI. Větší modely mohou fungovat přes stejný koncový bod SSN, pokud je uživatel hostuje jinde.
| Možnost | Klonování hlasu | Vejde se do 6 GB VRAM | Cesta API pro SSN |
|---|---|---|---|
| Qwen3-TTS 0.6B Base | 3sekundový referenční zvuk | Pravděpodobně | Použijte obálku kompatibilní s OpenAI a potom ttsprovider=customtts |
| XTTS-v2 / openedai-speech | Krátké referenční hlasy WAV | Ano, přibližně 4 GB podle openedai-speech | /v1/audio/speech |
| Chatterbox Turbo / Server | Klonování podle referenčního zvuku | Pravděpodobně při použití Turbo / malých úseků | Sestavení serverů kompatibilní s OpenAI nebo most |
| GPT-SoVITS | 5 sekund bez dotrénování, 1 minuta s několika ukázkami | Pravděpodobně s fp16 / nenáročnou instalací | Použijte scripts/local-tts-bridge.cjs --mode gptsovits |
| F5-TTS | Referenční WAV + přepis | Možná; závisí na sestavení a vokodéru | Použijte obálku kompatibilní s OpenAI nebo --mode f5 pro serverové obálky F5-TTS |
| MisoTTS 8B | Zvukový kontext zadání | Ne; projekt doporučuje 24 GB VRAM | Pouze vzdálený/vlastní koncový bod |
POST /v1/audio/speech s { model, input, voice, response_format, speed } a vrátit přehratelný zvukový soubor. To zahrnuje OpenAI, Coqui/XTTS, obálky Kokoro, obálky Qwen a většinu služeb proxy.
Jde o praktické výchozí body, nikoli pevné záruky. Verze modelu, kvantizace, délka textu, obraz Docker a aplikace na pozadí mohou měnit spotřebu paměti.
| Možnost | Minimální praktický počítač | Vhodný cíl | Poznámky |
|---|---|---|---|
| Systémové TTS / eSpeak | Libovolný moderní počítač | Libovolný počítač | Rychlé, nízká kvalita, bez klonování. |
| Vestavěný Kitten | Slabší CPU, 4 GB RAM | Moderní notebookový CPU, 8 GB RAM | Malý model ONNX, rychlé spuštění. |
| Vestavěný Piper | Moderní CPU, 4–8 GB RAM | Moderní CPU, 8 GB RAM | Dobrá možnost neuronového hlasu s nízkými nároky. |
| Vestavěné Kokoro | Moderní CPU, 8 GB RAM | GPU s podporou WebGPU nebo rychlé CPU, 8–16 GB RAM | Nejlepší kvalita bez nastavování. Při prvním načtení se stáhnou soubory modelu. |
| Kokoro-FastAPI | Hostitel Docker na CPU, 8 GB RAM | Volitelné GPU NVIDIA, 8–16 GB RAM | Dobrý místní server, pokud načítání modelu v prohlížeči není ideální. |
| openedai-speech Piper | CPU, 4–8 GB RAM | CPU, 8 GB RAM | Nenáročný server kompatibilní s OpenAI. |
| openedai-speech XTTS | GPU NVIDIA s přibližně 4 GB VRAM, 8–16 GB RAM | GPU NVIDIA s 6 GB+, 16 GB RAM | Cesta klonování hlasu; CPU je možné, ale pomalé. |
| Servery Chatterbox | CPU může u některých sestavení fungovat, ale je pomalé | GPU NVIDIA s 6 GB+, 16 GB RAM | Při klonování nebo zpracování dlouhého textu použijte GPU. |
| GPT-SoVITS / F5-TTS / Qwen3-TTS | Pouze testování na CPU, pomalé | GPU NVIDIA s 6 GB+ pro menší/optimalizované modely, 16 GB RAM | Záleží na výběru obálky a velikosti modelu. Počítejte s náročnějším nastavením. |
| MisoTTS 8B | Místně se 6 GB VRAM se nedoporučuje | 24 GB VRAM nebo vzdálený hostitel | Repozitář doporučuje pro interaktivní použití GPU s velkou VRAM. |
Toto jsou cíle vlastního hostování s klonováním hlasu zkontrolované na kompatibilitu s SSN. Cesta místního koncového bodu byla otestována proti oběma dock.html a featured.html.
SSN přijímá přímé binární zvukové odpovědi, odpovědi JSON se zvukem v base64 a odpovědi JSON s URL zvuku. Současné vlastní/místní přehrávání před přehráním načte vrácený zvuk do vyrovnávací paměti; průběžné streamované přehrávání zatím není podporováno.
| Server | Cesta SSN | Poznámky |
|---|---|---|
| openedai-speech | Přímo nebo přes most | Kompatibilní s OpenAI /v1/audio/speech. Režim Piper byl otestován se skutečnou syntézou na CPU z dock.html a featured.html, přímo i přes most. Při spuštění ze zdrojů na Windows ověřte, že složka Scripts virtuálního prostředí venv je v PATH , aby piper.exe a ffmpeg.exe bylo možné najít. |
| chatterbox-tts-api | Přímo nebo přes most | Kompatibilní s OpenAI /v1/audio/speech. Ke klonování používá nastavený referenční zvuk. Struktura API byla otestována přímo i přes most. |
| Chatterbox-TTS-Server | Přímo nebo přes most | Koncový bod kompatibilní s OpenAI a webové rozhraní. Otestováno se skutečnou syntézou na CPU pomocí Emily.wav z dock.html a featured.html, přímo i přes most. |
| GPT-SoVITS | Režim mostu | Spusťte most SSN s --mode gptsovits; cílový server je /tts, nikoli kompatibilní s OpenAI. |
| F5-TTS_server | Režim mostu | Spusťte most SSN s --mode f5; cílový server používá GET /synthesize_speech/. |
| Oficiální F5-TTS | Potřebuje obálku | Primárně CLI, Gradio a socketový server. Použijte obálku kompatibilní s OpenAI nebo režim mostu F5 proti obálce. |
| Qwen3-TTS | Potřebuje obálku | Primárně knihovna a ukázka Gradio. Dobrý kandidát pro malou obálku kompatibilní s OpenAI kolem generate_voice_clone. |
| MisoTTS | Pouze vzdáleně/vlastní | Klonování hlasu je podporováno, ale model 8B není cílem pro 6 GB VRAM a repozitář neobsahuje místní koncový bod REST. |
Kokoro-FastAPI provozuje model Kokoro 82M jako místní server s API kompatibilním s OpenAI. Funguje na CPU (GPU není potřeba) a má výbornou kvalitu hlasu.
Otevřete terminál (Příkazový řádek, PowerShell nebo Terminál) a spusťte jeden z následujících příkazů:
Otevřete prohlížeč a přejděte na http://localhost:8880/web/— měli byste vidět webové rozhraní, kde můžete testovat hlasy.
K dispozici je více než 67 hlasů. Několik příkladů:
Procházejte a testujte všechny hlasy na http://localhost:8880/web/ jakmile server běží.
Pokud je Kokoro-FastAPI na stejném počítači jako OBS:
Pokud je Kokoro-FastAPI na jiném počítači, nahraďte 192.168.x.x IP adresou daného počítače v místní síti:
af_bella, af_sarah, am_adam, nebo bf_emma. Názvy, například echo, nova, a alloy jsou názvy ve stylu OpenAI/openedai-speech a s Kokoro nemusí fungovat.
Chcete-li Kokoro-FastAPI automaticky udržovat spuštěné na pozadí, použijte přepínač restartu Dockeru:
Nyní se spustí automaticky s Docker Desktop při každém restartu.
openedai-speech zpřístupňuje koncový bod kompatibilní s OpenAI /v1/audio/speech , který Social Stream potřebuje. Malý obraz provozuje Piper na CPU; úplný obraz může provozovat klonování hlasu XTTS-v2 na podporovaném GPU.
Použijte tuto možnost pro server TTS pouze na CPU do 1 GB. Neobsahuje XTTS-v2 ani klonování hlasu.
docker-compose.min.yml. Případně spusťte níže uvedené příkazy přímo.
Pokud spouštíte openedai-speech z místní kopie zdrojů místo Dockeru, přidejte složku skriptů jeho virtuálního prostředí do PATH před spuštěním serveru. Bez toho mohou požadavky vracet HTTP 500, protože server nenajde piper.exe nebo ffmpeg.exe.
openedai-speech používá názvy hlasů ve stylu OpenAI mapované na hlasy Piper:
Samotné XTTS-v2 je model, nikoli webové API. Použijte úplný server openedai-speech pro načtení modelu, výběr uloženého referenčního hlasu, přijetí textu chatu z SSN a vrácení přehratelného zvuku. Server uvádí praktický cíl přibližně 4 GB VRAM GPU; inference na CPU je možná, ale pomalá.
openedai-speech-min pro XTTS-v2. Minimální obraz obsahuje pouze Piper. XTTS-v2 vyžaduje úplnou instalaci a model=tts-1-hd v každém požadavku řeči.
Na macOS nebo Linuxu použijte cp sample.env speech.env místo Copy-Item. Docker musí mít přístup k podporovanému GPU. Model se stáhne při prvním použití.
tts-1-hd v config/voice_to_speaker.yaml:Zachovejte všechny stávající hlasy již uvedené pod tts-1-hd. Změňte me na název hlasu, který má SSN odesílat, a podle potřeby použijte správný kód jazyka XTTS.
openaimodel=tts-1-hd je vyžadováno pro XTTS-v2. Pokud je vynecháno, Social Stream odešle své výchozí tts-1 a openedai-speech místo toho vybere Piper. Hodnota voiceopenai musí odpovídat názvu klonovaného hlasu v voice_to_speaker.yaml.
Pokud prohlížeč nebo OBS blokuje přímý požadavek, spusťte Místní most TTS na počítači OBS a zachovejte stejné parametry modelu a hlasu, zatímco měníte openaiendpoint na http://127.0.0.1:8124/v1/audio/speech.
Most je malý místní pomocník. Přijme požadavek prohlížeče z SSN, komunikuje s vaším serverem TTS a vrátí zvuk do SSN s hlavičkami vhodnými pro prohlížeč.
http://127.0.0.1:8124/v1/audio/speech, i když skutečný server TTS běží na jiném počítači.
Samostatná výchozí složka je local-tts-bridge/; viz README mostu pro všechny možnosti spuštění.
Windows PowerShell, když server TTS běží na tomto stejném počítači:
Windows PowerShell, když server TTS běží na jiném počítači:
Terminál macOS/Linux:
Poté nasměrujte OBS dock.html URL na most:
GPT-SoVITS používá vlastní /tts strukturu JSON, takže most může převést požadavek SSN kompatibilní s OpenAI na tělo požadavku GPT-SoVITS.
Některé serverové obálky F5-TTS zpřístupňují /synthesize_speech/?text=...&voice=... místo koncového bodu kompatibilního s OpenAI. Most může převést požadavek SSN do tohoto formátu dotazu.
http://127.0.0.1:8124/v1/audio/speech. Port změňte pomocí SSN_TTS_BRIDGE_PORT=8125 podle potřeby.
Všechny výše uvedené vlastní hostované servery používají stejný způsob připojení — podporu vestavěnou v Social Stream: Koncový bod OpenAI TTS s vlastní místní URL.
| Parametr | Hodnota | Popis |
|---|---|---|
ttsprovider |
customtts nebo openai |
Použijte cestu TTS kompatibilní s OpenAI. Použijte customtts pro místní/vlastní hostované koncové body. |
openaiendpoint |
http://localhost:8880/v1/audio/speech |
URL místního serveru (port změňte podle potřeby) |
speech |
en-US |
Zapíná TTS pro angličtinu |
voiceopenai |
af_bella |
Název hlasu (závisí na serveru) |
openaiformat |
mp3 |
Formát zvuku: mp3, wav, opus, flac |
openaispeed |
1.0 |
Rychlost řeči (0.5–2.0) |
customttsendpoint a localttsendpoint také fungují. customttsvoice, localttsvoice, customttsmodel, localttsmodel, customttsformat, a localttsformat jsou přijímané aliasy polí ve stylu OpenAI.
openaiendpoint musí být dostupné ze stránky přehrávající TTS a voiceopenai musí být hlas podporovaný serverem. Kokoro-FastAPI používá názvy, například af_bella; openedai-speech často používá názvy, například nova nebo echo.
Fungují s libovolným poskytovatelem TTS včetně místních serverů:
| Parametr | Příklad | Popis |
|---|---|---|
simpletts |
&simpletts |
Vynechat „říká“ — číst pouze zprávu |
simpletts2 |
&simpletts2 |
Úplně vynechat uživatelská jména |
volume |
&volume=0.8 |
Hlasitost (0.0–1.0) |
skipmessages |
&skipmessages=3 |
Číst pouze každou 3. zprávu |
ttscommand |
&ttscommand=!say |
Číst pouze zprávy začínající na !say |
readevents |
&readevents |
Číst také předplatná, dary atd. |
ttsquick |
&ttsquick=100 |
Záměrně zkrátí řeč po tomto počtu znaků. Odstraňte, pokud se zprávy uřezávají. |
SSN již podporuje systémové/prohlížečové speechSynthesis, vestavěné Kokoro, Piper, Kitten a eSpeak. Nejužitečnějšími budoucími doplňky v prohlížeči by byly výběr výstupního zvukového zařízení tam, kde setSinkId je dostupné, více hlasů Piper a vyhrazená cesta průběžného streamovaného přehrávání pro servery, které umějí streamovat zvukové úseky.
Způsob zachytávání zvuku TTS v OBS závisí na tom, jak Social Stream Ninja provozujete.
Jde o nejjednodušší metodu a funguje pro všechny poskytovatele TTS (vestavěný a vlastní hostovaný server).
dock.html URL s parametry TTSPokud používáte samostatnou desktopovou aplikaci Social Stream Ninja (nikoli zdroj Prohlížeč v OBS):
Audio Router dokáže nasměrovat jednu aplikaci do virtuálního kabelu, ale jde o starší software. Pokud funguje, upřednostněte směrování po aplikacích ve Windows.
Voicemeeter je nejlepší, když potřebujete TTS slyšet místně, nasměrovat je do OBS a oddělit je od hudby/herního zvuku.
?speech=en-US bez poskytovatele) závisí na hlasech zpřístupněných prohlížečem. OBS nemusí zpřístupnit žádné hlasy nebo může hlasy vypsat bez vytváření zachytitelného zvuku. Řeč a nahrávku OBS testujte samostatně. Použijte některého z výše uvedených poskytovatelů (kokoro, piperatd.) místo toho.
| Možnost | Nastavení | Kvalita | Soukromý | OBS (zdroj Prohlížeč) | Potřebné GPU | Cena |
|---|---|---|---|---|---|---|
| Vestavěné Kokoro | Žádné | ⭐⭐⭐⭐⭐ | Ano | Ano | Ne (s GPU rychlejší) | Zdarma |
| Vestavěný Piper | Žádné | ⭐⭐⭐⭐ | Ano | Ano | Ne | Zdarma |
| Vestavěný Kitten | Žádné | ⭐⭐⭐ | Ano | Ano | Ne | Zdarma |
| Vestavěný eSpeak | Žádné | ⭐⭐ | Ano | Ano | Ne | Zdarma |
| Kokoro-FastAPI | Docker | ⭐⭐⭐⭐⭐ | Ano | Ano | Ne (volitelné) | Zdarma |
| openedai-speech | Docker | ⭐⭐⭐⭐ | Ano | Ano | Ne | Zdarma |
| ElevenLabs | Klíč API | ⭐⭐⭐⭐⭐ | Ne | Ano | Ne | Placené úrovně |
| Systémové TTS | Žádné | ⭐⭐ | Ano | Ne* | Ne | Zdarma |
* Systémové TTS vyžaduje pro zachytávání v OBS směrování přes virtuální zvukový kabel.
Test aplikace dokazuje pouze to, že aplikace dosáhne na server. Zdroj Prohlížeč v OBS stále musí dosáhnout na koncový bod a přehrát zvuk.
127.0.0.1 IP adresou počítače se serverem TTS v místní síti.ttsquick. Tato možnost záměrně zkracuje čtený text.&ttsquick=14 nebo jiné malé číslo, odstraňte jej a obnovte zdroj Prohlížeč v OBS.typewriter=, při testování jej dočasně odstraňte. TTS běžně používá původní zprávu, ale odstranění vizuálních efektů je rychlý způsob, jak vyloučit problémy s časováním.http://127.0.0.1:8880/web/ pro Kokoro-FastAPI nebo odpovídající port vašeho serveru.http://SERVER_LAN_IP:8880/web/. Pokud se to nenačte, ani OBS nebude moci daný server používat.Pokud prohlížeč hlásí blokování požadavku kvůli CORS, přístupu k místní nebo soukromé síti či selhání fetch, server TTS nemusí požadavek vůbec přijmout.
npm run local-tts-bridge na počítači OBS a nasměrujte SSN na http://127.0.0.1:8124/v1/audio/speech.af_bella, af_sarah, am_adamnebo jiný hlas z webového rozhraní Kokoro.nova, echo, a alloy mohou být platné.?speech=en-US bez &ttsprovider=). Systémové TTS může vyžadovat zachytávání zvuku plochy nebo virtuálního kabelu.Značky obrazů Docker se mohou měnit. Pokud příkaz v tomto průvodci přestane fungovat, zkontrolujte aktuální značku na stránce projektu: