Lass deinen Livechat von lokalen KI-Stimmen vorlesen. Beginne mit der Option ohne Installation und nutze einen lokalen Server nur bei Bedarf.
Social Stream Ninja kann Chatnachrichten mit lokaler KI-Sprachausgabe vorlesen. „Lokal“ kann zwei Dinge bedeuten: Die Stimme läuft im Browser oder du betreibst einen kleinen TTS-Server auf deinem eigenen Computer.
Es gibt zwei Ansätze:
Mehrere hochwertige KI-Stimmen sind direkt in Social Stream Ninja integriert. Sie laufen mit WebAssembly oder ONNX in deinem Browser — ohne Server, Docker oder Installation.
Einfach einen URL-Parameter hinzufügen und loslegen.
Betreibe einen lokalen TTS-Server auf deinem Rechner und konfiguriere Social Stream Ninja für diesen Server. Damit erhältst du mehr Stimmen, Stimmenklonen und serverseitige Steuerung.
Verwendet die integrierte Unterstützung von Social Stream: OpenAI-kompatibler Endpunkt .
Dies ist für die meisten Streamer der kürzeste Weg:
&speech=en-US&ttsprovider=kokoro oder &speech=en-US&ttsprovider=kitten an deine dock.html URL.Testing local TTS. Warte bei Kokoro oder Piper auf die erstmaligen Modelldownloads.Dies ist der häufigste Fehler bei lokaler TTS.
localhost und 127.0.0.1 bedeuten immer „dieser selbe Computer“. Wenn OBS auf einem Computer und Kokoro auf einem anderen läuft, 127.0.0.1 innerhalb der OBS-URL verweist auf den OBS-Computer, nicht auf den Kokoro-Computer.
127.0.0.1 nur, wenn der TTS-Server auf demselben Computer wie die Audio abspielende Seite läuft. Läuft der Server auf einem anderen Computer, verwende dessen LAN-IP-Adresse.| Deine Einrichtung | Zu verwendender Endpunkt |
|---|---|
| OBS und Kokoro laufen auf demselben Computer | http://127.0.0.1:8880/v1/audio/speech |
| Kokoro läuft auf einem anderen Computer in deinem Heimnetz | http://192.168.x.x:8880/v1/audio/speech, mit der LAN-IP des Kokoro-Computers |
| Die Testschaltfläche der SSN-Desktop-App funktioniert, aber OBS bleibt stumm | OBS benötigt weiterhin einen eigenen funktionierenden Endpunkt. Der App-Test beweist nicht, dass OBS den Server erreichen kann. |
Stelle unter Linux, macOS und Windows außerdem sicher, dass die Firewall den Port erlaubt und Docker den Port veröffentlicht hat mit -p 8880:8880.
Öffne im Erweiterungs-Popup die TTS-Anbieterauswahl und wähle Eigener / lokaler TTS-Endpunkt. Das zeigt die OpenAI-kompatiblen lokalen Endpunktfelder und den Link zurück zu dieser Anleitung.
SSN behandelt einen lokalen/selbst gehosteten TTS-Server wie einen OpenAI-kompatiblen Sprachendpunkt. Der grundlegende Ablauf ist:
Für ttsprovider=customtts, localtts, oder openai, sendet SSN einen JSON-POST an den konfigurierten Endpunkt:
CORS ist eine Berechtigungsprüfung des Browsers. Einfach gesagt: Der TTS-Server muss dem Browser mitteilen: „Ja, diese Seite darf Audio von mir anfordern.“ Fehlt diese Berechtigung, kann die Anfrage blockiert werden, bevor Kokoro oder ein anderer TTS-Server sie überhaupt sieht.
dock.html in Chrome oder OBS lädst, kann CORS wichtig sein.https://beta.socialstream.ninja/dock.html, kann Chrome außerdem Aufrufe lokaler oder privater HTTP-Adressen blockieren.Wenn der Server keine Browseranfragen erlaubt, starte die Lokale SSN-TTS-Brücke und verwende in SSN http://127.0.0.1:8124/v1/audio/speech. Für OBS ist die einfachste Einrichtung, die Brücke auf demselben Computer wie OBS auszuführen.
| Antwort | SSN-Unterstützung | Hinweise |
|---|---|---|
| Binäres Audio | Ja | Beste Option. Antworte mit audio/mpeg, audio/wav, audio/ogg, audio/aac, oder einem anderen im Browser abspielbaren Audiotyp. |
| JSON mit Audio-URL | Ja | SSN prüft url, audio_url, output_url, verschachtelte data.url sowie den ersten Eintrag in data[] . |
| JSON mit Base64-Audio | Ja | SSN prüft audio, audio_data, audioContent, b64_json, verschachtelte data Felder und Daten-URLs. |
| Rohes PCM | Nur mit Wrapper | Gib PCM als WAV-Datei oder Base64-WAV zurück. Ein Browser-Audioelement kann rohe PCM-Bytes nicht zuverlässig direkt abspielen. |
mp3 für kleine Dateien und breite Browser-Unterstützung, wav für lokale Klonserver und Bridge-Tests und opus nur, wenn Server und Browser es beide unterstützen.
SSN unterstützt bei eigenen/lokalen TTS-Endpunkten derzeit keine fortlaufende Wiedergabe. Es wartet auf den Antwort-Blob oder die JSON-Audionutzdaten und spielt sie dann ab. Manche vorgeschalteten Server bieten Streaming-Endpunkte, aber der aktuelle OpenAI-kompatible SSN-Weg puffert vor der Wiedergabe.
Praktisches Ergebnis: Halte Chat-TTS-Abschnitte kurz. Streaming-Unterstützung bräuchte einen separaten Wiedergabeweg mit gestreamten WAV-/MP3-Blöcken, MediaSource, WebCodecs oder einem serverseitigen Mixer.
Diese Engines sind in Social Stream Ninja enthalten und benötigen keine Installation. Sie laufen im Browser mit WebAssembly (WASM) oder ONNX Runtime.
| Anbieter | Qualität | CPU-Nutzung | GPU/WebGPU | URL-Parameter |
|---|---|---|---|---|
| Kokoro TTS | ⭐⭐⭐⭐⭐ Hervorragend | Mittel | Schneller mit GPU | ?ttsprovider=kokoro |
| Piper TTS | ⭐⭐⭐⭐ Sehr gut | Gering | Nur CPU | ?ttsprovider=piper |
| Kitten TTS | ⭐⭐⭐ Gut | Sehr gering | Nur CPU | ?ttsprovider=kitten |
| eSpeak-NG | ⭐⭐ Robotisch | Minimal | Nur CPU | ?ttsprovider=espeak |
Hinzufügen &ttsprovider= und &speech= an deine Social-Stream- dock.html URL:
SSN bietet derzeit 28 englische, drei spanische und drei brasilianisch-portugiesische Kokoro-Stimmen an. Wähle eine mit &voicekokoro=:
Spanisches Beispiel:
Portugiesisches Beispiel:
Gib ein Stimmenmodell an mit &pipervoice=:
Portugiesische und spanische Piper-Stimmen sind verfügbar:
Chrome-Erweiterung, OBS-Browser-Quelle und eigenständige Social-Stream-Ninja-Desktop-App verwenden alle dieselben dock.html URL-Parameter für TTS. Der wichtige Unterschied ist, wo der Ton erzeugt wird.
| Oberfläche | Verhalten lokaler TTS | Audioerfassung |
|---|---|---|
| Chrome-Erweiterung / OBS-Browser-Quelle | Browser-fetch benötigt CORS vom lokalen Server, sofern du nicht die SSN-Brücke verwendest. | Verwende die OBS-Browser-Quelle mit „Audio über OBS steuern“. |
| Eigenständige Desktop-App | Verwendet dieselben Anbietereinstellungen. Lokale Dateifenster der App sind weniger durch CORS eingeschränkt, aber die Brücke bleibt der sicherste Weg für Server, die browserartige Anfragen ablehnen. | Erfasse Desktop-/App-Audio oder leite die App an ein virtuelles Audiokabel. |
| Integriertes Kokoro in der Desktop-App | Die App kann ihren lokalen Pfad ninjafy.tts für Kokoro verwenden, statt sich nur auf das Laden des Modells im Browser zu verlassen. |
Audio wird von der App abgespielt; verwende daher Desktop-/App-Audioerfassung. |
dock.html URL nach OBS kopierst, muss OBS selbst den TTS-Server erreichen und das Audio abspielen.
Wenn du mehr Stimmen, Stimmenklonen oder einen eigenen Server zur Nutzung in mehreren Tools möchtest, kannst du einen lokalen TTS-Server betreiben. Social Stream Ninja verbindet sich über seine integrierte Unterstützung: OpenAI-kompatibler TTS-Endpunkt — für lokale Server ist kein API-Schlüssel erforderlich.
Drei empfohlene Optionen:
| Server | Modell | GPU | Datenträger | Standardport |
|---|---|---|---|---|
| Kokoro-FastAPI Empfohlen | Kokoro 82M | Optional | ~2 GB | 8880 |
| openedai-speech (Piper) Ressourcenschonend | Piper TTS | Nur CPU | <1 GB | 8000 |
| kokoro-web | Kokoro 82M | Optional | ~2 GB | 3000 |
| Paket | Wichtigster Vorteil | Abwägung |
|---|---|---|
| Integriertes Kokoro | Beste erste Wahl: kein Server, hohe Qualität, privat, funktioniert in Browser und Desktop-App. | Kein Stimmenklonen. |
| Kokoro-FastAPI | OpenAI-kompatibler Server, einfache Docker-Einrichtung, CPU oder GPU, viele Kokoro-Stimmen. | Kein echtes Stimmenklonen; Stimmenmischung und eigene Stimmenfunktionen hängen von der Serverversion ab. |
| openedai-speech | Schlanker OpenAI-kompatibler Endpunkt; Piper schont die CPU und XTTS ergänzt Klonen mit etwa 4 GB VRAM als Ziel. | Laut Repository ist es größtenteils veraltet; betrachte es daher als nützlich, aber nicht zukunftssicher. |
| Chatterbox-Server | Stimmenklonen, Weboberflächenoptionen, OpenAI-kompatible APIs, Werkzeuge für lange Texte. | CUDA-/GPU-Unterstützung funktioniert bei manchen Versionen reibungsloser als CPU; die Einrichtung hängt vom Server-Fork ab. |
| GPT-SoVITS | Gutes Klonen und gute Steuerung mit kurzen Referenzen und Transkriptunterstützung. | Standardmäßig nicht OpenAI-kompatibel; verwende den SSN-Bridge-Modus. |
| F5-TTS | Natürliches Zero-Shot-Klonen mit Prompt-WAV und Transkript. | Das offizielle Projekt ist kein einfacher OpenAI-Endpunkt; verwende einen Wrapper oder Bridge-Modus. |
| Qwen3-TTS | Moderne Funktionen zum Klonen und Gestalten von Stimmen, einschließlich kleinerer 0.6B-/1.7B-Modelle. | Zunächst Bibliothek/Demo; benötigt für SSN einen Wrapper. |
| MisoTTS | Hochwertige promptgesteuerte Spracherzeugung. | Kein lokales Ziel für 6 GB VRAM; nutze bei Bedarf entferntes/eigenes Hosting. |
Stimmenklonen ist kein eigener SSN-Modus. Es ist eine Funktion einiger lokaler TTS-Server. SSN sendet den Chattext an einen lokalen Endpunkt; der Server wählt die geklonte Stimme anhand einer gespeicherten Referenzaudiodatei, eines Stimmenprofils oder der Bridge-Konfiguration.
ttsprovider=customtts.Setze bei höchstens 6 GB VRAM zuerst auf kleine Zero-Shot-Klonmodelle und OpenAI-kompatible Server. Größere Modelle können über denselben SSN-Endpunkt funktionieren, wenn der Nutzer sie anderswo hostet.
| Option | Stimmenklonen | Passt in 6 GB VRAM | API-Pfad für SSN |
|---|---|---|---|
| Qwen3-TTS 0.6B Base | 3 Sekunden Referenzaudio | Wahrscheinlich | Verwende einen OpenAI-kompatiblen Wrapper und dann ttsprovider=customtts |
| XTTS-v2 / openedai-speech | Kurze WAV-Referenzstimmen | Ja, laut openedai-speech etwa 4 GB | /v1/audio/speech |
| Chatterbox Turbo / Server | Klonen anhand von Referenzaudio | Wahrscheinlich bei Turbo / kleinen Abschnitten | OpenAI-kompatible Serverversionen oder die Brücke |
| GPT-SoVITS | 5 Sekunden Zero-Shot, 1 Minute Few-Shot | Wahrscheinlich mit fp16 / schlanker Installation | Verwende scripts/local-tts-bridge.cjs --mode gptsovits |
| F5-TTS | Prompt-WAV + Transkript | Vielleicht; hängt von Version und Vocoder ab | Verwende einen OpenAI-kompatiblen Wrapper oder --mode f5 für F5-TTS-Server-Wrapper |
| MisoTTS 8B | Audio-Prompt-Kontext | Nein; Projekt empfiehlt 24 GB VRAM | Nur entfernter/eigener Endpunkt |
POST /v1/audio/speech mit { model, input, voice, response_format, speed } und Rückgabe einer abspielbaren Audiodatei. Das deckt OpenAI, Coqui/XTTS, Kokoro-Wrapper, Qwen-Wrapper und die meisten Proxy-Dienste ab.
Dies sind praktische Ausgangspunkte, keine festen Garantien. Modellversion, Quantisierung, Textlänge, Docker-Image und Hintergrund-Apps können den Speicherbedarf verändern.
| Option | Praktische Mindestanforderungen an den Computer | Gutes Ziel | Hinweise |
|---|---|---|---|
| System TTS / eSpeak | Jeder moderne PC | Jeder PC | Schnell, geringe Qualität, kein Klonen. |
| Integriertes Kitten | Schwache CPU, 4 GB RAM | Moderne Laptop-CPU, 8 GB RAM | Kleines ONNX-Modell, schneller Start. |
| Integriertes Piper | Moderne CPU, 4–8 GB RAM | Moderne CPU, 8 GB RAM | Gute ressourcenschonende Option für neuronale Stimmen. |
| Integriertes Kokoro | Moderne CPU, 8 GB RAM | WebGPU-fähige GPU oder schnelle CPU, 8–16 GB RAM | Beste Qualität ohne Einrichtung. Beim ersten Laden werden Modellressourcen heruntergeladen. |
| Kokoro-FastAPI | CPU-Docker-Host, 8 GB RAM | NVIDIA-GPU optional, 8–16 GB RAM | Guter lokaler Server, wenn das Laden des Modells im Browser nicht ideal ist. |
| openedai-speech Piper | CPU, 4–8 GB RAM | CPU, 8 GB RAM | Schlanker OpenAI-kompatibler Server. |
| openedai-speech XTTS | NVIDIA-GPU mit etwa 4 GB VRAM, 8–16 GB RAM | NVIDIA-GPU mit mindestens 6 GB, 16 GB RAM | Weg zum Stimmenklonen; CPU ist möglich, aber langsam. |
| Chatterbox-Server | CPU funktioniert bei manchen Versionen, ist aber langsam | NVIDIA-GPU mit mindestens 6 GB, 16 GB RAM | Verwende zum Klonen oder für lange Texte eine GPU. |
| GPT-SoVITS / F5-TTS / Qwen3-TTS | Nur CPU-Tests, langsam | NVIDIA-GPU mit mindestens 6 GB für kleinere/optimierte Modelle, 16 GB RAM | Wrapperwahl und Modellgröße sind entscheidend. Rechne mit mehr Einrichtungsaufwand. |
| MisoTTS 8B | Bei 6 GB VRAM lokal nicht empfohlen | 24 GB VRAM oder entfernter Host | Das Repository empfiehlt für interaktive Nutzung GPUs mit viel VRAM. |
Dies sind die selbst gehosteten Stimmenklon-Ziele, die auf SSN-Kompatibilität geprüft wurden. Der lokale Endpunktweg wurde gegen beide getestet: dock.html und featured.html.
SSN akzeptiert direkte binäre Audioantworten, JSON-Antworten mit Base64-Audio und JSON-Antworten mit einer Audio-URL. Die aktuelle eigene/lokale Wiedergabe puffert das empfangene Audio vor dem Abspielen; fortlaufende Streaming-Wiedergabe wird noch nicht unterstützt.
| Server | SSN-Weg | Hinweise |
|---|---|---|
| openedai-speech | Direkt oder über Brücke | OpenAI-kompatibel /v1/audio/speech. Der Piper-Modus wurde mit echter CPU-Synthese getestet, ausgehend von dock.html und featured.html, direkt und über die Brücke. Wenn du unter Windows aus dem Quellcode startest, stelle sicher, dass der Ordner Scripts der virtuellen Umgebung in PATH liegt, damit piper.exe und ffmpeg.exe gefunden werden können. |
| chatterbox-tts-api | Direkt oder über Brücke | OpenAI-kompatibel /v1/audio/speech. Verwendet konfiguriertes Referenzaudio zum Klonen. Das API-Format wurde direkt und über die Brücke getestet. |
| Chatterbox-TTS-Server | Direkt oder über Brücke | OpenAI-kompatibler Endpunkt und Weboberfläche. Mit echter CPU-Synthese getestet unter Verwendung von Emily.wav aus dock.html und featured.html, direkt und über die Brücke. |
| GPT-SoVITS | Bridge-Modus | Starte die SSN-Brücke mit --mode gptsovits; Zielserver ist /tts, nicht OpenAI-kompatibel. |
| F5-TTS_server | Bridge-Modus | Starte die SSN-Brücke mit --mode f5; Zielserver verwendet GET /synthesize_speech/. |
| F5-TTS offiziell | Wrapper erforderlich | Zunächst CLI, Gradio und Socket-Server. Verwende einen OpenAI-kompatiblen Wrapper oder den F5-Bridge-Modus mit einem Wrapper. |
| Qwen3-TTS | Wrapper erforderlich | Zunächst Bibliothek und Gradio-Demo. Guter Kandidat für einen kleinen OpenAI-kompatiblen Wrapper um generate_voice_clone. |
| MisoTTS | Nur entfernt/eigen | Stimmenklonen wird unterstützt, aber das 8B-Modell ist kein Ziel für 6 GB VRAM und hat keinen lokalen REST-Endpunkt im Repository. |
Kokoro-FastAPI führt das Kokoro-82M-Modell als lokalen Server mit OpenAI-kompatibler API aus. Es funktioniert auf der CPU (keine GPU nötig) und bietet hervorragende Sprachqualität.
Öffne ein Terminal (Eingabeaufforderung, PowerShell oder Terminal) und führe einen der folgenden Befehle aus:
Öffne deinen Browser und gehe zu http://localhost:8880/web/— du solltest eine Weboberfläche sehen, in der du Stimmen testen kannst.
Über 67 Stimmen verfügbar. Einige Highlights:
Alle Stimmen ansehen und testen unter http://localhost:8880/web/ sobald der Server läuft.
Wenn Kokoro-FastAPI auf demselben Computer wie OBS läuft:
Wenn Kokoro-FastAPI auf einem anderen Computer läuft, ersetze 192.168.x.x durch die LAN-IP-Adresse dieses Computers:
af_bella, af_sarah, am_adam, oder bf_emma. Namen wie echo, nova, und alloy sind Namen im OpenAI-/openedai-speech-Stil und funktionieren möglicherweise nicht mit Kokoro.
Verwende Dockers Neustart-Flag, damit Kokoro-FastAPI automatisch im Hintergrund weiterläuft:
Der Server startet nun bei jedem Neustart automatisch mit Docker Desktop.
openedai-speech stellt den OpenAI-kompatiblen Endpunkt /v1/audio/speech bereit, den Social Stream benötigt. Das kleine Image führt Piper auf der CPU aus; das vollständige Image kann XTTS-v2-Stimmenklonen auf einer unterstützten GPU ausführen.
Verwende diese Option für einen reinen CPU-TTS-Server unter 1 GB. Sie enthält weder XTTS-v2 noch Stimmenklonen.
docker-compose.min.yml. Alternativ kannst du die folgenden Befehle direkt ausführen.
Wenn du openedai-speech aus einem lokalen Checkout statt Docker betreibst, füge den Skriptordner seiner virtuellen Umgebung zu PATH hinzu, bevor du den Server startest. Ohne dies können Anfragen HTTP 500 zurückgeben, weil der Server folgende Programme nicht findet: piper.exe oder ffmpeg.exe.
openedai-speech verwendet Stimmennamen im OpenAI-Stil, die Piper-Stimmen zugeordnet sind:
XTTS-v2 selbst ist ein Modell, keine Web-API. Verwende den vollständigen openedai-speech-Server, um das Modell zu laden, eine gespeicherte Referenzstimme auszuwählen, Chattext von SSN anzunehmen und abspielbares Audio zurückzugeben. Der Server nennt etwa 4 GB GPU-VRAM als praktischen Zielwert; CPU-Inferenz ist möglich, aber langsam.
openedai-speech-min für XTTS-v2. Das minimale Image enthält nur Piper. XTTS-v2 benötigt die vollständige Installation und model=tts-1-hd in jeder Sprachanfrage.
Verwende unter macOS oder Linux cp sample.env speech.env anstelle von Copy-Item. Docker muss Zugriff auf eine unterstützte GPU haben. Das Modell wird bei der ersten Nutzung heruntergeladen.
tts-1-hd in config/voice_to_speaker.yaml:Behalte alle vorhandenen Stimmen in diesem Abschnitt: tts-1-hd. Ändere me auf den Stimmennamen, den SSN senden soll, und verwende bei Bedarf den richtigen XTTS-Sprachcode.
openaimodel=tts-1-hd wird für XTTS-v2 benötigt. Wenn es fehlt, sendet Social Stream seinen Standard tts-1, und openedai-speech wählt stattdessen Piper. Der voiceopenai Wert muss mit dem Namen der geklonten Stimme in folgender Datei übereinstimmen: voice_to_speaker.yaml.
Wenn Browser oder OBS die direkte Anfrage blockieren, starte die Lokale TTS-Brücke auf dem OBS-Computer, behalte dieselben Modell- und Stimmenparameter bei und ändere dabei openaiendpoint auf http://127.0.0.1:8124/v1/audio/speech.
Die Brücke ist ein kleiner lokaler Helfer. Sie nimmt die Browseranfrage von SSN entgegen, spricht mit deinem TTS-Server und gibt Audio mit browsergeeigneten Headern an SSN zurück.
http://127.0.0.1:8124/v1/audio/speech verwenden, selbst wenn der eigentliche TTS-Server auf einem anderen Computer läuft.
Der eigenständige Startordner ist local-tts-bridge/; siehe die README der Brücke für alle Startoptionen.
Windows PowerShell, wenn der TTS-Server auf diesem Computer läuft:
Windows PowerShell, wenn der TTS-Server auf einem anderen Computer läuft:
macOS-/Linux-Terminal:
Richte dann die OBS- dock.html URL auf die Brücke aus:
GPT-SoVITS verwendet sein eigenes /tts JSON-Format, damit die Brücke die OpenAI-kompatible SSN-Anfrage in den GPT-SoVITS-Anfragetext umwandeln kann.
Einige F5-TTS-Server-Wrapper stellen /synthesize_speech/?text=...&voice=... statt eines OpenAI-kompatiblen Endpunkts bereit. Die Brücke kann SSNs Anfrage in dieses Abfrageformat umwandeln.
http://127.0.0.1:8124/v1/audio/speech. Ändere den Port mit SSN_TTS_BRIDGE_PORT=8125 bei Bedarf.
Alle oben genannten selbst gehosteten Server verwenden dieselbe Verbindungsmethode — die integrierte Unterstützung von Social Stream: OpenAI-TTS-Endpunkt mit eigener lokaler URL.
| Parameter | Wert | Beschreibung |
|---|---|---|
ttsprovider |
customtts oder openai |
Verwende den OpenAI-kompatiblen TTS-Weg. Verwende customtts für lokale/selbst gehostete Endpunkte. |
openaiendpoint |
http://localhost:8880/v1/audio/speech |
Deine lokale Server-URL (Port bei Bedarf ändern) |
speech |
en-US |
Aktiviert TTS für Englisch |
voiceopenai |
af_bella |
Stimmenname (serverabhängig) |
openaiformat |
mp3 |
Audioformat: mp3, wav, opus, flac |
openaispeed |
1.0 |
Sprechgeschwindigkeit (0,5–2,0) |
customttsendpoint und localttsendpoint funktionieren ebenfalls. customttsvoice, localttsvoice, customttsmodel, localttsmodel, customttsformat, und localttsformat sind akzeptierte Aliase für die Felder im OpenAI-Stil.
openaiendpoint muss von der TTS-abspielenden Seite erreichbar sein, und voiceopenai muss eine von deinem Server unterstützte Stimme sein. Kokoro-FastAPI verwendet Namen wie af_bella; openedai-speech verwendet oft Namen wie nova oder echo.
Diese Optionen funktionieren mit jedem TTS-Anbieter, einschließlich lokaler Server:
| Parameter | Beispiel | Beschreibung |
|---|---|---|
simpletts |
&simpletts |
„sagt“ auslassen — nur die Nachricht vorlesen |
simpletts2 |
&simpletts2 |
Benutzernamen vollständig auslassen |
volume |
&volume=0.8 |
Lautstärkepegel (0,0–1,0) |
skipmessages |
&skipmessages=3 |
Nur jede 3. Nachricht vorlesen |
ttscommand |
&ttscommand=!say |
Nur mit !say beginnende Nachrichten vorlesen |
readevents |
&readevents |
Auch Abonnements, Spenden usw. vorlesen |
ttsquick |
&ttsquick=100 |
Kürzt Sprache absichtlich nach dieser Zeichenzahl. Entferne den Wert, wenn Nachrichten abgeschnitten werden. |
SSN unterstützt bereits Betriebssystem-/Browser- speechSynthesis, integriertes Kokoro, Piper, Kitten und eSpeak. Die nützlichsten künftigen Ergänzungen im Browser wären eine Auswahl des Audioausgabegeräts, wo setSinkId verfügbar ist, mehr Piper-Stimmen sowie ein eigener Weg für fortlaufende Streaming-Wiedergabe für Server, die Audioblöcke streamen können.
Wie du TTS-Audio in OBS erfasst, hängt davon ab, wie du Social Stream Ninja betreibst.
Dies ist die einfachste Methode und funktioniert für alle TTS-Anbieter (integriert und selbst gehosteter Server).
dock.html URL mit TTS-ParameternWenn du die eigenständige Social-Stream-Ninja-Desktop-App verwendest (keine OBS-Browser-Quelle):
Audio Router kann eine App an ein virtuelles Kabel weiterleiten, ist aber ältere Software. Bevorzuge das app-spezifische Windows-Routing, wenn es funktioniert.
Voicemeeter ist am besten, wenn du TTS lokal hören, an OBS weiterleiten und von Musik-/Spielaudio trennen möchtest.
?speech=en-US ohne Anbieter) hängt von den Stimmen ab, die der Browser bereitstellt. OBS zeigt möglicherweise keine Stimmen oder listet Stimmen auf, ohne erfassbares Audio zu erzeugen. Teste Sprachausgabe und OBS-Aufnahme separat. Verwende einen der oben genannten Anbieter (kokoro, piper, usw.) stattdessen.
| Option | Einrichtung | Qualität | Privat | OBS (Browser-Quelle) | GPU erforderlich | Kosten |
|---|---|---|---|---|---|---|
| Integriertes Kokoro | Keine | ⭐⭐⭐⭐⭐ | Ja | Ja | Nein (schneller mit) | Kostenlos |
| Integriertes Piper | Keine | ⭐⭐⭐⭐ | Ja | Ja | Nein | Kostenlos |
| Integriertes Kitten | Keine | ⭐⭐⭐ | Ja | Ja | Nein | Kostenlos |
| Integriertes eSpeak | Keine | ⭐⭐ | Ja | Ja | Nein | Kostenlos |
| Kokoro-FastAPI | Docker | ⭐⭐⭐⭐⭐ | Ja | Ja | Nein (optional) | Kostenlos |
| openedai-speech | Docker | ⭐⭐⭐⭐ | Ja | Ja | Nein | Kostenlos |
| ElevenLabs | API-Schlüssel | ⭐⭐⭐⭐⭐ | Nein | Ja | Nein | Kostenpflichtige Tarife |
| System-Sprachausgabe | Keine | ⭐⭐ | Ja | Nein* | Nein | Kostenlos |
* System TTS erfordert für die OBS-Erfassung Audio-Routing über ein virtuelles Kabel.
Der App-Test beweist nur, dass die App den Server erreichen kann. Die OBS-Browser-Quelle muss weiterhin selbst den Endpunkt erreichen und Audio abspielen.
127.0.0.1 durch die LAN-IP des TTS-Servercomputers.ttsquick. Diese Option kürzt den gesprochenen Text absichtlich.&ttsquick=14 oder eine andere kleine Zahl siehst, entferne sie und aktualisiere die OBS-Browser-Quelle.typewriter=, entferne ihn vorübergehend beim Testen. TTS verwendet normalerweise die ursprüngliche Nachricht, aber das Entfernen visueller Effekte ist eine schnelle Möglichkeit, Zeitprobleme auszuschließen.http://127.0.0.1:8880/web/ für Kokoro-FastAPI oder den passenden Port deines Servers.http://SERVER_LAN_IP:8880/web/. Wenn das nicht lädt, kann OBS diesen Server ebenfalls nicht verwenden.Wenn der Browser meldet, dass CORS, lokaler Netzwerkzugriff, privater Netzwerkzugriff oder fehlgeschlagener fetch die Anfrage blockiert hat, erreicht sie den TTS-Server möglicherweise nie.
npm run local-tts-bridge auf dem OBS-Computer aus und verwende in SSN http://127.0.0.1:8124/v1/audio/speech.af_bella, af_sarah, am_adam, oder eine andere Stimme aus der Kokoro-Weboberfläche.nova, echo, und alloy können gültig sein.?speech=en-US ohne &ttsprovider=). System TTS benötigt möglicherweise Desktop-Audio oder Erfassung über ein virtuelles Kabel.Docker-Image-Tags können sich ändern. Wenn ein Befehl in dieser Anleitung nicht mehr funktioniert, prüfe auf der Projektseite den aktuellen Tag: