Anleitung zum KI-Co-Host

So arbeiten Dock-Steuerung, privater Chatbot und KI-Bühnen-Overlay zusammen.

Was es macht

Es gibt zwei Co-Host-Abläufe: einen durchgehenden Sprachbegleiter in cohost.html, und manuelle Dock-Aktionen, die freigegebene Texte an cohost-overlay.html.

Dock-Steuerung

Wenn das Bühnen-Overlay verbunden ist, klicke mit der rechten Maustaste auf eine Chatnachricht im Dock und wähle Co-Host. Das Dock kann die Nachricht vorlesen, die KI um eine Antwort bitten oder einen harmlosen Roast-Entwurf erstellen.

KI-Bühnen-Overlay

Das Overlay zeigt Avatar, Sprechblase und optional die Sprachausgabe des Browsers. Diese Browserquelle fügst du in OBS ein.

Privater Chatbot

Antwort und Leichter Roast verwenden den konfigurierten LLM-Anbieter über die Brücke des privaten Chatbots. Vorlesen benötigt keine KI.

Multimodaler Co-Host

cohost.html verbindet sich mit dem SSN-Livechat-Feed, wenn es mit derselben session. Im standardmäßigen Kontextmodus merkt sich die KI aktuelle Zuschauernachrichten und bespricht sie, wenn der Streamer danach fragt.

Co-Host per Rechtsklick im Dock einrichten

  1. Öffne das Streaming-Chat-Dock mit deiner Sitzung: dock.html?session=YOUR_SESSION_ID.
  2. Füge das KI-Bühnen-Overlay zu OBS hinzu: cohost-overlay.html?session=YOUR_SESSION_ID. Füge hinzu &tts nur für einen Ablauf mit Textantworten.
  3. Konfiguriere für KI-Antworten einen LLM-Anbieter im Popup. Für einen schnellen Test wähle Gehostetes Test-LLM von SSN, das llm.socialstream.ninja.
  4. Aktivieren Chatbots und KI-Dienste > Chatbot – Private Oberfläche > Privaten Chatbot aktivieren.
  5. Klicke mit der rechten Maustaste auf eine Dock-Nachricht und wähle Co-Host. Das Menü bleibt verborgen, bis das Bühnen-Overlay erkannt wird. Dieses Kontextmenü der Dock-Nachrichten ist noch nicht per Tastatur erreichbar. Tastaturnutzer können das Texteingabefeld oder die Sprachsteuerung auf cohost.html.
Steuerungsseite cohost.html mit Mediengeräten, KI-Anbietereinstellungen, Systemanweisungen und Livechat-Status
Der cohost.html Steuerungsseite: Wähle Kamera und Mikrofon, einen KI-Anbieter und Systemanweisungen und beobachte den Livechat-Statusbereich.

Tipp: Verwende denselben session Wert für Dock und Co-Host-Overlay. &tts gilt für Text-Overlay-Abläufe. Wenn natives Audio der Steuerungsseite aktiv ist, unterdrückt SSN doppelte Overlay-Sprachausgabe; &forcetts setzt diesen Schutz bewusst außer Kraft.

Einfache KI-Option

llm.socialstream.ninja ist verfügbar über Gehostetes Test-LLM von SSN als kostenlose einfache Testoption, solange der Testdienst verfügbar ist.

  • Öffnen Chatbots und KI-Dienste > LLM-Anbieter konfigurieren.
  • Auswählen Gehostetes Test-LLM von SSN (experimentell).
  • Lasse Endpunkt, Token und Modell für die Standard-Testeinrichtung leer.
  • Verwende langfristig dein eigenes Token oder einen lokalen Anbieter, falls der Testdienst deaktiviert oder begrenzt wird.

Unterstützung für Sprachgespräche

  • OpenAI Realtime: Überträgt das auf cohost.html direkt an OpenAI für ein natives Sprachgespräch. Das gesprochene Gespräch und der Livechat-Kontext bleiben in derselben Co-Host-Sitzung.
  • SSN-Desktop-App: Verwendet lokales Whisper mit dem auf cohost.html. Beim ersten Einsatz werden etwa 42 MB heruntergeladen; danach läuft die Transkription offline.
  • Chrome / Link der Chrome-Erweiterung: Die Erweiterung öffnet die gehostete Co-Host-Seite in einem Chrome-Tab. OpenAI Realtime nutzt WebRTC mit einem kurzlebigen Client-Geheimnis; Anbieter mit Textantworten nutzen die Chrome-Spracherkennung und benötigen möglicherweise Internet.
  • Andere Browser: Spracherkennung ist nicht garantiert. Texteingaben an den Co-Host, Livechat-Eingaben, Kamera-/Bildschirmeingaben und Antworten konfigurierter LLMs können auch ohne Spracherkennung funktionieren.

Bei OpenAI Realtime sollte Diagnostik Hört zu (OpenAI WebRTC). Mit Desktop Whisper sollte dort Hört zu (Desktop Whisper) und dann den erkannten Text unter Gehört.

Datenschutz: das ausgewählte Mikrofon, ausdrücklich ausgewählte Kamera-/Bildschirmbilder und vom gewählten Livechat-Modus geteilte Zuschauernachrichten werden an diesen KI-Anbieter gesendet. Zuschauernachrichten gelten als nicht vertrauenswürdiger Kontext und können keine Co-Host-Werkzeuge autorisieren. Öffne den generierten Co-Host-Steuerungslink aus dem Popup und halte ihn privat. Seine private Berechtigung läuft nach 12 Stunden ab, gilt nur für die aktuelle SSN-Sitzung und wird nach dem Laden aus der Adressleiste entfernt.

OpenAI Realtime einrichten

  1. Wähle im SSN-Popup ChatGPT-API, gib deinen OpenAI-Projekt-API-Schlüssel ein und verwende Ausgewählten Chatbot testen.
  2. Öffne den generierten cohost.html?session=YOUR_SESSION_ID Link aus dem Popup. Seine private, ablaufende Co-Host-Berechtigung autorisiert Realtime, ohne die separate Option für den privaten Chatbot zu aktivieren.
  3. Auswählen OpenAI Realtime. Der normale Schlüssel bleibt im Hintergrund der SSN-Erweiterung oder Desktop-App; die Co-Host-Seite erhält nur ein kurzlebiges Realtime-Client-Geheimnis.
  4. Wähle ausdrücklich das Mikrofon aus, in das du sprichst, lasse Audioantwort ausgewählt und drücke Co-Host starten.
  5. Optional: Lasse Videoquelle auf Kein Video (Standard) oder wähle ausdrücklich Bildschirmfreigabe oder eine Kamera. OpenAI erhält bei jeder direkten gesprochenen oder getippten Anfrage ein aktuelles Bild statt durchgehendem Video. Dies kann API-Kosten und Latenz erhöhen.
  6. Lasse Livechat auf Nur Kontext – auf Nachfrage antworten. Frage „Was sagt der Chat?“, damit dieselbe sprechende KI auf aktuelle Zuschauernachrichten eingeht.
  7. Erfasse den Ton des Co-Host-Browsers oder der App in OBS. Die native OpenAI-Stimme wird nur von cohost.html; cohost-overlay.html empfängt Avatar und Text, nicht denselben Audiostream. Wähle bei Unterstützung ein virtuelles Kabel unter Co-Host-Ausgabe für getrenntes Audio-Routing in OBS.
  8. Lasse die Sprechblase des Bühnen-Overlays sichtbar oder stelle Untertitel bereit, damit die KI-Antwort nicht nur hörbar ist.

Dies verwendet die OpenAI-API-Abrechnung und erstellt eine SSN-Realtime-Unterhaltung über WebRTC, getrennt von chatgpt.com. Antworten sind auf 512 Ausgabetokens begrenzt. Diagnostik zeigt den kumulierten Tokenverbrauch und die gemessene Latenz bis zur ersten Ausgabe. OpenAI kürzt noch nicht abgespieltes Audio automatisch, wenn der Streamer unterbricht. SSN hält höchstens 20 aktuelle Chatnachrichten bis zu 90 Sekunden vor, einschließlich Kontext zu bezahlter Unterstützung, Mitgliedschaften, Moderatoren, Events und Quellkanälen, und entfernt diesen vorübergehenden Kontext danach. SSN prüft stille Sitzungen, verbindet ausgefallene Verbindungen neu und erneuert Sitzungen vor der 60-Minuten-Grenze. Eine wiederhergestellte Sitzung übernimmt Systemanweisungen und Leistungseinstellungen, beginnt aber ohne das vorherige gesprochene Gespräch.

Geschwindigkeit, Qualität und Kosten von OpenAI

  • Modell: Mini ist normalerweise schneller und günstiger. Volle Qualität ist leistungsfähiger und kostet mehr.
  • Reasoning-Aufwand: Minimal oder Niedrig reduziert normalerweise Antwortverzögerung und berechnete Ausgabenutzung. Hoch oder Sehr hoch kann komplexe Antworten verbessern, aber langsamer und teurer sein. Änderungen gelten auch bei bestehender Verbindung.
  • Geschwindigkeit des Sprecherwechsels: Schnell wartet bis zu etwa 2 Sekunden auf das Ende eines Gedankens, Ausgewogen etwa 4 Sekunden und Geduldig etwa 8 Sekunden. Schnell wirkt reaktionsfreudiger, kann aber eine natürliche Pause unterbrechen.
  • Diagnostik: Die Latenz misst die Zeit vom Ende des Sprecherbeitrags bis zum ersten Text oder Audio und weist nach Möglichkeit die Modellverzögerung getrennt aus. Netzwerkbedingungen und Anbieterauslastung können auch bei ähnlichen Anfragen variieren.

Optionale Stream-Steuerung

OpenAI Realtime unterstützt die unten beschriebenen Werkzeuge für Spotify, OBS-Szenen und hervorgehobenen Chat. SSN Configured LLM unterstützt derzeit nur Spotify; andere Co-Host-Anbieter bieten diese Werkzeuge noch nicht.

  1. Aktiviere im SSN-Popup nur die gewünschten Co-Host-Werkzeuge: Spotify, OBS-Szenen oder hervorgehobenen Chat.
  2. Gib für OBS die exakten erlaubten Szenennamen als kommagetrennte Liste ein und lasse actions.html mit OBS verbunden oder verwende eine OBS-Browserquelle mit vollständigen Berechtigungen.
  3. Ein cohost.html, öffne Stream-Steuerung des Co-Hosts und schalte dieselben Werkzeuge für diese Steuerung frei.
  4. Bitte direkt darum, etwa „Wechsle zu BRB“, „Hebe die letzte Nachricht hervor“ oder „Leere den hervorgehobenen Chat“. Zuschauernachrichten können keine Werkzeuge autorisieren. Pro direkter Streamer-Anfrage wird höchstens ein Werkzeug ausgeführt, das den Stream verändert.

Der Werkzeugzugriff ist auf erlaubte Funktionen beschränkt und bietet keinen allgemeinen API-Zugriff. OBS kann nur Szenen auswählen, die in den SSN-Einstellungen genannt sind. Hervorhebungsanfragen verwenden eine kürzlich erfasste Chatnachricht und benötigen das Streaming-Chat-Dock. Werkzeugantworten bestätigen die Zustellung, nicht die abgeschlossene Ausführung in OBS oder im Overlay.

So kommunizieren die Seiten

Dock und Overlay verwenden die bestehende Sitzungsbrücke von Social Stream. Nachrichten werden als overlayNinja Daten gesendet und anhand des Labels adressiert.

Im Co-Host vorlesen: sendet das Dock die ausgewählte Chatnachricht direkt an cohost-overlay.html.

Antwort / Leichter Roast: sendet das Dock eine Anfrage des privaten Chatbots an den SSN-Hintergrunddienst, zeigt den KI-Entwurf im Dock und sendet ihn erst an das Overlay, nachdem der Streamer auf Sprechen geklickt hat.

{
  "action": "cohostOverlay",
  "target": "cohost-overlay",
  "meta": {
    "command": "say",
    "text": "The line the avatar should say",
    "speak": true,
    "emotion": "happy"
  }
}

Verfügbare Aktionen

Aktion Erfordert Ergebnis
Im Co-Host vorlesen Verbunden cohost-overlay.html Liest die ausgewählte Chatnachricht im Overlay vor.
Antwort Privater Chatbot + konfiguriertes LLM oder gehostetes Test-LLM Erstellt einen kurzen Antwortentwurf zur Freigabe durch den Streamer.
Leichter Roast Privater Chatbot + konfiguriertes LLM oder gehostetes Test-LLM Erstellt einen kurzen, spielerischen und jugendfreien Entwurf zur Freigabe durch den Streamer.
Sprechen Entwurf im Freigabebereich Sendet den freigegebenen Text an das KI-Bühnen-Overlay.
Kopieren Entwurf im Freigabebereich Kopiert den Entwurf, ohne ihn an das Overlay zu senden.

Status und Fehlerbehebung

  • Wenn das Co-Host-Menü fehlt, wird das Co-Host-Overlay in derselben Sitzung nicht erkannt.
  • Wenn Antwort oder Leichter Roast deaktiviert ist, ist die SSN-Brücke oder der private Chatbot nicht verfügbar.
  • Der Overlay-Schalter des primären Chatbots ist optional und aktiviert keine Co-Host-Rechtsklickaktionen im Dock.
  • Wenn cohost.html keinen Chat sieht, prüfe, ob die URL dieselbe session wie das Popup verwendet und Livechat auf Kontext, Fragen oder Alle eingestellt ist.
  • Nur Kontext teilt den Chat derzeit nur bei OpenAI Realtime mit der KI. Andere Anbieter beobachten den Feed, ohne ihn in das Modell einzuspeisen.
  • Mikrofon stummschalten stoppt Audio, das an den Co-Host gesendet wird. Co-Host-Stimme stummschalten, der Lautstärkeregler, die Auswahl des Ausgabegeräts und Sprechen beenden steuern die Wiedergabe. Geteiltes Systemaudio stummschalten ist getrennt und erscheint bei Anbietern mit Bildschirmunterstützung.
  • Wenn ein Stream-Werkzeug nicht verfügbar ist, aktiviere es sowohl im SSN-Popup als auch in Stream-Steuerung des Co-Hosts. Für OBS muss außerdem mindestens ein exakter Szenenname in der Freigabeliste stehen.
  • Verwende Overlay testen um eine harmlose sichtbare Testzeile zu senden. Prüfe anschließend, ob sie im KI-Bühnen-Overlay in OBS erscheint.
  • Wenn der Co-Host den Chat kennt, aber schweigt, ist das im Modus Nur Kontext: Frage, was der Chat sagt. Fragen oder Alle sprechen automatische Antworten auf der Co-Host-Seite; sie veröffentlichen diese Antworten nicht im YouTube-, Twitch- oder Kick-Chat.
  • Wenn die Desktop-App Hört zu (Desktop Whisper) , aber nie Gehört, prüfe, ob das ausgewählte Mikrofon nicht stummgeschaltet ist, und warte auf den ersten Modell-Download.
  • Wenn Chrome nie Gehört, erlaube den Mikrofonzugriff, prüfe das Standardmikrofon des Betriebssystems, bestätige den Internetzugang und die Verfügbarkeit der Chrome-Spracherkennung.
  • Wenn OpenAI-Realtime-Text erscheint, aber kein Audio spielt, prüfe Audioantwort, die Audioberechtigungen des Browsers und die Browser- oder App-Audioerfassung von OBS. Verwende &tts nur für den separaten Text-Overlay-Ablauf.
  • Wenn OpenAI-Realtime-Antworten langsam sind, probiere Mini, niedriges Reasoning und schnellen Sprecherwechsel und vergleiche dann die Latenzzeile in Diagnostik. Höheres Reasoning und geduldiger Sprecherwechsel tauschen bewusst Geschwindigkeit gegen Tiefe oder längere Pausen.
  • Wenn OpenAI Realtime die Verbindung verliert, lasse den Co-Host laufen, während er es erneut versucht. Diagnostik zeigt Fehler bei Daten, Peer, Anbieter oder Zustandsprüfung. Eine wiederhergestellte Sitzung behält Systemanweisungen und Leistungseinstellungen, kann aber das vorherige gesprochene Gespräch nicht zurückholen.
  • Wenn eine Anfrage für Antwort, Leichter Roast oder SSN Configured LLM abläuft, prüfe, ob Social Stream eingeschaltet ist, die Sitzung stimmt, der private Chatbot aktiviert ist und der gewählte LLM-Anbieter erreichbar ist. OpenAI Realtime benötigt den privaten Chatbot nicht.
  • Wenn Local Gemma seine Modelldateien nicht vom Standardhost herunterladen kann, stelle den Ressourcenhost auf deinen eigenen gespiegelten Gemma-Ordner um.
  • Wenn die gehostete Test-KI nicht mehr antwortet, kann sie deaktiviert oder begrenzt sein. Wechsle zu deinem eigenen Token, Ollama oder Custom API.
  • Wenn mehrere Overlays geöffnet sind, muss das Overlay-Label zum Dock-Ziel passen. Das Standard-Label ist cohost-overlay.

Nützliche URL-Parameter

  • session=YOUR_SESSION_ID – erforderlich, damit Dock und Overlay denselben Raum nutzen.
  • tts oder speak=1 – lässt das Overlay mit Browser-TTS sprechen.
  • forcetts – erlaubt Overlay-TTS, auch wenn die Co-Host-Steuerung bereits Audio wiedergibt; dadurch entsteht absichtlich eine zweite Stimme.
  • label=cohost-overlay – legt das Ziel-Label des Overlays fest.
  • name=NinjaBot – legt den Anzeigenamen im Overlay fest.
  • avatar=https://... – verwendet ein eigenes Avatarbild.
  • position=bottom-right – steuert die Position auf der Bühne.
  • scale=1.2 – skaliert das Overlay.
  • status – zeigt Verbindungs- und Statustext im Overlay.

Hinweise zum Aufbau

  • Für Dock- und manuelle Textabläufe ist das Overlay die Quelle für Bild und optionales TTS. Erfasse für die native OpenAI-Stimme cohost.html Audio separat; das Bühnen-Overlay spielt denselben WebRTC-Ton nicht erneut ab.
  • Das Dock ist die Bedienoberfläche; die Freigabe durch den Streamer bleibt somit außerhalb der Übertragung.
  • Generierte Antworten werden nicht automatisch gesprochen; der Streamer muss sie zuerst freigeben.
  • Nicht standardmäßige Befehlsdetails stehen in meta, damit die Daten für Overlays und Automatisierungen berechenbar bleiben.