Guide de configuration de la synthèse vocale

Écoutez votre chat en trois étapes. Commencez gratuitement, sans compte ni clé API.

1. Activer la lecture du chat

Aucun chat connecté pour le moment ? Commencez ici : installez SSN, ajoutez votre source et ouvrez le dock.

Ouvrez : panneau de l’extension SSN ou le panneau de l’application de bureau Sources et paramètres.

Sous Incrustation principale du chat et Dock de contrôle, développez Message — Synthèse vocale. Activez l’interrupteur affiché ici :

Panneau réel : Message — Text to Speech, avec Enable TTS in dock activé
Interrupteur bleu = lecture du chat activée.

2. Choisir une voix gratuite

Dans la même section, faites défiler jusqu’à Fournisseur de synthèse vocale. Choisissez Piper TTS, puis une voix.

Panneau réel : Piper TTS sélectionné, avec la voix English US Female HFC Medium
Piper ne nécessite ni compte ni clé API. Prévoyez du temps pour le premier téléchargement de voix.

Utilisez copier le lien à côté de Incrustation principale du chat et Dock de contrôle pour obtenir le lien mis à jour.

3. La diffuser dans OBS

  1. Ajoutez dans OBS une Source navigateur et collez ce lien.
  2. Activer Contrôler l’audio via OBS dans ses propriétés.
  3. Envoyez un message de chat. Vérifiez le niveau audio de la source, puis effectuez un court enregistrement.

Vous souhaitez aussi l’entendre ? Dans les propriétés audio avancées d’OBS, choisissez Monitoring et sortie pour cette source. Ne gardez qu’une instance lisant le chat.

Écouter les voix gratuites

Vous préférez un autre son ? Ces quatre voix sont gratuites. Lancez la lecture pour les comparer.

Piper

Anglais américain féminin (HFC), qualité moyenne.
en_US-hfc_female-medium

Voir les paramètres et les voix

Kokoro

Bella, femme américaine. Testée sur CPU/WASM, q8.
af_bella

Voir les paramètres et les voix

Kitten

Voix 4, femme. Modèle intégré nano v0.1.
expr-voice-4-f

Voir les paramètres et les voix

eSpeak

Anglais. Une voix synthétique peu volumineuse.
en

Voir les paramètres et les voix

Extraits en espagnol et portugais

Choisissez une langue au-dessus de la liste des voix dans les paramètres SSN, puis utilisez Test. Piper propose l’Espagne, le Mexique, le Brésil et le Portugal ; Kokoro ajoute trois voix espagnoles et trois voix portugaises brésiliennes.

Piper - Espagnol (Espagne)

DaveFX

Kokoro - Espagnol

Dora

Piper - Portugais (Brésil)

Faber

Kokoro - Portugais (Brésil)

Dora

Synthèse locale gratuite, avec un téléchargement initial. Les extraits excluent le temps de chargement. Piper est le point de départ le plus léger ; Kokoro peut être lent sur CPU. Utilisez Piper si la lecture prend du retard sur le chat.

Texte des extraits et détails des tests

Les quatre extraits anglais lisent : Bienvenue sur le direct ! Merci d’être avec nous. À quel jeu devrions-nous jouer ensuite ? La lecture des noms est désactivée.

Vérifié le 7 septembre 2026 dans OBS 32.2.2 sous Windows 11 : un message a atteint le véritable dock, généré de la parole, fait bouger l’indicateur de la source Navigateur et figuré dans un enregistrement. Kokoro a mis nettement plus de temps à commencer dans ce test sur CPU. Ces extraits présentent la voix, pas le temps d’attente.

La synthèse vocale système proposait cinq voix sur cette machine, mais n’a produit aucun son dans l’enregistrement de la source Navigateur. Ce résultat est propre à cette configuration ; testez toujours votre URL finale et l’enregistrement. Les voix cloud sont absentes des tests car aucun identifiant payant n’a été utilisé.

Besoin d’aide ?

Ma plateforme de chat prend-elle en charge la synthèse vocale ?

Si SSN reçoit le chat sous forme de texte, il peut le lire à voix haute. YouTube, Twitch, TikTok et les autres sources utilisent la même fonction. Votre plateforme de chat n’a pas besoin de sa propre synthèse vocale.

Aucune voix ?

Vérifiez que le dock reçoit le chat, puis l’interrupteur de synthèse vocale, le fournisseur et les filtres. Utilisez le nouveau lien copié. Laissez le premier téléchargement du modèle se terminer.

Cela fonctionne dans Chrome/Edge, mais pas OBS ?

OBS possède un navigateur et une liste de voix distincts. La synthèse système peut ne pas y fonctionner, même si des voix sont répertoriées. Essayez Piper, Kokoro, Kitten ou eSpeak. Un câble audio virtuel ne corrige pas l’absence de parole générée.

Le niveau bouge, mais l’enregistrement est muet ?

Vérifiez le mode muet et l’affectation des pistes d’enregistrement dans OBS. Utilisez Surveillance et sortie si vous voulez aussi l’entendre ; évitez de capturer cette sortie de surveillance une deuxième fois. Guide audio OBS.

Puis-je utiliser un dock OBS ou Featured Chat à la place ?

Un dock de navigateur personnalisé OBS est un panneau de contrôle, pas la source Navigateur de scène utilisée ci-dessus. Pour Featured Chat, activez la synthèse vocale dans les options propres à cette incrustation et copiez son lien. Ne gardez qu’une page qui parle pour éviter les voix en double.

Comparer tous les fournisseurs : prérequis, coût et compromis

Commencez par Piper pour une voix locale gratuite, ou comparez Kokoro si vous préférez son timbre. Essayez eSpeak si la réactivité compte davantage que le réalisme. Kitten est une autre option anglaise compacte. Écoutez avant de choisir.

FournisseurAdapté àCompromisPrérequis / coût
KokoroVoix anglaises, espagnoles et portugaises brésiliennes.Plus de calculs CPU ; le début de la première lecture peut être lent.Gratuit, sans clé. Télécharge les ressources du modèle/des voix ; CPU ou WebGPU compatible.
PiperVoix neuronales locales ; options en anglais, espagnol et portugais.La qualité et la prononciation varient selon la voix.Gratuit, sans clé. Télécharge le modèle sélectionné, environ 63 Mo pour HFC medium, plus les fichiers du moteur.
KittenModèle anglais compact, huit voix au choix.Moins de langues et de styles de voix.Gratuit, sans clé. Modèle actuellement intégré : environ 24 Mo, plus les fichiers du moteur/des voix ; CPU.
eSpeakLéger, multilingue et rapide à démarrer.Son volontairement synthétique/robotique.Gratuit, sans clé. Charge les fichiers intégrés du moteur/des langues ; aucun modèle neuronal ni GPU nécessaire.
Synthèse vocale systèmeUtilise les voix exposées par votre navigateur ou application de bureau.La liste des voix et la capture OBS varient ; certaines voix nécessitent Internet.Aucun frais de fournisseur SSN. Nécessite une voix système/navigateur fonctionnelle ; testez sur la page de lecture réelle.
ElevenLabsIdentifiants de voix, sélection du modèle et contrôles de stabilité/style.Des limites de compte, délais réseau et frais API peuvent s’appliquer.Internet, clé API et identifiant de voix accessible. Le texte du chat est envoyé au fournisseur.
Google CloudVoix nommées et contrôles de langue, vitesse et hauteur.Toutes les voix ne prennent pas en charge tous les contrôles.Internet, API Cloud TTS activée, clé API et voix/langue correspondantes. Facturation/quota applicables.
GeminiStyles de voix et instructions écrites d’interprétation.Les modèles en aperçu et les quotas peuvent changer ; la latence varie.Internet, clé API Gemini et accès au modèle de synthèse vocale choisi. Vérifiez les limites/la facturation du compte.
SpeechifyIdentifiant de voix avec contrôles de vitesse, langue et modèle.Nécessite un accès API ; les voix disponibles dépendent du compte.Internet et clé API Speechify. Les conditions et limites d’utilisation API s’appliquent.
OpenAIVoix nommées avec contrôles du modèle et du format.Facturation API et Internet requis ; l’abonnement au compte est distinct.Clé API avec accès à la synthèse vocale. Le texte du chat est envoyé au point d’accès configuré.
Personnalisé / LocalUtilisez votre propre serveur vocal compatible.Configuration la plus exigeante : point d’accès, modèle, voix et accès du navigateur doivent correspondre.Un point d’accès de synthèse vocale compatible OpenAI et accessible ; une clé si nécessaire. Le coût du matériel local ou de l’hébergement varie.

Les tailles de téléchargement ci-dessus concernent les fichiers de modèle, pas la mémoire totale utilisée ni toutes les ressources requises. Les fournisseurs locaux utilisent l’ordinateur exécutant le dock/l’incrustation ; la première utilisation peut être plus lente et OBS possède son propre cache. Les fournisseurs cloud réduisent les calculs locaux mais envoient le texte hors de l’appareil.

OBS : les quatre fournisseurs locaux ci-dessous ont réussi les tests d’enregistrement de source Navigateur. Les fournisseurs cloud/personnalisés renvoient du son à lire par la page, mais n’ont pas été testés avec des comptes réels dans cette vérification. La synthèse système nécessite un test distinct même si elle répertorie des voix.

Paramètres des fournisseurs et noms des voix

Véritables paramètres de l’application de bureau, capturés avec un profil neuf. Ouvrez le fournisseur souhaité ; les champs de clés API sont volontairement vides. Ces contrôles configurent le dock ou l’incrustation SSN sélectionné. Sélectionnez une capture pour l’afficher en taille réelle.

Synthèse vocale système

La liste des langues est vide dans ce profil neuf. Les voix disponibles dépendent du navigateur/de l’application et des voix installées ; SSN n’a pas de liste universelle de voix.

Véritables paramètres du fournisseur de synthèse vocale système de SSN
Kokoro

Choisissez une voix dans SSN ; le modèle se charge dans la page qui parle. La sélection comprend l’anglais américain/britannique, l’espagnol et le portugais brésilien. Utilisez le filtre de langue pour trouver des voix ; Test lit une courte phrase dans la langue choisie. Pour réduire la charge CPU, essayez Piper.

Véritables paramètres du fournisseur Kokoro de SSN
Noms des voix et valeurs d’URL
  • Heart (femme américaine) — af_heart
  • Alloy (femme américaine) — af_alloy
  • Aoede (femme américaine) — af_aoede
  • Bella (femme américaine) — af_bella
  • Jessica (femme américaine) — af_jessica
  • Kore (femme américaine) — af_kore
  • Nicole (femme américaine) — af_nicole
  • Nova (femme américaine) — af_nova
  • River (femme américaine) — af_river
  • Sarah (femme américaine) — af_sarah
  • Sky (femme américaine) — af_sky
  • Adam (homme américain) — am_adam
  • Echo (homme américain) — am_echo
  • Eric (homme américain) — am_eric
  • Fenrir (homme américain) — am_fenrir
  • Liam (homme américain) — am_liam
  • Michael (homme américain) — am_michael
  • Onyx (homme américain) — am_onyx
  • Puck (homme américain) — am_puck
  • Santa (homme américain) — am_santa
  • Emma (femme britannique) — bf_emma
  • Isabella (femme britannique) — bf_isabella
  • George (homme britannique) — bm_george
  • Lewis (homme britannique) — bm_lewis
  • Alice (femme britannique) — bf_alice
  • Lily (femme britannique) — bf_lily
  • Daniel (homme britannique) — bm_daniel
  • Fable (homme britannique) — bm_fable
  • Dora (espagnol) - ef_dora
  • Alex (espagnol) - em_alex
  • Santa (espagnol) - em_santa
  • Dora (portugais brésilien) - pf_dora
  • Alex (portugais brésilien) - pm_alex
  • Santa (portugais brésilien) - pm_santa
Kitten

Huit voix anglaises : variantes masculines et féminines numérotées 2, 3, 4 et 5. L’extrait utilise Voice 4 (Female).

Véritables paramètres du fournisseur Kitten de SSN
Noms des voix et valeurs d’URL
  • Voix 2 (homme) — expr-voice-2-m
  • Voix 2 (femme) — expr-voice-2-f
  • Voix 3 (homme) — expr-voice-3-m
  • Voix 3 (femme) — expr-voice-3-f
  • Voix 4 (homme) — expr-voice-4-m
  • Voix 4 (femme) — expr-voice-4-f
  • Voix 5 (homme) — expr-voice-5-m
  • Voix 5 (femme) — expr-voice-5-f
Piper

Choisissez une langue et un modèle correspondants. L’exemple utilise HFC medium. Un simple réglage de langue ne traduit pas une voix.

Véritables paramètres du fournisseur Piper de SSN
Noms des voix et valeurs d’URL
  • Anglais américain féminin (HFC) - Moyen — en_US-hfc_female-medium
  • Espagnol d’Espagne (DaveFX) - Moyen — es_ES-davefx-medium
  • Espagnol du Mexique (Ald) - Moyen — es_MX-ald-medium
  • Portugais brésilien (Faber) - Moyen — pt_BR-faber-medium
  • Portugais brésilien (Edresson) - Faible — pt_BR-edresson-low
  • Portugais du Portugal (Tugao) - Moyen — pt_PT-tugão-medium
eSpeak

Choisissez une voix dans la langue voulue et ajustez éventuellement la vitesse. Ce moteur produit volontairement un son robotique.

Véritables paramètres du fournisseur eSpeak de SSN
Noms des voix et valeurs d’URL
  • Anglais — en
  • Espagnol — es
  • Portugais du Brésil — pt-br
  • Portugais du Portugal — pt-pt
ElevenLabs

Saisissez votre clé API, puis utilisez List My Available Voices pour trouver un identifiant de voix accessible à votre compte. Référence des fournisseurs.

Véritables paramètres du fournisseur ElevenLabs de SSN
Google Cloud

Saisissez une clé API Google Cloud TTS et le nom exact de la voix, avec la langue correspondante. Noms des voix et contrôles pris en charge.

Véritables paramètres du fournisseur Google Cloud de SSN
Gemini

Sélectionnez un modèle et une voix de synthèse vocale pris en charge ; les instructions de style modifient l’interprétation. Il s’agit des paramètres de l’API Gemini, distincts de Google Cloud TTS. Exemples de voix et prérequis.

Véritables paramètres du fournisseur Gemini de SSN
Fish Audio

Sélectionnez Fish Audio dans le menu du fournisseur de synthèse vocale pour le dock de chat, l’incrustation Featured, la page TTS ou Flow Actions. Saisissez votre propre Clé API Fish Audio, puis utilisez le bouton Test TTS existant. Un identifiant de voix facultatif choisit une voix depuis Fish Audio; copiez l’identifiant du modèle de voix, pas son nom ni l’URL de sa page. Laissez ce champ vide pour utiliser la voix par défaut du service.

Les options avancées comprennent le modèle et la vitesse de parole (0.5–2). SSN utilise par défaut s2.1-pro-free; la disponibilité de l’offre gratuite et les conditions d’usage raisonnable sont définies par Fish Audio. Les modèles payants nécessitent du crédit sur le compte. SSN ne réessaie pas une requête gratuite échouée avec un modèle payant. Utilisez Plus d’options de synthèse vocale pour le volume des spectateurs. Le texte est envoyé à Fish Audio et la langue est détectée par le service.

Configuration OBS / navigateur : Exécutez le pont local de synthèse vocale existant de SSN en mode Fish sur l’ordinateur OBS. Définissez sa variable d’environnement SSN_TTS_TARGET_BEARER sur votre clé API Fish et démarrez node scripts/local-tts-bridge.cjs --mode fish. Dans le panneau Fish Audio, définissez URL du pont OBS / navigateur (OBS / browser bridge URL) à http://127.0.0.1:8124/v1/audio/speech; collez le jeton du pont local affiché dans le terminal dans le champ du panneau Clé API . Le jeton change au redémarrage sauf si vous définissez SSN_TTS_BRIDGE_TOKEN sur un secret aléatoire long ; gardez privés les liens d’incrustation contenant un jeton. Laissez le pont fonctionner, testez la voix et utilisez l’URL d’incrustation générée dans OBS. Activez Contrôler l’audio via OBS dans les paramètres de la source Navigateur si vous souhaitez son audio dans le mixeur OBS. Les requêtes Fish directes depuis des pages hébergées n’ont pas l’autorisation CORS ; le pont fournit une réponse audio accessible au navigateur.

Avec le pont, ajoutez &fishendpoint=http%3A%2F%2F127.0.0.1%3A8124%2Fv1%2Faudio%2Fspeech à l’URL et omettez fishkey lorsque le pont conserve la clé.

Paramètres d’URL : &ttsprovider=fish&fishkey=YOUR_KEY&voicefish=VOICE_ID&fishmodel=s2.1-pro-free&fishspeed=1. Activez la synthèse vocale avec les contrôles habituels. Gardez privés les liens générés contenant votre clé. Le remplacement de voix existant de Speak Text dans Event Flow accepte un identifiant Fish si la page destinataire utilise Fish Audio.

Référence API Fish Audio · Annonce et conditions du modèle gratuit

Speechify

Guide Speechify détaillé : clé API, voix, vitesse et volume pour les spectateurs.

Saisissez la clé API et l’identifiant de voix de votre compte API Speechify. Configuration du fournisseur.

Véritables paramètres du fournisseur Speechify de SSN
OpenAI

Choisissez une voix/un modèle pris en charge et saisissez une clé API. Un abonnement ChatGPT ne fournit pas de crédits API. Conservez le point d’accès par défaut pour OpenAI.

Véritables paramètres du fournisseur OpenAI de SSN
Synthèse vocale personnalisée / locale (Custom / Local TTS)

Cette option réutilise les contrôles compatibles OpenAI ; le titre indique donc encore OpenAI. Saisissez le point d’accès de votre serveur et la voix/le modèle qu’il prend en charge ; l’authentification dépend du serveur. Consultez le guide du serveur local.

Véritables paramètres du fournisseur de synthèse vocale personnalisé/local de SSN
Avancé : modifier manuellement une URL de synthèse vocale

Bons premiers tests :

dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=kokoro
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=piper
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=kitten

Pour le portugais ou l’espagnol, commencez plutôt par l’une de ces voix :

dock.html?session=YOUR_SESSION&speech=pt-BR&ttsprovider=piper&pipervoice=pt_BR-faber-medium
dock.html?session=YOUR_SESSION&speech=pt-BR&ttsprovider=espeak&espeakvoice=pt-br
dock.html?session=YOUR_SESSION&speech=es-ES&ttsprovider=piper&pipervoice=es_ES-davefx-medium
dock.html?session=YOUR_SESSION&speech=es-ES&ttsprovider=espeak&espeakvoice=es

Référence complète de la synthèse vocale · Guide du serveur local de synthèse vocale

Avancé : exécuter votre propre serveur local de synthèse vocale

Un serveur local de synthèse vocale est utile pour des voix privées, un modèle précis ou un serveur comme Kokoro-FastAPI ou openedai-speech. La page diffusant la voix doit pouvoir atteindre le point d’accès.

Schéma montrant une source Navigateur OBS envoyant des demandes vocales via le pont local de synthèse vocale Social Stream Ninja vers un serveur de synthèse vocale
Pour OBS, le pont local fonctionne généralement mieux sur le même ordinateur qu’OBS.
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=customtts&openaiendpoint=http://127.0.0.1:8124/v1/audio/speech&voiceopenai=af_bella

localhost désigne l’ordinateur exécutant la page. Si votre serveur vocal se trouve sur un autre ordinateur, utilisez son adresse IP locale ou exécutez le pont sur l’ordinateur OBS.