دليل إعداد تحويل النص إلى كلام

اسمع دردشتك في ثلاث خطوات. ابدأ مجانًا، دون حساب أو مفتاح API.

1. تفعيل قراءة الدردشة

لم توصل الدردشة بعد؟ ابدأ هنا: ثبّت SSN وأضف مصدرك وافتح لوحة الإرساء.

افتح النافذة المنبثقة لإضافة SSN أو، في تطبيق سطح المكتب، افتح المصادر والإعدادات.

ضمن تراكب الدردشة الرئيسي ولوحة التحكم، وسّع الرسائل — تحويل النص إلى كلام (Message — Text to Speech). فعّل المفتاح الموضح هنا:

النافذة المنبثقة الفعلية: Message — Text to Speech مع تفعيل Enable TTS in dock
المفتاح الأزرق = قراءة الدردشة مفعلة.

2. اختيار صوت مجاني

في القسم نفسه، مرّر إلى مزود خدمة TTS. اختر Piper TTS، ثم صوتًا.

النافذة المنبثقة الفعلية: اختيار Piper TTS بصوت English US Female HFC Medium
لا يحتاج Piper إلى حساب أو مفتاح API. امنح تنزيل الصوت الأول وقتًا كافيًا.

استخدم نسخ الرابط بجوار تراكب الدردشة الرئيسي ولوحة التحكم للحصول على رابطك المحدّث.

3. تشغيله في OBS

  1. أضف في OBS مصدر المتصفح والصق ذلك الرابط.
  2. تفعيل التحكم بالصوت عبر OBS (Control audio via OBS) في خصائصه.
  3. أرسل رسالة دردشة. افحص مقياس صوت المصدر، ثم سجّل مقطعًا قصيرًا.

تريد سماعه بنفسك؟ في Advanced Audio Properties في OBS، اختر المراقبة والإخراج (Monitor and Output) لذلك المصدر. أبقِ نسخة واحدة فقط تقرأ الدردشة.

الاستماع إلى الأصوات المجانية

تفضّل صوتًا آخر؟ هذه الأصوات الأربعة مجانية. اضغط التشغيل للمقارنة.

Piper

أنثى إنجليزية أمريكية (HFC)، جودة متوسطة.
en_US-hfc_female-medium

عرض الإعدادات والأصوات

Kokoro

Bella، أنثى أمريكية. اختُبرت باستخدام CPU/WASM وq8.
af_bella

عرض الإعدادات والأصوات

Kitten

الصوت 4، أنثى. نموذج nano v0.1 المضمّن.
expr-voice-4-f

عرض الإعدادات والأصوات

eSpeak

الإنجليزية. صوت اصطناعي قليل المتطلبات.
en

عرض الإعدادات والأصوات

عينات بالإسبانية والبرتغالية

اختر لغة فوق قائمة الأصوات في إعدادات SSN، ثم استخدم اختبار. يوفر Piper أصواتًا لإسبانيا والمكسيك والبرازيل والبرتغال؛ ويضيف Kokoro ثلاثة أصوات إسبانية وثلاثة بالبرتغالية البرازيلية.

Piper - الإسبانية (إسبانيا)

DaveFX

Kokoro - الإسبانية

Dora

Piper - البرتغالية (البرازيل)

Faber

Kokoro - البرتغالية (البرازيل)

Dora

توليد محلي مجاني مع تنزيل أولي. لا تشمل العينات وقت التحميل. Piper نقطة البداية الأخف؛ وقد يكون Kokoro بطيئًا على CPU. استخدم Piper إذا تأخر الكلام عن الدردشة.

نصوص العينات وتفاصيل الاختبار

تقرأ العينات الإنجليزية الأربع: مرحبًا بكم في البث! شكرًا لانضمامكم إلينا. أي لعبة ينبغي أن نلعب بعد ذلك؟ قراءة الأسماء معطلة.

جرى التحقق في 7 سبتمبر 2026 في OBS 32.2.2 على Windows 11: وصلت رسالة دردشة إلى لوحة الإرساء الفعلية، وولّدت كلامًا، وحركت مقياس مصدر المتصفح، وظهرت في تسجيل. استغرق Kokoro وقتًا أطول ملحوظًا لبدء الكلام في اختبار CPU هذا. تعاين هذه المقاطع الصوت، لا وقت الانتظار.

أظهر تحويل النص إلى كلام في النظام خمسة أصوات على هذا الجهاز لكنه لم ينتج صوتًا في تسجيل مصدر المتصفح. هذه النتيجة خاصة بهذا الإعداد؛ اختبر دائمًا رابطك النهائي والتسجيل. لا تتضمن المقارنة أصواتًا سحابية لأننا لم نستخدم بيانات اعتماد مدفوعة.

تحتاج إلى مساعدة؟

هل تدعم منصة الدردشة لدي تحويل النص إلى كلام؟

إذا استقبل SSN الدردشة كنص، فيمكنه قراءتها بصوت مسموع. تستخدم YouTube وTwitch وTikTok والمصادر الأخرى الميزة نفسها. لا تحتاج منصة الدردشة إلى دعم تحويل النص إلى كلام خاص بها.

لا يوجد كلام؟

تأكد من استقبال لوحة الإرساء للدردشة، ثم تحقق من مفتاح تحويل النص إلى كلام والمزود وعوامل التصفية. استخدم الرابط المنسوخ حديثًا. انتظر انتهاء تنزيل النموذج الأول.

يعمل في Chrome/Edge لكن لا يعمل في OBS؟

لدى OBS متصفح وقائمة أصوات منفصلان. قد لا يعمل تحويل النص إلى كلام في النظام هناك، حتى إذا سرد أصواتًا. جرّب Piper أو Kokoro أو Kitten أو eSpeak. لا يستطيع كابل صوت افتراضي إصلاح غياب الكلام.

المقياس يتحرك لكن التسجيل صامت؟

تحقق من الكتم وتعيينات مسارات التسجيل في OBS. استخدم Monitor and Output إذا أردت سماعه أيضًا؛ وتجنب التقاط مخرج المراقبة ذلك مرة ثانية. دليل صوت OBS.

هل يمكنني استخدام لوحة OBS أو Featured Chat بدلًا من ذلك؟

لوحة Custom Browser Dock في OBS لوحة تحكم وليست مصدر متصفح المشهد المستخدم أعلاه. لـFeatured Chat، فعّل تحويل النص إلى كلام في خيارات النافذة المنبثقة الخاصة بذلك التراكب وانسخ رابطه. أبقِ صفحة واحدة تنطق لتجنب تضاعف الأصوات.

مقارنة جميع المزودين: المتطلبات والتكلفة والمقايضات

ابدأ بـPiper لصوت محلي مجاني، أو قارن Kokoro إذا فضّلت صوته. جرّب eSpeak عندما تكون الاستجابة أهم من الواقعية. Kitten خيار إنجليزي مدمج آخر. استمع قبل أن تقرر.

المزودمناسب لـالمقايضةالمتطلبات / التكلفة
Kokoroأصوات إنجليزية وإسبانية وبرتغالية برازيلية.عمل أكثر على CPU؛ وقد يتأخر أول كلام.مجاني دون مفتاح. ينزّل ملفات النموذج والصوت؛ يعمل على CPU أو WebGPU مدعوم.
Piperأصوات عصبية محلية؛ وخيارات إنجليزية وإسبانية وبرتغالية.تختلف الجودة والنطق باختلاف الصوت.مجاني دون مفتاح. ينزّل النموذج المحدد (HFC medium: نحو 63 MB)، إضافة إلى ملفات المحرك.
Kittenنموذج إنجليزي مدمج وثمانية خيارات أصوات.لغات وأنماط أصوات أقل.مجاني دون مفتاح. النموذج المضمّن الحالي: نحو 24 MB، إضافة إلى ملفات المحرك والأصوات؛ يعمل على CPU.
eSpeakخفيف ويدعم لغات عديدة وسريع البدء.صوت اصطناعي أو آلي عمدًا.مجاني دون مفتاح. يحمّل ملفات المحرك واللغة المضمّنة؛ لا يحتاج إلى نموذج عصبي أو GPU.
تحويل النص إلى كلام في النظاميستخدم الأصوات التي يتيحها متصفحك أو تطبيق سطح المكتب.تختلف قائمة الأصوات والتقاط OBS؛ وتحتاج بعض الأصوات إلى الإنترنت.لا توجد رسوم مزود لـSSN. يتطلب صوت نظام أو متصفح يعمل؛ اختبر في صفحة التشغيل الفعلية.
ElevenLabsمعرّفات أصوات واختيار النموذج وعناصر تحكم بالثبات والأسلوب.قد تنطبق حدود الحساب وتأخير الشبكة ورسوم API.إنترنت ومفتاح API ومعرّف صوت متاح. يذهب نص الدردشة إلى المزود.
Google Cloudأصوات مسماة وعناصر تحكم باللغة والمعدل وطبقة الصوت.لا يدعم كل صوت جميع عناصر التحكم.إنترنت وCloud TTS API مفعّلة ومفتاح API وصوت ولغة متطابقان. تنطبق الفوترة والحصص.
Geminiأنماط أصوات وتعليمات إلقاء مكتوبة.قد تتغير النماذج التجريبية والحصص؛ ويختلف التأخير.إنترنت ومفتاح Gemini API ووصول إلى نموذج TTS المحدد. تحقق من حدود الحساب والفوترة.
Speechifyمعرّف صوت مع عناصر تحكم بالسرعة واللغة والنموذج.يتطلب وصول API؛ وتعتمد الأصوات المتاحة على الحساب.إنترنت ومفتاح Speechify API. تنطبق شروط استخدام API وحدوده.
OpenAIأصوات مسماة مع عناصر تحكم بالنموذج والتنسيق.يتطلب فوترة API واتصالًا بالإنترنت؛ اشتراك الحساب منفصل.مفتاح API مع وصول إلى تحويل النص إلى كلام. يُرسَل نص الدردشة إلى نقطة النهاية المُهيَّأة.
مخصص / محلياستخدم خادم الصوت المتوافق الخاص بك.الأكثر احتياجًا للإعداد: يجب توافق نقطة النهاية والنموذج والصوت ووصول المتصفح.نقطة نهاية كلام متوافقة مع OpenAI ويمكن الوصول إليها؛ ومفتاح عند الحاجة. تختلف تكاليف الأجهزة المحلية أو الاستضافة.

أحجام التنزيل أعلاه تخص ملفات النماذج، وليست إجمالي استهلاك الذاكرة أو كل الأصول المطلوبة. يستخدم المزودون المحليون الجهاز الذي يشغّل لوحة الإرساء أو التراكب؛ وقد يكون الاستخدام الأول أبطأ، ولدى OBS ذاكرته المؤقتة الخاصة. يوفر المزودون السحابيون المعالجة المحلية، لكنهم يرسلون النص خارج الجهاز.

OBS: اجتاز المزودون المحليون الأربعة أدناه اختبارات تسجيل مصدر المتصفح. يعيد المزودون السحابيون والمخصصون صوتًا لتشغّله الصفحة، لكن لم يُختبَروا بحسابات فعلية في هذه المراجعة. يحتاج تحويل النص إلى كلام في النظام إلى اختبار منفصل حتى عندما يسرد أصواتًا.

إعدادات المزودين وأسماء الأصوات

إعدادات تطبيق سطح المكتب الفعلية، التُقطت بملف شخصي جديد. افتح المزود المطلوب؛ حقول مفاتيح API فارغة عمدًا. تهيّئ هذه العناصر لوحة إرساء SSN أو التراكب المحدد. حدد لقطة شاشة لرؤيتها بحجمها الكامل.

تحويل النص إلى كلام في النظام

قائمة اللغات فارغة في هذا الملف الشخصي الجديد. تعتمد الأصوات المتاحة على المتصفح أو التطبيق والأصوات المثبتة؛ ولا توجد قائمة أصوات SSN موحدة.

إعدادات مزود System TTS الفعلية في SSN
Kokoro

اختر صوتًا في SSN؛ يُحمَّل النموذج في الصفحة التي تنطق. تشمل الخيارات الإنجليزية الأمريكية والبريطانية والإسبانية والبرتغالية البرازيلية. استخدم عامل تصفية اللغة للعثور على الأصوات؛ ويشغّل Test عبارة قصيرة باللغة المحددة. لاستهلاك CPU أقل، جرّب Piper.

إعدادات مزود Kokoro الفعلية في SSN
أسماء الأصوات وقيم URL
  • Heart (أنثى أمريكية) — af_heart
  • Alloy (أنثى أمريكية) — af_alloy
  • Aoede (أنثى أمريكية) — af_aoede
  • Bella (أنثى أمريكية) — af_bella
  • Jessica (أنثى أمريكية) — af_jessica
  • Kore (أنثى أمريكية) — af_kore
  • Nicole (أنثى أمريكية) — af_nicole
  • Nova (أنثى أمريكية) — af_nova
  • River (أنثى أمريكية) — af_river
  • Sarah (أنثى أمريكية) — af_sarah
  • Sky (أنثى أمريكية) — af_sky
  • Adam (ذكر أمريكي) — am_adam
  • Echo (ذكر أمريكي) — am_echo
  • Eric (ذكر أمريكي) — am_eric
  • Fenrir (ذكر أمريكي) — am_fenrir
  • Liam (ذكر أمريكي) — am_liam
  • Michael (ذكر أمريكي) — am_michael
  • Onyx (ذكر أمريكي) — am_onyx
  • Puck (ذكر أمريكي) — am_puck
  • Santa (ذكر أمريكي) — am_santa
  • Emma (أنثى بريطانية) — bf_emma
  • Isabella (أنثى بريطانية) — bf_isabella
  • George (ذكر بريطاني) — bm_george
  • Lewis (ذكر بريطاني) — bm_lewis
  • Alice (أنثى بريطانية) — bf_alice
  • Lily (أنثى بريطانية) — bf_lily
  • Daniel (ذكر بريطاني) — bm_daniel
  • Fable (ذكر بريطاني) — bm_fable
  • Dora (الإسبانية) - ef_dora
  • Alex (الإسبانية) - em_alex
  • Santa (الإسبانية) - em_santa
  • Dora (البرتغالية البرازيلية) - pf_dora
  • Alex (البرتغالية البرازيلية) - pm_alex
  • Santa (البرتغالية البرازيلية) - pm_santa
Kitten

ثمانية أصوات إنجليزية: أشكال ذكورية وأنثوية بالأرقام 2 و3 و4 و5. تستخدم العينة Voice 4 (Female).

إعدادات مزود Kitten الفعلية في SSN
أسماء الأصوات وقيم URL
  • الصوت 2 (ذكر) — expr-voice-2-m
  • الصوت 2 (أنثى) — expr-voice-2-f
  • الصوت 3 (ذكر) — expr-voice-3-m
  • الصوت 3 (أنثى) — expr-voice-3-f
  • الصوت 4 (ذكر) — expr-voice-4-m
  • الصوت 4 (أنثى) — expr-voice-4-f
  • الصوت 5 (ذكر) — expr-voice-5-m
  • الصوت 5 (أنثى) — expr-voice-5-f
Piper

اختر لغة ونموذجًا متطابقين. تستخدم العينة HFC medium. إعداد اللغة وحده لا يترجم الصوت.

إعدادات مزود Piper الفعلية في SSN
أسماء الأصوات وقيم URL
  • أنثى إنجليزية أمريكية (HFC) - جودة متوسطة — en_US-hfc_female-medium
  • الإسبانية الأوروبية (DaveFX) - جودة متوسطة — es_ES-davefx-medium
  • الإسبانية المكسيكية (Ald) - جودة متوسطة — es_MX-ald-medium
  • البرتغالية البرازيلية (Faber) - جودة متوسطة — pt_BR-faber-medium
  • البرتغالية البرازيلية (Edresson) - جودة منخفضة — pt_BR-edresson-low
  • البرتغالية الأوروبية (Tugao) - جودة متوسطة — pt_PT-tugão-medium
eSpeak

اختر صوتًا للغة، ويمكنك ضبط معدل الكلام. صوت هذا المحرك آلي عن قصد.

إعدادات مزود eSpeak الفعلية في SSN
أسماء الأصوات وقيم URL
  • الإنجليزية — en
  • الإسبانية — es
  • البرتغالية البرازيلية — pt-br
  • البرتغالية الأوروبية — pt-pt
ElevenLabs

أدخل مفتاح API، ثم استخدم List My Available Voices للعثور على معرّف صوت يستطيع حسابك استخدامه. مرجع المزودين.

إعدادات مزود ElevenLabs الفعلية في SSN
Google Cloud

أدخل مفتاح Google Cloud TTS API واسم الصوت الدقيق مع لغته المطابقة. أسماء الأصوات وعناصر التحكم المدعومة.

إعدادات مزود Google Cloud الفعلية في SSN
Gemini

اختر نموذجًا وصوتًا مدعومين لتحويل النص إلى كلام؛ تغير تعليمات الأسلوب طريقة الإلقاء. هذه إعدادات Gemini API، وهي منفصلة عن Google Cloud TTS. أمثلة الأصوات ومتطلباتها.

إعدادات مزود Gemini الفعلية في SSN
Fish Audio

اختر Fish Audio في قائمة مزود تحويل النص إلى كلام للوحة إرساء الدردشة أو تراكب الرسالة المميزة أو صفحة TTS أو Flow Actions. أدخل مفتاح Fish Audio API، ثم استخدم زر Test TTS الموجود. يحدد Voice ID الاختياري صوتًا من Fish Audio؛ انسخ معرّف نموذج الصوت، لا اسمه أو رابط صفحته. اتركه فارغًا لاستخدام صوت الخدمة الافتراضي.

تشمل الخيارات المتقدمة النموذج ومعدل الكلام (0.5–2). يستخدم SSN افتراضيًا s2.1-pro-free؛ تتحكم Fish Audio في توفر الخطة المجانية وشروط الاستخدام العادل. تتطلب النماذج المدفوعة رصيدًا في الحساب. لا يعيد SSN محاولة طلب مجاني فاشل بنموذج مدفوع. استخدم More TTS options لمستوى الصوت للمشاهدين. يُرسَل النص إلى Fish Audio، وتكتشف الخدمة اللغة.

إعداد OBS / المتصفح: شغّل جسر تحويل النص إلى كلام المحلي بوضع Fish الحالي في SSN على جهاز OBS. اضبط متغير البيئة SSN_TTS_TARGET_BEARER على مفتاح Fish API الخاص بك، ثم شغّل node scripts/local-tts-bridge.cjs --mode fish. في لوحة Fish Audio، اضبط رابط جسر OBS / المتصفح إلى http://127.0.0.1:8124/v1/audio/speech؛ الصق رمز الجسر المحلي المطبوع في الطرفية في حقل مفتاح API في النافذة المنبثقة. يتغير الرمز عند إعادة التشغيل ما لم تضبط SSN_TTS_BRIDGE_TOKEN على سر عشوائي طويل؛ واحتفظ بروابط التراكبات التي تحمل الرمز خاصة. اترك الجسر يعمل واختبر الصوت واستخدم رابط التراكب المُنشأ في OBS. فعّل Control audio via OBS في إعدادات مصدر المتصفح إذا أردت صوته في مازج OBS. تفتقر طلبات Fish المباشرة من صفحات المتصفح المستضافة إلى إذن CORS؛ ويوفر الجسر استجابة الصوت التي يمكن للمتصفح الوصول إليها.

مع الجسر، أضف &fishendpoint=http%3A%2F%2F127.0.0.1%3A8124%2Fv1%2Faudio%2Fspeech إلى الرابط واحذف fishkey عندما يحتفظ الجسر بالمفتاح.

معاملات URL: &ttsprovider=fish&fishkey=YOUR_KEY&voicefish=VOICE_ID&fishmodel=s2.1-pro-free&fishspeed=1. فعّل تحويل النص إلى كلام بعناصر التحكم المعتادة. احتفظ بالروابط المُنشأة التي تحتوي على مفتاحك خاصة. يقبل تجاوز الصوت الحالي في Speak Text ضمن Event Flow معرّف صوت Fish عندما تستخدم الصفحة المستقبلة Fish Audio.

مرجع Fish Audio API · إعلان النموذج المجاني وشروطه

Speechify

دليل Speechify خطوة بخطوة: مفتاح API والأصوات والسرعة ومستوى الصوت للمشاهدين.

أدخل مفتاح API ومعرّف الصوت من حساب Speechify API. إعداد المزوّد.

إعدادات مزود Speechify الفعلية في SSN
OpenAI

اختر صوتًا ونموذجًا مدعومين وأدخل مفتاح API. لا يوفر اشتراك ChatGPT رصيد API. احتفظ بنقطة النهاية الافتراضية لـOpenAI.

إعدادات مزود OpenAI الفعلية في SSN
تحويل نص إلى كلام مخصص / محلي

يعيد هذا الخيار استخدام عناصر التحكم المتوافقة مع OpenAI، لذا يظل العنوان OpenAI. أدخل نقطة نهاية خادمك والصوت والنموذج اللذين يدعمهما؛ وتعتمد المصادقة على خادمك. راجع دليل الخادم المحلي.

إعدادات مزود Custom / Local TTS الفعلية في SSN
متقدم: تعديل رابط تحويل النص إلى كلام يدويًا

اختبارات أولى مناسبة:

dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=kokoro
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=piper
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=kitten

للبرتغالية أو الإسبانية، ابدأ بأحد هذه الخيارات بدلًا من ذلك:

dock.html?session=YOUR_SESSION&speech=pt-BR&ttsprovider=piper&pipervoice=pt_BR-faber-medium
dock.html?session=YOUR_SESSION&speech=pt-BR&ttsprovider=espeak&espeakvoice=pt-br
dock.html?session=YOUR_SESSION&speech=es-ES&ttsprovider=piper&pipervoice=es_ES-davefx-medium
dock.html?session=YOUR_SESSION&speech=es-ES&ttsprovider=espeak&espeakvoice=es

المرجع الكامل لتحويل النص إلى كلام · دليل خادم تحويل النص إلى كلام المحلي

متقدم: تشغيل خادمك المحلي لتحويل النص إلى كلام

يفيد الخادم المحلي لتحويل النص إلى كلام عندما تريد أصواتًا خاصة أو نموذج صوت محددًا أو خادمًا مثل Kokoro-FastAPI أو openedai-speech. يجب أن تستطيع الصفحة التي تشغّل الكلام الوصول إلى نقطة النهاية.

رسم يوضح إرسال مصدر متصفح OBS طلبات تحويل النص إلى كلام عبر جسر Social Stream Ninja المحلي إلى خادم تحويل النص إلى كلام
مع OBS، يعمل الجسر المحلي عادةً بأفضل صورة عندما يعمل على جهاز OBS نفسه.
dock.html?session=YOUR_SESSION&speech=en-US&ttsprovider=customtts&openaiendpoint=http://127.0.0.1:8124/v1/audio/speech&voiceopenai=af_bella

localhost يعني الجهاز الذي يشغّل الصفحة. إذا كان خادم تحويل النص إلى كلام على جهاز آخر، فاستخدم عنوان LAN لذلك الجهاز أو شغّل الجسر على جهاز OBS.