Озвучуйте чат наживо локальними голосами ШІ. Почніть із варіанта без встановлення, а локальний сервер використовуйте лише за потреби.
Social Stream Ninja може читати повідомлення чату вголос за допомогою локального ШІ для синтезу мовлення. «Локальний» може означати дві речі: голос працює всередині браузера або ви запускаєте невеликий сервер TTS на власному комп’ютері.
Є два підходи:
Кілька високоякісних голосів ШІ вбудовано безпосередньо в Social Stream Ninja. Вони працюють у браузері через WebAssembly або ONNX — без сервера, Docker чи встановлення.
Просто додайте параметр URL і починайте.
Запустіть локальний сервер TTS на своєму комп’ютері та спрямуйте на нього Social Stream Ninja. Це дає більше голосів, клонування голосу та серверне керування.
Використовує вбудовану в Social Stream підтримку: Кінцева точка, сумісна з OpenAI .
Це найкоротший шлях для більшості стрімерів:
&speech=en-US&ttsprovider=kokoro або &speech=en-US&ttsprovider=kitten до свого dock.html URL.Testing local TTS. Якщо використовуєте Kokoro чи Piper, дочекайтеся першого завантаження моделей.Це найпоширеніша помилка з локальним TTS.
localhost і 127.0.0.1 завжди означають «цей самий комп’ютер». Якщо OBS працює на одному комп’ютері, а Kokoro — на іншому, 127.0.0.1 в URL OBS указує на комп’ютер з OBS, а не на комп’ютер із Kokoro.
127.0.0.1 лише коли сервер TTS працює на тому самому комп’ютері, що й сторінка, яка відтворює звук. Якщо сервер працює на іншому комп’ютері, використовуйте його LAN IP-адресу.| Ваші налаштування | Кінцева точка для використання |
|---|---|
| OBS і Kokoro працюють на одному комп’ютері | http://127.0.0.1:8880/v1/audio/speech |
| Kokoro працює на іншому комп’ютері у вашій домашній мережі | http://192.168.x.x:8880/v1/audio/speech, використовуючи LAN IP комп’ютера з Kokoro |
| Кнопка перевірки настільного застосунку SSN працює, але OBS мовчить | OBS усе одно потребує власної робочої кінцевої точки. Перевірка в застосунку не доводить, що OBS може зв’язатися із сервером. |
У Linux, macOS і Windows також переконайтеся, що брандмауер дозволяє порт і Docker опублікував його через -p 8880:8880.
У спливному вікні розширення відкрийте вибір постачальника TTS і виберіть Власна / локальна кінцева точка TTS. Це показує поля локальної кінцевої точки, сумісної з OpenAI, і посилання на цей посібник.
SSN розглядає локальний/власний сервер TTS як кінцеву точку мовлення, сумісну з OpenAI. Основний процес:
Для ttsprovider=customtts, localtts, або openai, SSN надсилає JSON POST на налаштовану кінцеву точку:
CORS — це перевірка дозволу в браузері. Простими словами: сервер TTS має сказати браузеру «так, ця сторінка може запитувати в мене аудіо». Якщо такого дозволу немає, запит може бути заблоковано ще до того, як Kokoro чи інший сервер TTS його побачить.
dock.html у Chrome або OBS, CORS може мати значення.https://beta.socialstream.ninja/dock.html, Chrome також може блокувати запити до локальних або приватних HTTP-адрес.Якщо сервер не дозволяє браузерні запити, запустіть Міст локального TTS SSN та спрямуйте SSN на http://127.0.0.1:8124/v1/audio/speech. Для OBS найпростіше запустити міст на тому самому комп’ютері, що й OBS.
| Відповідь | Підтримка SSN | Примітки |
|---|---|---|
| Двійкові аудіодані | Так | Найкращий варіант. Повертайте audio/mpeg, audio/wav, audio/ogg, audio/aacабо інший тип аудіо, який може відтворити браузер. |
| JSON із URL аудіо | Так | SSN перевіряє url, audio_url, output_url, вкладені data.url, і перший data[] елемент. |
| JSON із аудіо в base64 | Так | SSN перевіряє audio, audio_data, audioContent, b64_json, вкладені data поля та URL даних. |
| Необроблений PCM | Лише з обгорткою | Повертайте PCM як файл WAV або WAV у base64. Аудіоелемент браузера не може надійно відтворювати необроблені байти PCM безпосередньо. |
mp3 для невеликих файлів і широкої підтримки браузерами, wav для локальних серверів клонування та перевірки мосту, і opus лише коли і сервер, і браузер це підтримують.
Наразі SSN не підтримує поступове відтворення для власних/локальних кінцевих точок TTS. Він чекає на blob відповіді або аудіодані JSON, а потім відтворює їх. Деякі сервери надають потокові кінцеві точки, але поточний шлях SSN, сумісний з OpenAI, буферизує звук перед відтворенням.
Практичний висновок: робіть фрагменти TTS чату короткими. Для потокової підтримки потрібен окремий шлях відтворення з потоковими фрагментами WAV/MP3, MediaSource, WebCodecs або серверним мікшером.
Ці рушії входять до Social Stream Ninja й не потребують встановлення. Вони працюють у браузері через WebAssembly (WASM) або ONNX Runtime.
| Постачальник | Якість | Використання CPU | GPU/WebGPU | Параметр URL |
|---|---|---|---|---|
| Kokoro TTS | ⭐⭐⭐⭐⭐ Чудова | Середнє | Швидше з GPU | ?ttsprovider=kokoro |
| Piper TTS | ⭐⭐⭐⭐ Дуже добра | Низьке | Лише CPU | ?ttsprovider=piper |
| Kitten TTS | ⭐⭐⭐ Добра | Дуже низьке | Лише CPU | ?ttsprovider=kitten |
| eSpeak-NG | ⭐⭐ Роботизована | Мінімальне | Лише CPU | ?ttsprovider=espeak |
Додайте &ttsprovider= і &speech= до свого Social Stream dock.html URL:
Наразі SSN пропонує 28 англійських, три іспанські та три бразильські португальські голоси Kokoro. Укажіть голос за допомогою параметра &voicekokoro=:
Приклад іспанською:
Приклад португальською:
Укажіть модель голосу через &pipervoice=:
Доступні португальські й іспанські голоси Piper:
Розширення Chrome, браузерне джерело OBS та окремий настільний застосунок Social Stream Ninja використовують однакові dock.html параметри URL для TTS. Важлива відмінність — де саме створюється звук.
| Середовище | Поведінка локального TTS | Захоплення звуку |
|---|---|---|
| Розширення Chrome / браузерне джерело OBS | Браузерний fetch потребує CORS від локального сервера, якщо ви не використовуєте міст SSN. | Використовуйте браузерне джерело OBS із «Control audio via OBS». |
| Окремий настільний застосунок | Використовує ті самі налаштування постачальника. Вікна локальних файлів застосунку менше обмежені CORS, але міст усе одно є найнадійнішим шляхом для серверів, які відхиляють браузерні запити. | Захоплюйте звук робочого столу/застосунку або спрямуйте застосунок на віртуальний аудіокабель. |
| Вбудований Kokoro в настільному застосунку | Застосунок може використовувати свій локальний шлях ninjafy.tts для Kokoro замість покладання лише на завантаження моделі в браузері. |
Звук відтворюється із застосунку, тому використовуйте захоплення звуку робочого столу/застосунку. |
dock.html URL в OBS, саме OBS має дістатися сервера TTS і відтворити звук.
Якщо вам потрібні додаткові голоси, клонування голосу або окремий сервер для різних інструментів, можна запустити локальний сервер TTS. Social Stream Ninja підключається до нього через вбудовану підтримку: Кінцева точка TTS, сумісна з OpenAI — для локальних серверів API-ключ не потрібен.
Три рекомендовані варіанти:
| Сервер | Модель | GPU | Диск | Порт за замовчуванням |
|---|---|---|---|---|
| Kokoro-FastAPI Рекомендовано | Kokoro 82M | Необов’язково | ~2 ГБ | 8880 |
| openedai-speech (Piper) Легкий | Piper TTS | Лише CPU | <1 ГБ | 8000 |
| kokoro-web | Kokoro 82M | Необов’язково | ~2 ГБ | 3000 |
| Пакет | Основна перевага | Компроміс |
|---|---|---|
| Вбудований Kokoro | Найкращий початковий вибір: без сервера, висока якість, приватність, працює в браузері та настільному застосунку. | Без клонування голосу. |
| Kokoro-FastAPI | Сервер, сумісний з OpenAI, просте налаштування Docker, CPU або GPU, багато голосів Kokoro. | Без справжнього клонування голосу; змішування голосів і власні голосові функції залежать від збірки сервера. |
| openedai-speech | Легка кінцева точка, сумісна з OpenAI; Piper добре працює на CPU, а XTTS додає клонування з орієнтиром близько 4 ГБ VRAM. | У репозиторії зазначено, що проєкт переважно застарів, тож вважайте його корисним, але без гарантій на майбутнє. |
| Сервери Chatterbox | Клонування голосу, варіанти вебінтерфейсу, API, сумісні з OpenAI, інструменти для довгих текстів. | Для деяких збірок підтримка CUDA/GPU зручніша за CPU; налаштування залежить від відгалуження сервера. |
| GPT-SoVITS | Потужне клонування/керування з короткими зразками та підтримкою транскриптів. | За замовчуванням несумісний з OpenAI; використовуйте режим мосту SSN. |
| F5-TTS | Природне клонування zero-shot із WAV-зразком і транскриптом. | Офіційний проєкт не є простою кінцевою точкою OpenAI; використовуйте обгортку або режим мосту. |
| Qwen3-TTS | Сучасне клонування та створення голосів, зокрема менші моделі 0.6B/1.7B. | Насамперед бібліотека/демонстрація; для SSN потрібна обгортка. |
| MisoTTS | Високоякісна генерація мовлення за запитом. | Не підходить для локального запуску з 6 ГБ VRAM; за потреби використовуйте віддалений/власний хостинг. |
Клонування голосу — не окремий режим SSN. Це функція деяких локальних серверів TTS. SSN надсилає текст чату на локальну кінцеву точку; сервер вибирає клонований голос зі збереженого еталонного аудіофайлу, профілю голосу або конфігурації мосту.
ttsprovider=customtts.Для 6 ГБ VRAM або менше спочатку орієнтуйтеся на невеликі моделі клонування zero-shot і сервери, сумісні з OpenAI. Більші моделі також можуть працювати через ту саму кінцеву точку SSN, якщо користувач розміщує їх деінде.
| Варіант | Клонування голосу | Уміщується в 6 ГБ VRAM | Шлях API для SSN |
|---|---|---|---|
| Qwen3-TTS 0.6B Base | 3-секундний еталонний аудіозапис | Імовірно | Використовуйте обгортку, сумісну з OpenAI, а потім ttsprovider=customtts |
| XTTS-v2 / openedai-speech | Короткі еталонні записи голосу у WAV | Так, openedai-speech повідомляє про приблизно 4 ГБ | /v1/audio/speech |
| Chatterbox Turbo / Server | Клонування за еталонним аудіо | Імовірно, за використання Turbo / невеликих фрагментів | Серверні збірки, сумісні з OpenAI, або міст |
| GPT-SoVITS | 5 секунд для zero-shot, 1 хвилина для few-shot | Імовірно з fp16 / полегшеним установленням | Використовуйте scripts/local-tts-bridge.cjs --mode gptsovits |
| F5-TTS | WAV-зразок + транскрипт | Можливо; залежить від збірки та вокодера | Використовуйте обгортку, сумісну з OpenAI, або --mode f5 для серверних обгорток F5-TTS |
| MisoTTS 8B | Аудіоконтекст запиту | Ні; проєкт рекомендує 24 ГБ VRAM | Лише віддалена/власна кінцева точка |
POST /v1/audio/speech з { model, input, voice, response_format, speed } і повертати аудіофайл, придатний для відтворення. Це охоплює OpenAI, Coqui/XTTS, обгортки Kokoro, Qwen і більшість проксі-сервісів.
Це практичні відправні точки, а не суворі гарантії. Версія моделі, квантування, довжина тексту, образ Docker і фонові застосунки можуть змінювати споживання пам’яті.
| Варіант | Мінімальні практичні вимоги до комп’ютера | Хороший варіант | Примітки |
|---|---|---|---|
| Системний TTS / eSpeak | Будь-який сучасний ПК | Будь-який ПК | Швидко, низька якість, без клонування. |
| Вбудований Kitten | Слабкий CPU, 4 ГБ RAM | Сучасний CPU ноутбука, 8 ГБ RAM | Невелика модель ONNX, швидкий запуск. |
| Вбудований Piper | Сучасний CPU, 4–8 ГБ RAM | Сучасний CPU, 8 ГБ RAM | Хороший варіант нейронного голосу з низьким споживанням ресурсів. |
| Вбудований Kokoro | Сучасний CPU, 8 ГБ RAM | GPU з підтримкою WebGPU або швидкий CPU, 8–16 ГБ RAM | Найкраща якість без налаштування. Перше завантаження отримує ресурси моделі. |
| Kokoro-FastAPI | Хост Docker на CPU, 8 ГБ RAM | NVIDIA GPU необов’язковий, 8–16 ГБ RAM | Хороший локальний сервер, коли завантаження моделі в браузері незручне. |
| openedai-speech Piper | CPU, 4–8 ГБ RAM | CPU, 8 ГБ RAM | Легкий сервер, сумісний з OpenAI. |
| openedai-speech XTTS | NVIDIA GPU з приблизно 4 ГБ VRAM, 8–16 ГБ RAM | NVIDIA GPU з 6 ГБ+, 16 ГБ RAM | Шлях клонування голосу; CPU можливий, але повільний. |
| Сервери Chatterbox | CPU може працювати з деякими збірками, але повільно | NVIDIA GPU з 6 ГБ+, 16 ГБ RAM | Використовуйте GPU для клонування або обробки довгого тексту. |
| GPT-SoVITS / F5-TTS / Qwen3-TTS | CPU лише для перевірки, повільно | NVIDIA GPU з 6 ГБ+ для менших/оптимізованих моделей, 16 ГБ RAM | Вибір обгортки й розмір моделі мають значення. Очікуйте більше налаштувань. |
| MisoTTS 8B | Не рекомендовано локально з 6 ГБ VRAM | 24 ГБ VRAM або віддалений хост | Репозиторій рекомендує GPU з великим обсягом VRAM для інтерактивного використання. |
Це власні рішення для клонування голосу, перевірені на сумісність із SSN. Шлях локальної кінцевої точки перевірено з обома dock.html і featured.html.
SSN приймає прямі двійкові аудіовідповіді, JSON-відповіді з аудіо в base64 та JSON-відповіді з URL аудіо. Поточне відтворення власного/локального TTS буферизує отримане аудіо перед відтворенням; поступове потокове відтворення ще не підтримується.
| Сервер | Шлях SSN | Примітки |
|---|---|---|
| openedai-speech | Безпосередньо або через міст | Сумісний з OpenAI /v1/audio/speech. Режим Piper перевірено зі справжнім синтезом на CPU з dock.html і featured.html, безпосередньо та через міст. Якщо запускаєте з вихідного коду у Windows, переконайтеся, що папка Scripts віртуального середовища є в PATH , щоб piper.exe і ffmpeg.exe можна було знайти. |
| chatterbox-tts-api | Безпосередньо або через міст | Сумісний з OpenAI /v1/audio/speech. Використовує налаштований еталонний аудіозапис для клонування. Формат API перевірено безпосередньо та через міст. |
| Chatterbox-TTS-Server | Безпосередньо або через міст | Кінцева точка, сумісна з OpenAI, і вебінтерфейс. Перевірено зі справжнім синтезом на CPU за допомогою Emily.wav з dock.html і featured.html, безпосередньо та через міст. |
| GPT-SoVITS | Режим мосту | Запустіть міст SSN із --mode gptsovits; цільовий сервер — /tts, несумісний з OpenAI. |
| F5-TTS_server | Режим мосту | Запустіть міст SSN із --mode f5; цільовий сервер використовує GET /synthesize_speech/. |
| Офіційний F5-TTS | Потрібна обгортка | Насамперед CLI, Gradio та сокет-сервер. Використовуйте обгортку, сумісну з OpenAI, або режим мосту F5 з обгорткою. |
| Qwen3-TTS | Потрібна обгортка | Насамперед бібліотека й демонстрація Gradio. Хороший кандидат для невеликої обгортки, сумісної з OpenAI, навколо generate_voice_clone. |
| MisoTTS | Лише віддалений/власний | Клонування голосу підтримується, але модель 8B не розрахована на 6 ГБ VRAM, а репозиторій не має локальної REST-кінцевої точки. |
Kokoro-FastAPI запускає модель Kokoro 82M як локальний сервер з API, сумісним з OpenAI. Він працює на CPU (GPU не потрібен) і має чудову якість голосу.
Відкрийте термінал (Command Prompt, PowerShell або Terminal) і виконайте одну з таких команд:
Відкрийте браузер і перейдіть на http://localhost:8880/web/— має з’явитися вебінтерфейс, де можна перевіряти голоси.
Доступно понад 67 голосів. Кілька прикладів:
Переглядайте й перевіряйте всі голоси на http://localhost:8880/web/ після запуску сервера.
Якщо Kokoro-FastAPI працює на тому самому комп’ютері, що й OBS:
Якщо Kokoro-FastAPI працює на іншому комп’ютері, замініть 192.168.x.x на LAN IP-адресу того комп’ютера:
af_bella, af_sarah, am_adam, або bf_emma. Назви на кшталт echo, nova, і alloy — це назви у стилі OpenAI/openedai-speech, які можуть не працювати з Kokoro.
Щоб Kokoro-FastAPI автоматично працював у фоні, використовуйте прапорець перезапуску Docker:
Тепер він автоматично запускатиметься разом із Docker Desktop після кожного перезавантаження.
openedai-speech надає сумісну з OpenAI кінцеву точку /v1/audio/speech , яка потрібна Social Stream. Його малий образ запускає Piper на CPU; повний образ може виконувати клонування голосу XTTS-v2 на підтримуваному GPU.
Використовуйте цей варіант для сервера TTS лише на CPU розміром до 1 ГБ. Він не містить XTTS-v2 чи клонування голосу.
docker-compose.min.yml. Або виконайте наведені нижче команди безпосередньо.
Якщо ви запускаєте openedai-speech із локального репозиторію замість Docker, додайте папку скриптів його віртуального середовища до PATH перед запуском сервера. Без цього запити можуть повертати HTTP 500, оскільки сервер не може знайти piper.exe або ffmpeg.exe.
openedai-speech використовує назви голосів у стилі OpenAI, зіставлені з голосами Piper:
Сам XTTS-v2 — це модель, а не веб-API. Використовуйте повний сервер openedai-speech, щоб завантажити модель, вибрати збережений еталонний голос, приймати текст чату від SSN і повертати придатне для відтворення аудіо. Сервер указує практичний орієнтир приблизно 4 ГБ GPU VRAM; обчислення на CPU можливі, але повільні.
openedai-speech-min для XTTS-v2. Мінімальний образ містить лише Piper. XTTS-v2 потребує повного встановлення та model=tts-1-hd в кожному запиті мовлення.
У macOS або Linux використовуйте cp sample.env speech.env замість Copy-Item. Docker повинен мати доступ до підтримуваного GPU. Модель завантажується під час першого використання.
tts-1-hd у config/voice_to_speaker.yaml:Збережіть усі наявні голоси, уже перелічені під tts-1-hd. Змініть me на назву голосу, яку SSN має надсилати, і за потреби використовуйте правильний код мови XTTS.
openaimodel=tts-1-hd потрібен для XTTS-v2. Якщо його не вказано, Social Stream надсилає своє стандартне значення tts-1, і openedai-speech натомість вибирає Piper. Значення voiceopenai має відповідати назві клонованого голосу в voice_to_speaker.yaml.
Якщо браузер або OBS блокує прямий запит, запустіть Міст локального TTS на комп’ютері з OBS і збережіть ті самі параметри моделі й голосу, змінюючи openaiendpoint до http://127.0.0.1:8124/v1/audio/speech.
Міст — це невелика локальна допоміжна програма. Вона приймає браузерний запит SSN, звертається до вашого сервера TTS, а потім повертає аудіо в SSN із заголовками, придатними для браузера.
http://127.0.0.1:8124/v1/audio/speech, навіть якщо справжній сервер TTS працює на іншому комп’ютері.
Окрема початкова папка — local-tts-bridge/; див. README мосту щодо всіх варіантів запуску.
Windows PowerShell, коли сервер TTS працює на цьому самому комп’ютері:
Windows PowerShell, коли сервер TTS працює на іншому комп’ютері:
Термінал macOS/Linux:
Потім спрямуйте OBS dock.html URL на міст:
GPT-SoVITS використовує власний /tts формат JSON, тому міст може перетворити запит SSN, сумісний з OpenAI, на тіло запиту GPT-SoVITS.
Деякі серверні обгортки F5-TTS надають /synthesize_speech/?text=...&voice=... замість кінцевої точки, сумісної з OpenAI. Міст може перетворити запит SSN на цей формат запиту.
http://127.0.0.1:8124/v1/audio/speech. Змініть порт за допомогою SSN_TTS_BRIDGE_PORT=8125 за потреби.
Усі наведені вище власні сервери використовують той самий спосіб підключення — вбудовану в Social Stream підтримку: Кінцева точка OpenAI TTS з власною локальною URL-адресою.
| Параметр | Значення | Опис |
|---|---|---|
ttsprovider |
customtts або openai |
Використовуйте шлях TTS, сумісний з OpenAI. Використовуйте customtts для локальних/власних кінцевих точок. |
openaiendpoint |
http://localhost:8880/v1/audio/speech |
URL вашого локального сервера (за потреби змініть порт) |
speech |
en-US |
Умикає TTS для англійської |
voiceopenai |
af_bella |
Назва голосу (залежить від сервера) |
openaiformat |
mp3 |
Формат аудіо: mp3, wav, opus, flac |
openaispeed |
1.0 |
Швидкість мовлення (0,5–2,0) |
customttsendpoint і localttsendpoint також працюють. customttsvoice, localttsvoice, customttsmodel, localttsmodel, customttsformat, і localttsformat — це прийнятні псевдоніми полів у стилі OpenAI.
openaiendpoint має бути доступна зі сторінки, яка відтворює TTS, а voiceopenai має бути голосом, який підтримує ваш сервер. Kokoro-FastAPI використовує назви на кшталт af_bella; openedai-speech часто використовує назви на кшталт nova або echo.
Вони працюють із будь-яким постачальником TTS, зокрема локальними серверами:
| Параметр | Приклад | Опис |
|---|---|---|
simpletts |
&simpletts |
Пропускати «says» — читати лише повідомлення |
simpletts2 |
&simpletts2 |
Повністю пропускати імена користувачів |
volume |
&volume=0.8 |
Рівень гучності (0,0–1,0) |
skipmessages |
&skipmessages=3 |
Читати лише кожне третє повідомлення |
ttscommand |
&ttscommand=!say |
Читати лише повідомлення, що починаються з !say |
readevents |
&readevents |
Також читати підписки, донати тощо. |
ttsquick |
&ttsquick=100 |
Навмисно обрізає озвучення після цієї кількості символів. Приберіть параметр, якщо повідомлення обриваються. |
SSN уже підтримує системний/браузерний speechSynthesis, вбудовані Kokoro, Piper, Kitten та eSpeak. Найкориснішими майбутніми доповненнями в браузері були б вибір пристрою виведення звуку там, де setSinkId доступний, більше голосів Piper і окремий шлях поступового потокового відтворення для серверів, здатних передавати аудіофрагменти потоком.
Спосіб захоплення звуку TTS в OBS залежить від того, як ви запускаєте Social Stream Ninja.
Це найпростіший спосіб, який працює для усіх постачальників TTS (вбудований і власний сервер).
dock.html URL із параметрами TTSЯкщо ви використовуєте окремий настільний застосунок Social Stream Ninja, а не браузерне джерело OBS:
Audio Router може спрямувати окремий застосунок на віртуальний кабель, але це старіша програма. Віддавайте перевагу маршрутизації окремого застосунку у Windows, коли вона працює.
Voicemeeter найкраще підходить, коли потрібно чути TTS локально, направляти його в OBS і тримати окремо від музики/звуку гри.
?speech=en-US без постачальника) залежить від голосів, які надає браузер. OBS може не надавати голосів або показувати голоси, звук яких неможливо захопити. Перевіряйте мовлення й запис OBS окремо. Використовуйте одного з наведених вище постачальників (kokoro, piperтощо).
| Варіант | Налаштування | Якість | Приватний | OBS (браузерне джерело) | Потрібен GPU | Вартість |
|---|---|---|---|---|---|---|
| Вбудований Kokoro | Немає | ⭐⭐⭐⭐⭐ | Так | Так | Ні (з ним швидше) | Безкоштовно |
| Вбудований Piper | Немає | ⭐⭐⭐⭐ | Так | Так | Ні | Безкоштовно |
| Вбудований Kitten | Немає | ⭐⭐⭐ | Так | Так | Ні | Безкоштовно |
| Вбудований eSpeak | Немає | ⭐⭐ | Так | Так | Ні | Безкоштовно |
| Kokoro-FastAPI | Docker | ⭐⭐⭐⭐⭐ | Так | Так | Ні (необов’язково) | Безкоштовно |
| openedai-speech | Docker | ⭐⭐⭐⭐ | Так | Так | Ні | Безкоштовно |
| ElevenLabs | API-ключ | ⭐⭐⭐⭐⭐ | Ні | Так | Ні | Платні тарифи |
| Системне озвучення | Немає | ⭐⭐ | Так | Ні* | Ні | Безкоштовно |
* Для захоплення системного TTS в OBS потрібна маршрутизація через віртуальний аудіокабель.
Перевірка в застосунку доводить лише те, що застосунок може зв’язатися із сервером. Браузерне джерело OBS усе одно має дістатися кінцевої точки та відтворити звук.
127.0.0.1 на LAN IP комп’ютера із сервером TTS.ttsquick. Цей параметр навмисно скорочує озвучуваний текст.&ttsquick=14 або інше мале число, приберіть його й оновіть браузерне джерело OBS.typewriter=, тимчасово приберіть його під час перевірки. TTS зазвичай використовує початкове повідомлення, але вимкнення візуальних ефектів — швидкий спосіб виключити проблеми з часом.http://127.0.0.1:8880/web/ для Kokoro-FastAPI або відповідний порт вашого сервера.http://SERVER_LAN_IP:8880/web/. Якщо вона не завантажується, OBS також не зможе використовувати цей сервер.Якщо браузер повідомляє, що запит заблоковано через CORS, доступ до локальної чи приватної мережі або failed fetch, сервер TTS може взагалі не отримати запит.
npm run local-tts-bridge на комп’ютері з OBS та спрямуйте SSN на http://127.0.0.1:8124/v1/audio/speech.af_bella, af_sarah, am_adamабо інший голос із вебінтерфейсу Kokoro.nova, echo, і alloy можуть бути правильними.?speech=en-US без &ttsprovider=). Системний TTS може потребувати захоплення звуку робочого столу або віртуального кабелю.Теги образів Docker можуть змінюватися. Якщо команда з цього посібника перестала працювати, перевірте поточний тег на сторінці проєкту: