Озвучивайте чат локальными ИИ-голосами. Начните с варианта без установки и используйте локальный сервер только при необходимости.
Social Stream Ninja умеет читать сообщения чата вслух с помощью локального ИИ-синтеза речи. «Локальный» означает одно из двух: голос работает прямо в браузере либо небольшой сервер озвучивания запущен на вашем компьютере.
Есть два подхода:
Несколько качественных ИИ-голосов встроены прямо в Social Stream Ninja. Они работают в браузере через WebAssembly или ONNX — без сервера, Docker и установки.
Просто добавьте параметр URL — и можно начинать.
Запустите локальный сервер озвучивания на своём компьютере и укажите его в Social Stream Ninja. Это даёт больше голосов, клонирование и управление на стороне сервера.
Использует встроенную в Social Stream поддержку: OpenAI-совместимая конечная точка .
Для большинства стримеров это самый короткий путь:
&speech=en-US&ttsprovider=kokoro или &speech=en-US&ttsprovider=kitten к вашему dock.html URL.Testing local TTS. При использовании Kokoro или Piper дождитесь первой загрузки моделей.Это самая частая ошибка при настройке локального озвучивания.
localhost и 127.0.0.1 всегда означают «этот же компьютер». Если OBS находится на одном компьютере, а Kokoro — на другом, 127.0.0.1 в URL OBS указывает на компьютер с OBS, а не с Kokoro.
127.0.0.1 только если сервер озвучивания находится на том же компьютере, что и страница воспроизведения. Если сервер на другом компьютере, используйте его IP-адрес локальной сети.| Ваша конфигурация | Какую конечную точку использовать |
|---|---|
| OBS и Kokoro работают на одном компьютере | http://127.0.0.1:8880/v1/audio/speech |
| Kokoro работает на другом компьютере домашней сети | http://192.168.x.x:8880/v1/audio/speech, используя LAN IP компьютера с Kokoro |
| Тестовая кнопка настольного SSN работает, но OBS молчит | OBS всё равно нужна собственная рабочая конечная точка. Проверка приложения не доказывает, что OBS может подключиться к серверу. |
В Linux, macOS и Windows также убедитесь, что брандмауэр разрешает порт и Docker опубликовал его с помощью -p 8880:8880.
В меню расширения откройте выбор провайдера озвучивания и выберите Собственная / локальная конечная точка озвучивания. Появятся поля локальной OpenAI-совместимой конечной точки и ссылка на это руководство.
SSN воспринимает локальный или собственный сервер озвучивания как OpenAI-совместимую речевую конечную точку. Основной процесс:
Для ttsprovider=customtts, localtts, или openai, SSN отправляет JSON POST на настроенную конечную точку:
CORS — проверка разрешений в браузере. Проще говоря, сервер озвучивания должен сообщить браузеру: «Да, этой странице разрешено запрашивать у меня звук». Без разрешения запрос может быть заблокирован ещё до того, как попадёт в Kokoro или другой сервер озвучивания.
dock.html в Chrome или OBS, CORS может иметь значение.https://beta.socialstream.ninja/dock.html, Chrome также может блокировать обращения к локальным или частным HTTP-адресам.Если сервер не разрешает запросы браузера, запустите Мост локального озвучивания SSN и направьте SSN на http://127.0.0.1:8124/v1/audio/speech. Для OBS проще всего запустить мост на том же компьютере, что и OBS.
| Ответ | Поддержка SSN | Примечания |
|---|---|---|
| Двоичные аудиоданные | Да | Лучший вариант. Возвращайте audio/mpeg, audio/wav, audio/ogg, audio/aacили другой аудиотип, воспроизводимый браузером. |
| JSON с URL аудио | Да | SSN проверяет url, audio_url, output_url, вложенный data.url, а первый data[] . |
| JSON с аудио в base64 | Да | SSN проверяет audio, audio_data, audioContent, b64_json, вложенный data поля и URL данных. |
| Необработанные PCM-данные | Только через обёртку | Возвращайте PCM как файл WAV или WAV в base64. Аудиоэлемент браузера не может надёжно воспроизводить необработанные байты PCM напрямую. |
mp3 для небольших файлов и широкой поддержки браузерами, wav для локальных серверов клонирования и проверки моста, а также opus только если это поддерживают и сервер, и браузер.
SSN пока не воспроизводит звук постепенно из собственных или локальных конечных точек. Он дожидается двоичного ответа или JSON с аудио, затем воспроизводит его. Некоторые серверы предоставляют потоковые конечные точки, но текущий OpenAI-совместимый путь SSN сначала буферизует звук.
Практический вывод: делайте озвучиваемые фрагменты чата короткими. Для потокового воспроизведения нужен отдельный путь с фрагментами WAV/MP3, MediaSource, WebCodecs или серверным микшером.
Эти движки входят в Social Stream Ninja и не требуют установки. Они работают в браузере через WebAssembly (WASM) или ONNX Runtime.
| Провайдер | Качество | Использование процессора | GPU/WebGPU | Параметр URL |
|---|---|---|---|---|
| Kokoro TTS | ⭐⭐⭐⭐⭐ Отличный | Среднее | Быстрее с GPU | ?ttsprovider=kokoro |
| Piper TTS | ⭐⭐⭐⭐ Очень хороший | Низкое | Только процессор | ?ttsprovider=piper |
| Kitten TTS | ⭐⭐⭐ Хороший | Очень низкое | Только процессор | ?ttsprovider=kitten |
| eSpeak-NG | ⭐⭐ Роботизированный | Минимальное | Только процессор | ?ttsprovider=espeak |
Добавить &ttsprovider= и &speech= к вашему Social Stream dock.html URL:
Сейчас в SSN доступны 28 английских, три испанских и три бразильских португальских голоса Kokoro. Укажите голос с помощью параметра &voicekokoro=:
Пример на испанском:
Пример на португальском:
Укажите модель голоса с помощью &pipervoice=:
Доступны португальские и испанские голоса Piper:
Расширение Chrome, источник «Браузер» OBS и отдельное настольное приложение Social Stream Ninja используют одинаковые dock.html параметры URL для озвучивания. Главное различие — где создаётся звук.
| Среда | Поведение локального озвучивания | Захват звука |
|---|---|---|
| Расширение Chrome / источник «Браузер» OBS | Для запросов из браузера локальный сервер должен разрешать CORS, если вы не используете мост SSN. | Используйте источник «Браузер» OBS с параметром «Управлять аудио через OBS». |
| Отдельное настольное приложение | Использует те же настройки провайдера. Локальные файловые окна приложения меньше ограничены CORS, но для серверов, отклоняющих браузерные запросы, мост остаётся самым надёжным путём. | Захватывайте звук рабочего стола или приложения либо направьте приложение на виртуальный аудиокабель. |
| Встроенный Kokoro в настольном приложении | Приложение может использовать свой локальный путь ninjafy.tts для Kokoro вместо зависимости только от загрузки модели в браузере. |
Звук воспроизводится приложением, поэтому используйте захват звука рабочего стола или приложения. |
dock.html URL в OBS, именно OBS должен подключиться к серверу озвучивания и воспроизвести звук.
Если нужны дополнительные голоса, клонирование или отдельный сервер для нескольких инструментов, можно запустить локальный сервер озвучивания. Social Stream Ninja подключается к нему через встроенную поддержку: OpenAI-совместимая конечная точка озвучивания — для локальных серверов API-ключ не нужен.
Три рекомендуемых варианта:
| Сервер | Модель | GPU | Диск | Порт по умолчанию |
|---|---|---|---|---|
| Kokoro-FastAPI Рекомендуется | Kokoro 82M | Необязательно | ~2 ГБ | 8880 |
| openedai-speech (Piper) Лёгкий | Piper TTS | Только процессор | <1 ГБ | 8000 |
| kokoro-web | Kokoro 82M | Необязательно | ~2 ГБ | 3000 |
| Пакет | Главное преимущество | Компромисс |
|---|---|---|
| Встроенный Kokoro | Лучший первый вариант: без сервера, высокое качество, приватность, работа в браузере и настольном приложении. | Без клонирования голоса. |
| Kokoro-FastAPI | OpenAI-совместимый сервер, простая настройка Docker, процессор или GPU, много голосов Kokoro. | Настоящего клонирования нет; смешивание и настройка голосов зависят от сборки сервера. |
| openedai-speech | Лёгкая OpenAI-совместимая конечная точка; Piper удобен для процессора, а XTTS добавляет клонирование с ориентиром примерно на 4 ГБ видеопамяти. | В репозитории указано, что проект в основном устарел: он может быть полезен, но не стоит рассчитывать на его развитие. |
| Серверы Chatterbox | Клонирование голоса, варианты веб-интерфейса, OpenAI-совместимые API и инструменты для длинных текстов. | В некоторых сборках CUDA/GPU работает стабильнее процессора; настройка зависит от ответвления сервера. |
| GPT-SoVITS | Хорошее клонирование и управление по коротким образцам с поддержкой расшифровки. | По умолчанию несовместим с OpenAI; используйте режим моста SSN. |
| F5-TTS | Естественное клонирование без обучения по образцу WAV и расшифровке. | Официальный проект не предоставляет простую конечную точку OpenAI; используйте обёртку или режим моста. |
| Qwen3-TTS | Современные функции клонирования и создания голосов, включая небольшие модели 0.6B/1.7B. | В первую очередь библиотека или демонстрация; для SSN нужна обёртка. |
| MisoTTS | Высококачественная генерация речи по описанию. | Не подходит для локального запуска с 6 ГБ видеопамяти; при необходимости используйте удалённое или собственное размещение. |
Клонирование голоса — не отдельный режим SSN, а функция некоторых локальных серверов озвучивания. SSN отправляет текст чата на локальную конечную точку; сервер выбирает клонированный голос из сохранённого образца, профиля голоса или настроек моста.
ttsprovider=customtts.При 6 ГБ видеопамяти или меньше сначала выбирайте небольшие модели клонирования без обучения и OpenAI-совместимые серверы. Более крупные модели тоже могут работать через ту же конечную точку SSN, если пользователь размещает их на другом компьютере.
| Вариант | Клонирование голоса | Помещается в 6 ГБ видеопамяти | Путь API для SSN |
|---|---|---|---|
| Qwen3-TTS 0.6B Base | Образец аудио длиной 3 секунды | Скорее всего | Используйте OpenAI-совместимую обёртку, затем ttsprovider=customtts |
| XTTS-v2 / openedai-speech | Голоса по коротким образцам WAV | Да, около 4 ГБ по данным openedai-speech | /v1/audio/speech |
| Chatterbox Turbo / Server | Клонирование по образцу аудио | Скорее всего при Turbo или небольших фрагментах | OpenAI-совместимые сборки сервера или мост |
| GPT-SoVITS | 5 секунд без обучения, 1 минута с небольшим обучением | Скорее всего при fp16 или облегчённой установке | Используйте scripts/local-tts-bridge.cjs --mode gptsovits |
| F5-TTS | Образец WAV и расшифровка | Возможно; зависит от сборки и вокодера | Используйте OpenAI-совместимую обёртку или --mode f5 для серверных обёрток F5-TTS |
| MisoTTS 8B | Аудиоконтекст для генерации | Нет; проект рекомендует 24 ГБ видеопамяти | Только удалённая или собственная конечная точка |
POST /v1/audio/speech с { model, input, voice, response_format, speed } и возвращают воспроизводимый аудиофайл. Это охватывает OpenAI, Coqui/XTTS, обёртки Kokoro и Qwen и большинство прокси-сервисов.
Это практические ориентиры, а не строгие гарантии. Версия модели, квантование, длина текста, образ Docker и фоновые приложения могут менять расход памяти.
| Вариант | Минимальная практическая конфигурация | Подходящий вариант | Примечания |
|---|---|---|---|
| Системное озвучивание / eSpeak | Любой современный ПК | Любой ПК | Быстро, низкое качество, без клонирования. |
| Встроенный Kitten | Слабый процессор, 4 ГБ ОЗУ | Современный процессор ноутбука, 8 ГБ ОЗУ | Небольшая модель ONNX, быстрый запуск. |
| Встроенный Piper | Современный процессор, 4–8 ГБ ОЗУ | Современный процессор, 8 ГБ ОЗУ | Хороший нейросетевой голос с низкими требованиями к ресурсам. |
| Встроенный Kokoro | Современный процессор, 8 ГБ ОЗУ | GPU с поддержкой WebGPU или быстрый процессор, 8–16 ГБ ОЗУ | Лучшее качество без настройки. При первом запуске скачиваются файлы модели. |
| Kokoro-FastAPI | Хост Docker с процессором, 8 ГБ ОЗУ | GPU NVIDIA необязателен, 8–16 ГБ ОЗУ | Хороший локальный сервер, если загрузка модели в браузере неудобна. |
| openedai-speech Piper | Процессор, 4–8 ГБ ОЗУ | Процессор, 8 ГБ ОЗУ | Лёгкий OpenAI-совместимый сервер. |
| openedai-speech XTTS | GPU NVIDIA примерно с 4 ГБ видеопамяти, 8–16 ГБ ОЗУ | GPU NVIDIA с 6 ГБ+, 16 ГБ ОЗУ | Путь клонирования голоса; на процессоре возможно, но медленно. |
| Серверы Chatterbox | Некоторые сборки работают на процессоре, но медленно | GPU NVIDIA с 6 ГБ+, 16 ГБ ОЗУ | При клонировании или обработке длинного текста используйте GPU. |
| GPT-SoVITS / F5-TTS / Qwen3-TTS | На процессоре только для проверки, медленно | GPU NVIDIA с 6 ГБ+ для небольших или оптимизированных моделей, 16 ГБ ОЗУ | Важны выбор обёртки и размер модели. Настройка потребует больше усилий. |
| MisoTTS 8B | Не рекомендуется локально при 6 ГБ видеопамяти | 24 ГБ видеопамяти или удалённый хост | Для интерактивного использования репозиторий рекомендует GPU с большим объёмом видеопамяти. |
Это варианты собственного сервера клонирования, проверенные на совместимость с SSN. Путь локальной конечной точки проверен с обоими dock.html и featured.html.
SSN принимает прямые двоичные аудиоответы, JSON с аудио в base64 и JSON с URL аудио. Текущее воспроизведение через собственную или локальную конечную точку сначала буферизует полученный звук; постепенное потоковое воспроизведение пока не поддерживается.
| Сервер | Путь SSN | Примечания |
|---|---|---|
| openedai-speech | Напрямую или через мост | Совместимый с OpenAI /v1/audio/speech. Режим Piper проверен на настоящем синтезе с помощью процессора из dock.html и featured.html, напрямую и через мост. При запуске из исходников в Windows убедитесь, что папка Scripts виртуального окружения находится в PATH , чтобы piper.exe и ffmpeg.exe можно было найти. |
| chatterbox-tts-api | Напрямую или через мост | Совместимый с OpenAI /v1/audio/speech. Для клонирования используется настроенный образец аудио. Формат API проверен напрямую и через мост. |
| Chatterbox-TTS-Server | Напрямую или через мост | OpenAI-совместимая конечная точка и веб-интерфейс. Проверено с настоящим синтезом на процессоре с использованием Emily.wav из dock.html и featured.html, напрямую и через мост. |
| GPT-SoVITS | Режим моста | Запустите мост SSN с --mode gptsovits; целевой сервер — /tts, а не OpenAI-совместимый. |
| F5-TTS_server | Режим моста | Запустите мост SSN с --mode f5; целевой сервер использует GET /synthesize_speech/. |
| Официальный F5-TTS | Нужна обёртка | В первую очередь CLI, Gradio и сокет-сервер. Используйте OpenAI-совместимую обёртку или режим моста F5 с обёрткой. |
| Qwen3-TTS | Нужна обёртка | В первую очередь библиотека и демонстрация Gradio. Хороший кандидат для небольшой OpenAI-совместимой обёртки вокруг generate_voice_clone. |
| MisoTTS | Только удалённое или собственное размещение | Клонирование поддерживается, но модель 8B не рассчитана на 6 ГБ видеопамяти, а в репозитории нет локальной REST-конечной точки. |
Kokoro-FastAPI запускает модель Kokoro 82M как локальный сервер с OpenAI-совместимым API. Работает на процессоре без GPU и обеспечивает отличное качество голоса.
Откройте терминал: командную строку, PowerShell или Terminal — и выполните одну из команд:
Откройте браузер и перейдите по адресу http://localhost:8880/web/— откроется веб-интерфейс для проверки голосов.
Доступно более 67 голосов. Несколько примеров:
Посмотреть и проверить все голоса можно на http://localhost:8880/web/ после запуска сервера.
Если Kokoro-FastAPI находится на том же компьютере, что и OBS:
Если Kokoro-FastAPI находится на другом компьютере, замените 192.168.x.x IP-адресом этого компьютера в локальной сети:
af_bella, af_sarah, am_adam, или bf_emma. Такие имена, как echo, nova, и alloy — имена в стиле OpenAI или openedai-speech; они могут не работать с Kokoro.
Чтобы Kokoro-FastAPI автоматически работал в фоне, используйте флаг перезапуска Docker:
Теперь сервер будет автоматически запускаться вместе с Docker Desktop после каждой перезагрузки.
openedai-speech предоставляет совместимую с OpenAI конечную точку /v1/audio/speech , которая нужна Social Stream. Небольшой образ запускает Piper на процессоре; полный образ умеет клонировать голос через XTTS-v2 на поддерживаемом GPU.
Используйте этот вариант для сервера озвучивания только на процессоре размером менее 1 ГБ. XTTS-v2 и клонирование голоса в него не входят.
docker-compose.min.yml. Либо выполните приведённые ниже команды напрямую.
Если вы запускаете openedai-speech из локальной копии исходников, а не через Docker, добавьте папку скриптов виртуального окружения в PATH перед запуском сервера. Иначе запросы могут возвращать HTTP 500, поскольку сервер не находит piper.exe или ffmpeg.exe.
openedai-speech использует имена голосов в стиле OpenAI, сопоставленные голосам Piper:
XTTS-v2 — модель, а не веб-API. Используйте полный сервер openedai-speech для загрузки модели, выбора сохранённого образца голоса, получения текста чата из SSN и возврата воспроизводимого аудио. Сервер указывает практический ориентир около 4 ГБ видеопамяти GPU; работа на процессоре возможна, но медленна.
openedai-speech-min для XTTS-v2. Минимальный образ содержит только Piper. Для XTTS-v2 нужны полная установка и model=tts-1-hd в каждом запросе речи.
В macOS или Linux используйте cp sample.env speech.env вместо Copy-Item. Docker должен иметь доступ к поддерживаемому GPU. Модель скачивается при первом использовании.
tts-1-hd в config/voice_to_speaker.yaml:Сохраните все голоса, уже перечисленные в tts-1-hd. Измените me на имя голоса, которое SSN должен отправлять, и при необходимости укажите правильный код языка XTTS.
openaimodel=tts-1-hd требуется для XTTS-v2. Если он не указан, Social Stream отправляет значение по умолчанию tts-1, и openedai-speech вместо этого выбирает Piper. Значение voiceopenai должно совпадать с именем клонированного голоса в voice_to_speaker.yaml.
Если браузер или OBS блокирует прямой запрос, запустите Мост локального озвучивания на компьютере с OBS; сохраняйте параметры модели и голоса, меняя openaiendpoint на http://127.0.0.1:8124/v1/audio/speech.
Мост — небольшой локальный помощник. Он принимает браузерный запрос SSN, обращается к вашему серверу озвучивания, затем возвращает звук в SSN с подходящими браузеру заголовками.
http://127.0.0.1:8124/v1/audio/speech, даже если сам сервер озвучивания находится на другом компьютере.
Папка для самостоятельного запуска — local-tts-bridge/; см. README моста для всех параметров запуска.
Windows PowerShell, если сервер озвучивания находится на этом компьютере:
Windows PowerShell, если сервер озвучивания находится на другом компьютере:
Терминал macOS/Linux:
Затем направьте в OBS dock.html URL на мост:
GPT-SoVITS использует собственный /tts формат JSON, поэтому мост преобразует OpenAI-совместимый запрос SSN в тело запроса GPT-SoVITS.
Некоторые серверные обёртки F5-TTS предоставляют /synthesize_speech/?text=...&voice=... вместо OpenAI-совместимой конечной точки. Мост может преобразовать запрос SSN в этот формат.
http://127.0.0.1:8124/v1/audio/speech. Измените порт с помощью SSN_TTS_BRIDGE_PORT=8125 при необходимости.
Все перечисленные собственные серверы подключаются одинаково — через встроенную в Social Stream поддержку: Конечная точка OpenAI TTS с собственным локальным URL.
| Параметр | Значение | Описание |
|---|---|---|
ttsprovider |
customtts или openai |
Используйте OpenAI-совместимый путь озвучивания. Укажите customtts для локальных и собственных конечных точек. |
openaiendpoint |
http://localhost:8880/v1/audio/speech |
URL локального сервера; при необходимости измените порт |
speech |
en-US |
Включает озвучивание на английском |
voiceopenai |
af_bella |
Имя голоса (зависит от сервера) |
openaiformat |
mp3 |
Формат аудио: mp3, wav, opus, flac |
openaispeed |
1.0 |
Скорость речи (0.5–2.0) |
customttsendpoint и localttsendpoint тоже работают. customttsvoice, localttsvoice, customttsmodel, localttsmodel, customttsformat, и localttsformat принимаются как альтернативные имена полей в стиле OpenAI.
openaiendpoint должен быть доступен со страницы, воспроизводящей речь, а voiceopenai должен соответствовать голосу, поддерживаемому сервером. Kokoro-FastAPI использует имена вроде af_bella; openedai-speech часто использует имена вроде nova или echo.
Работает с любым провайдером озвучивания, включая локальные серверы:
| Параметр | Пример | Описание |
|---|---|---|
simpletts |
&simpletts |
Пропускать «говорит» — читать только сообщение |
simpletts2 |
&simpletts2 |
Полностью пропускать имена пользователей |
volume |
&volume=0.8 |
Громкость (0.0–1.0) |
skipmessages |
&skipmessages=3 |
Читать только каждое третье сообщение |
ttscommand |
&ttscommand=!say |
Читать только сообщения, начинающиеся с !say |
readevents |
&readevents |
Также читать подписки, пожертвования и другие события |
ttsquick |
&ttsquick=100 |
Намеренно обрывает речь после указанного числа символов. Уберите параметр, если сообщения обрезаются. |
SSN уже поддерживает системное и браузерное speechSynthesis, встроенные Kokoro, Piper, Kitten и eSpeak. Из будущих браузерных дополнений полезнее всего были бы выбор устройства вывода звука там, где setSinkId доступен, больше голосов Piper и отдельный путь постепенного потокового воспроизведения для серверов, умеющих передавать фрагменты аудио.
Способ захвата озвучивания в OBS зависит от того, как вы запускаете Social Stream Ninja.
Это самый простой способ, подходящий для всех провайдеров озвучивания (встроенный и собственный сервер).
dock.html URL с параметрами озвучиванияЕсли вы используете отдельное настольное приложение Social Stream Ninja, а не источник «Браузер» OBS:
Audio Router может направлять отдельное приложение на виртуальный кабель, но это старая программа. Если работает маршрутизация отдельных приложений Windows, лучше использовать её.
Voicemeeter лучше всего подходит, когда нужно слышать озвучивание локально, направлять его в OBS и отделять от музыки и звуков игры.
?speech=en-US без провайдера) зависит от голосов, предоставляемых браузером. OBS может не предоставлять голоса либо показывать их без звука, доступного для захвата. Проверяйте речь и запись OBS отдельно. Используйте одного из провайдеров выше (kokoro, piperи другие) вместо этого.
| Вариант | Настройка | Качество | Личный | OBS (источник «Браузер») | Нужен GPU | Стоимость |
|---|---|---|---|---|---|---|
| Встроенный Kokoro | Нет | ⭐⭐⭐⭐⭐ | Да | Да | Нет (с ним быстрее) | Бесплатно |
| Встроенный Piper | Нет | ⭐⭐⭐⭐ | Да | Да | Нет | Бесплатно |
| Встроенный Kitten | Нет | ⭐⭐⭐ | Да | Да | Нет | Бесплатно |
| Встроенный eSpeak | Нет | ⭐⭐ | Да | Да | Нет | Бесплатно |
| Kokoro-FastAPI | Docker | ⭐⭐⭐⭐⭐ | Да | Да | Нет (необязательно) | Бесплатно |
| openedai-speech | Docker | ⭐⭐⭐⭐ | Да | Да | Нет | Бесплатно |
| ElevenLabs | API-ключ | ⭐⭐⭐⭐⭐ | Нет | Да | Нет | Платные тарифы |
| Системное озвучивание | Нет | ⭐⭐ | Да | Нет* | Нет | Бесплатно |
* Для захвата системного озвучивания в OBS нужна маршрутизация через виртуальный аудиокабель.
Проверка приложения доказывает только его доступ к серверу. Источник «Браузер» OBS должен отдельно подключиться к конечной точке и воспроизвести звук.
127.0.0.1 IP-адресом компьютера с сервером озвучивания в локальной сети.ttsquick. Этот параметр намеренно сокращает произносимый текст.&ttsquick=14 или другое небольшое число, удалите параметр и обновите источник «Браузер» OBS.typewriter=, временно уберите его на время проверки. Озвучивание обычно использует исходное сообщение, но отключение визуальных эффектов помогает быстро исключить проблемы с синхронизацией.http://127.0.0.1:8880/web/ для Kokoro-FastAPI или соответствующий порт вашего сервера.http://SERVER_LAN_IP:8880/web/. Если страница не загружается, OBS тоже не сможет использовать этот сервер.Если браузер сообщает о блокировке CORS, доступа к локальной или частной сети либо об ошибке fetch, запрос может вообще не дойти до сервера озвучивания.
npm run local-tts-bridge на компьютере с OBS и направьте SSN на http://127.0.0.1:8124/v1/audio/speech.af_bella, af_sarah, am_adamили другой голос из веб-интерфейса Kokoro.nova, echo, и alloy могут подходить.?speech=en-US без &ttsprovider=). Для системного озвучивания может потребоваться захват звука рабочего стола или виртуального кабеля.Теги образов Docker могут меняться. Если команда из этого руководства перестала работать, проверьте актуальный тег на странице проекта: