Hugging Face собрала open-source стек для локальных голосовых агентов

МЕНЮ


Главная страница
Поиск
Регистрация на сайте
Помощь проекту
Архив новостей

ТЕМЫ


Новости ИИРазработка ИИВнедрение ИИРабота разума и сознаниеМодель мозгаРобототехника, БПЛАТрансгуманизмОбработка текстаТеория эволюцииДополненная реальностьЖелезоКиберугрозыНаучный мирИТ индустрияРазработка ПОТеория информацииМатематикаЦифровая экономика

Авторизация



2026-07-24 11:13

примеры ии

Репозиторий `speech-to-speech` содержит модульный пайплайн с низкой задержкой:

`VAD ? STT ? LLM ? TTS`

Каждый компонент можно заменить. Для распознавания речи поддерживаются Parakeet TDT, Whisper, Faster Whisper и Paraformer. Для генерации голоса доступны Qwen3-TTS, Kokoro, Pocket TTS, ChatTTS и MMS.

LLM можно запускать через облачный OpenAI-совместимый API либо локально через Transformers, MLX, vLLM или llama.cpp. Весь стек способен работать на собственном железе без передачи аудио внешнему сервису.

Сервер поддерживает протокол OpenAI Realtime и WebSocket-эндпоинт `/v1/realtime`. Это позволяет подключать существующие клиенты с потоковой передачей аудио, транскрипцией, прерыванием ответа и tool calling.

Запуск:

```

pip install speech-to-speech

speech-to-speech

```

По умолчанию используются Parakeet TDT для распознавания и Qwen3-TTS для синтеза речи. Есть отдельные режимы для локального микрофона, WebSocket, TCP и Docker. Проект уже используется как разговорный бэкенд для тысяч роботов Reachy Mini.

Лицензия: Apache 2.0.

https://github.com/huggingface/speech-to-speech


Телеграм: t.me/ainewsline

Источник: github.com

Комментарии: