Перевод речи и видео
Помимо речи на входе и выходе, AiHummer предлагает две дополнительные медиа-возможности: перевод речи и понимание видео. Распознавание и обработка видео могут выполняться локально; способ синтеза и перевода зависит от выбранных TTS и LLM. Перевод собирается из уже имеющихся сервисов STT/TTS и LLM, а видео — как отдельный дополнительный сервис, доступный по URL.
[!NOTE] Диаризации дикторов и клонирования голоса в продукте нет — эти возможности были удалены. Если вы встречали их в старых материалах, не рассчитывайте на них: голосовой стек — это STT, TTS, обработка аудиозапроса (
/v1/voice/turn), перевод речи и понимание видео.
Перевод речи
Перевод речи превращает аудио на одном языке в озвученный перевод на другом, чтобы агент мог обслуживать звонящих на разных языках. Это чистый конвейер перевода без обработки запроса агентом: входящее аудио распознаётся (STT), текст переводится одноразовым обращением к LLM, и перевод озвучивается (TTS).
аудио на входе ─▶ STT ─▶ перевод (LLM) ─▶ TTS ─▶ аудио на выходе
Отдельный сервис не нужен: конвейер использует те же сервисы, что и обработка
аудиозапроса, — faster-whisper (:8001, локально) и edge-tts (:8002,
внешний онлайн-сервис Microsoft) — плюс настроенного LLM-провайдера.
| Параметр | Значение |
|---|---|
| Endpoint | POST /v1/voice/translate?target=<lang> |
Параметр target |
Целевой язык (BCP-47 или название языка); обязателен |
| Вход | Аудио в теле запроса (Content-Type, по умолчанию audio/ogg) |
| Выход | Переведённое аудио (audio/mpeg) |
| Заголовки ответа | X-Voice-Transcript — исходный текст, X-Voice-Reply — перевод |
| Требует | Настроенные STT, TTS и LLM-провайдер |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<двоичное аудио>
Понимание видео
Понимание видео извлекает содержимое клипа, демультиплексируя аудио и выбирая ключевые кадры с помощью ffmpeg — в этом сервисе нет ML-модели; он готовит аудио и кадры для хода агента.
| Параметр | Значение |
|---|---|
| Основа | ffmpeg (демукс + ключевые кадры, без ML) |
| Порт сервиса | :8005 |
| Endpoint | POST /v1/video/understand |
| Подключается через | AIHUMMER_VIDEO_URL |
Подключение
Перевод речи не требует отдельной переменной: он активен, когда настроены STT,
TTS и LLM-провайдер. Понимание видео включается URL своего сервиса — это
настройка каталога, которую задают из веб-интерфейса (Управление →
Настройки) или командой aihummer settings set (gateway.env — только для
начальной загрузки и для неё игнорируется); установщик может развернуть его,
либо укажите на уже работающий экземпляр.
# Опциональный сервис видео
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] Возможности независимы — включайте только нужные. Развёртыванию, которому достаточно распознавания и синтеза, хватит пары STT/TTS; видео-сервис можно оставить не настроенным.
Куда дальше
- Базовый речевой тракт: Речь на входе и выходе.
- Как сервисы подключаются и используются совместно: Сервисы.