Traduction de discours et vidéo
Au-delà discours entrant et sortant, AiHummer offre deux capacités médias supplémentaires : traduction de la parole et compréhension de la vidéo. Les deux fonctionnent sur moteurs gratuits/locaux: la traduction est assemblée à partir des sidecars STT/TTS et du LLM que vous avez déjà, tandis que la vidéo fonctionne indépendamment side-car atteint par URL.
[!NOTE] La diarisation des locuteurs et le clonage vocal sont pas partie du produit — ceux les capacités ont été supprimées. Si vous les avez vues dans du matériel plus ancien, ne prévoyez pas autour d’eux : la pile vocale est STT, TTS, le tour de parole (
/v1/voice/turn), traduction de la parole et compréhension vidéo.
Traduction de la parole
La traduction orale transforme l’audio dans une langue en audio parlé dans une autre, de sorte qu’un agent peut servir des appelants dans différentes langues. C’est un pipeline de traduction pure sans tour d’agent: l’audio entrant est transcrit (STT), le texte est traduit avec une complétion LLM en une seule fois, et la traduction est restituée oralement (TTS).
audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out
Aucun sidecar supplémentaire n’est nécessaire : le pipeline utilise les mêmes sidecars gratuits/locaux que le tour de voix — faster-whisper:8001) et edge-tts (:8002) — plus votre fournisseur de LLM configuré.
| Article | Valeur |
|---|---|
| Point de terminaison | POST /v1/voice/translate?target=<lang> |
target paramètre |
Langue cible (BCP-47 ou un nom de langue simple); requis |
| Entrée | Audio dans le corps de la requête (Content-Type, par défaut à audio/ogg) |
| Sortie | Audio traduit (audio/mpeg) |
| En-têtes de réponse | X-Voice-Transcript — texte source, X-Voice-Reply — la traduction |
| Exige | Fournisseur de STT, TTS et LLM configuré |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<binary audio>
Compréhension de la vidéo
La compréhension vidéo extrait ce qu’un clip contient en démultiplexant l’audio et en échantillonnant des images clés avec ffmpeg — il y a pas de modèle ML dans ce sidecar ; il prépare l’audio et les images pour le tour de l’agent.
| Article | Valeur |
|---|---|
| Soutenu par | ffmpeg (démux + images-clés, sans ML) |
| Port de side-car | :8005 |
| Point de terminaison | POST /v1/video/understand |
| Câblé avec | AIHUMMER_VIDEO_URL |
Câblage
La traduction vocale n’a pas besoin de variable dédiée : elle est active une fois que STT, TTS et un fournisseur LLM sont configurés. La compréhension vidéo est activée par son URL sidecar — un paramètre de catalogue vous configurez depuis l’interface d’administration (Gestion → Paramètres) ou avec aihummer settings set (gateway.env est uniquement bootstrap et ignoré pour cela); l’installateur natif de l’hôte peut le provisionner, ou pointer vers une instance que vous exécutez déjà.
# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] Les capacités sont indépendantes — n’activez que celles dont vous avez besoin. Un déploiement qui a juste besoin de transcription et de synthèse peut exécuter seule la paire STT/TTS et laissez le sidecar vidéo non configuré.
Où aller ensuite
- Le chemin de parole par défaut : Discours entrant et sortant.
- Comment les side-cars sont câblés et partagés : Side-cars.