AiHummer
Français
ConnexionCompte
v1.0.x
{ }Swagger

Traduction de discours et vidéo

v1.0.x · mis à jour 2026-07-05

Au-delà discours entrant et sortant, AiHummer offre deux capacités médias supplémentaires : traduction de la parole et compréhension de la vidéo. Les deux fonctionnent sur moteurs gratuits/locaux: la traduction est assemblée à partir des sidecars STT/TTS et du LLM que vous avez déjà, tandis que la vidéo fonctionne indépendamment side-car atteint par URL.

[!NOTE] La diarisation des locuteurs et le clonage vocal sont pas partie du produit — ceux les capacités ont été supprimées. Si vous les avez vues dans du matériel plus ancien, ne prévoyez pas autour d’eux : la pile vocale est STT, TTS, le tour de parole (/v1/voice/turn), traduction de la parole et compréhension vidéo.

Traduction de la parole

La traduction orale transforme l’audio dans une langue en audio parlé dans une autre, de sorte qu’un agent peut servir des appelants dans différentes langues. C’est un pipeline de traduction pure sans tour d’agent: l’audio entrant est transcrit (STT), le texte est traduit avec une complétion LLM en une seule fois, et la traduction est restituée oralement (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

Aucun sidecar supplémentaire n’est nécessaire : le pipeline utilise les mêmes sidecars gratuits/locaux que le tour de voix — faster-whisper:8001) et edge-tts (:8002) — plus votre fournisseur de LLM configuré.

Article Valeur
Point de terminaison POST /v1/voice/translate?target=<lang>
target paramètre Langue cible (BCP-47 ou un nom de langue simple); requis
Entrée Audio dans le corps de la requête (Content-Type, par défaut à audio/ogg)
Sortie Audio traduit (audio/mpeg)
En-têtes de réponse X-Voice-Transcript — texte source, X-Voice-Reply — la traduction
Exige Fournisseur de STT, TTS et LLM configuré
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Compréhension de la vidéo

La compréhension vidéo extrait ce qu’un clip contient en démultiplexant l’audio et en échantillonnant des images clés avec ffmpeg — il y a pas de modèle ML dans ce sidecar ; il prépare l’audio et les images pour le tour de l’agent.

Article Valeur
Soutenu par ffmpeg (démux + images-clés, sans ML)
Port de side-car :8005
Point de terminaison POST /v1/video/understand
Câblé avec AIHUMMER_VIDEO_URL

Câblage

La traduction vocale n’a pas besoin de variable dédiée : elle est active une fois que STT, TTS et un fournisseur LLM sont configurés. La compréhension vidéo est activée par son URL sidecar — un paramètre de catalogue vous configurez depuis l’interface d’administration (Gestion → Paramètres) ou avec aihummer settings set (gateway.env est uniquement bootstrap et ignoré pour cela); l’installateur natif de l’hôte peut le provisionner, ou pointer vers une instance que vous exécutez déjà.

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Les capacités sont indépendantes — n’activez que celles dont vous avez besoin. Un déploiement qui a juste besoin de transcription et de synthèse peut exécuter seule la paire STT/TTS et laissez le sidecar vidéo non configuré.

Où aller ensuite