Taleoversættelse & video
Udover tale ind og ud, AiHummer tilbyder to yderligere mediefunktioner: taleoversættelse og videoforståelse. Begge kører på gratis/lokale motorer: oversættelsen samles fra STT/TTS-sidevogne og den LLM, du allerede har, mens videoen kører som sin egen sidevogn opnået via URL.
[!NOTE] Talerdiarisering og stemmekloning er ikke en del af produktet — de funktionaliteter blev fjernet. Hvis du så dem i ældre materiale, skal du ikke planlægge omkring dem: stemmestakken er STT, TTS, stemmeskiftet (
/v1/voice/turn), taleoversættelse og videoforståelse.
Taletoversættelse
Taleoversættelse omdanner lyd på ét sprog til talt lyd på et andet, så en agent kan betjene opkaldere på tværs af sprog. Det er en ren oversættelsespipeline uden agentomslag: den indkommende lyd transskriberes (STT), teksten oversættes med en one-shot LLM-fuldførelse, og oversættelsen læses op igen (TTS).
audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out
Der er ikke brug for en ekstra sidecar: pipelinen bruger de samme gratis/lokale sidecars som stemmevendingen — faster-whisper (:8001) og edge-tts (:8002) — plus din konfigurerede LLM-udbyder.
| Vare | Værdi |
|---|---|
| Endepunkt | POST /v1/voice/translate?target=<lang> |
target parameter |
Mål sprog (BCP-47 eller et almindeligt sprognavn); påkrævet |
| Input | Lyd i anmodningens indhold (Content-Type, som standard til audio/ogg) |
| Output | Oversat lyd (audio/mpeg) |
| Svaroverskrifter | X-Voice-Transcript — kildetekst, X-Voice-Reply — oversættelsen |
| Kræver | STT, TTS og en LLM-udbyder konfigureret |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<binary audio>
Videoforståelse
Videoforståelse udtrækker, hvad et klip indeholder, ved at demultiplexe lyd og udtage nøgleframes med ffmpeg — der er ingen ML-model i denne sidevogn; den forbereder lyd og billeder til agentens tur.
| Vare | Værdi |
|---|---|
| Støttet af | ffmpeg (demux + keyframes, ingen ML) |
| Sidecar-port | :8005 |
| Endepunkt | POST /v1/video/understand |
| Forbundet med | AIHUMMER_VIDEO_URL |
Ledningsføring
Taleoversættelse behøver ingen dedikeret variabel: den er aktiv, når STT, TTS og en LLM-udbyder er konfigureret. Videoforståelse aktiveres via dens sidecar-URL — en katalogindstilling du indstiller fra admin-brugerfladen (Administration → Indstillinger) eller med aihummer settings set (gateway.env er kun bootstrap og ignoreres for det); den host-native installer kan provisionere det eller pege på en instans, du allerede kører.
# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] Kapabiliteterne er uafhængige — aktiver kun dem, du har brug for. En implementering der bare har brug for transskription og syntese kan køre STT/TTS-parret alene og lad videosidevognen være ukonfigureret.
Hvor til næste
- Standard talesti: Tale ind og ud.
- Hvordan sidevogne er forbundet og delt: Sidevogne.