AiHummer
Dansk
Log indKonto
v1.2.x
{ }Swagger

Taleoversættelse & video

v1.2.x · opdateret 2026-07-05

Udover tale ind og ud, AiHummer tilbyder to yderligere mediefunktioner: taleoversættelse og videoforståelse. Begge kører på gratis/lokale motorer: oversættelsen samles fra STT/TTS-sidevogne og den LLM, du allerede har, mens videoen kører som sin egen sidevogn opnået via URL.

[!NOTE] Talerdiarisering og stemmekloning er ikke en del af produktet — de funktionaliteter blev fjernet. Hvis du så dem i ældre materiale, skal du ikke planlægge omkring dem: stemmestakken er STT, TTS, stemmeskiftet (/v1/voice/turn), taleoversættelse og videoforståelse.

Taletoversættelse

Taleoversættelse omdanner lyd på ét sprog til talt lyd på et andet, så en agent kan betjene opkaldere på tværs af sprog. Det er en ren oversættelsespipeline uden agentomslag: den indkommende lyd transskriberes (STT), teksten oversættes med en one-shot LLM-fuldførelse, og oversættelsen læses op igen (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

Der er ikke brug for en ekstra sidecar: pipelinen bruger de samme gratis/lokale sidecars som stemmevendingen — faster-whisper (:8001) og edge-tts (:8002) — plus din konfigurerede LLM-udbyder.

Vare Værdi
Endepunkt POST /v1/voice/translate?target=<lang>
target parameter Mål sprog (BCP-47 eller et almindeligt sprognavn); påkrævet
Input Lyd i anmodningens indhold (Content-Type, som standard til audio/ogg)
Output Oversat lyd (audio/mpeg)
Svaroverskrifter X-Voice-Transcript — kildetekst, X-Voice-Reply — oversættelsen
Kræver STT, TTS og en LLM-udbyder konfigureret
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Videoforståelse

Videoforståelse udtrækker, hvad et klip indeholder, ved at demultiplexe lyd og udtage nøgleframes med ffmpeg — der er ingen ML-model i denne sidevogn; den forbereder lyd og billeder til agentens tur.

Vare Værdi
Støttet af ffmpeg (demux + keyframes, ingen ML)
Sidecar-port :8005
Endepunkt POST /v1/video/understand
Forbundet med AIHUMMER_VIDEO_URL

Ledningsføring

Taleoversættelse behøver ingen dedikeret variabel: den er aktiv, når STT, TTS og en LLM-udbyder er konfigureret. Videoforståelse aktiveres via dens sidecar-URL — en katalogindstilling du indstiller fra admin-brugerfladen (Administration → Indstillinger) eller med aihummer settings set (gateway.env er kun bootstrap og ignoreres for det); den host-native installer kan provisionere det eller pege på en instans, du allerede kører.

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Kapabiliteterne er uafhængige — aktiver kun dem, du har brug for. En implementering der bare har brug for transskription og syntese kan køre STT/TTS-parret alene og lad videosidevognen være ukonfigureret.

Hvor til næste