Taletolkning og video
Bortenfor tale inn og ut, AiHummer tilbyr to ekstra mediefunksjoner: taletolkning og videoforståelse. Begge kjører på gratis/lokale motorer: oversettelsen settes sammen fra STT/TTS-sidevognene og LLM-en du allerede har, mens videoen kjører som sin egen sidevogn nådd via URL.
[!NOTE] Høyttalerdialysering og stemmekloning er ikke en del av produktet — de funksjoner ble fjernet. Hvis du så dem i eldre materiale, ikke planlegg rundt dem: stemmestakken er STT, TTS, stemmesvingen (
/v1/voice/turn), taleoversettelse og videoforståelse.
Taletolking
Taleoversettelse gjør lyd på ett språk om til talelyd på et annet, slik at en agent kan betjene innringere på tvers av språk. Det er en ren oversettelsesprosess uten agentvending: den innkommende lyden blir transkribert (STT), teksten blir oversatt med en éngangs LLM-utførelse, og oversettelsen blir lest opp (TTS).
audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out
Ingen ekstra sidecar er nødvendig: pipeline bruker de samme gratis/lokale sidecarene som stemmesvingen — faster-whisper (:8001) og edge-tts (:8002) — pluss din konfigurerte LLM-leverandør.
| Vare | Verdi |
|---|---|
| Endepunkt | POST /v1/voice/translate?target=<lang> |
target parameter |
Mål språk (BCP-47 eller et vanlig språk navn); påkrevd |
| Inndata | Lyd i forespørselens kropp (Content-Type, standardinnstillinger til audio/ogg) |
| Utdata | Oversatt lyd (audio/mpeg) |
| Svaroverskrifter | X-Voice-Transcript — kilde tekst, X-Voice-Reply — oversettelsen |
| Krever | STT, TTS og en LLM-leverandør konfigurert |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<binary audio>
Videoforståelse
Videoforståelse utvinner hva en video inneholder ved å demuxe lyd og prøve ut nøkkelrammer med ffmpeg — det er ingen ML-modell i denne sidekaren; den forbereder lyd og rammer for agentens tur.
| Vare | Verdi |
|---|---|
| Støttet av | ffmpeg (demux + nøkkelrammer, ingen ML) |
| Sidecar-port | :8005 |
| Endepunkt | POST /v1/video/understand |
| Kablet med | AIHUMMER_VIDEO_URL |
Ledningsføring
Taleoversettelse trenger ingen dedikert variabel: den er aktiv så snart STT, TTS og en LLM-leverandør er konfigurert. Videoforståelse aktiveres via sin sidecar-URL — en kataloginnstilling du setter fra admin UI (Administrasjon → Innstillinger) eller med aihummer settings set (gateway.env er bare bootstrap og ignoreres for det); vertens native-installer kan provisionere det, eller peke på en instans du allerede kjører.
# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] Funksjonene er uavhengige — aktiver bare de du trenger. En distribusjon som bare trenger transkripsjon og syntese kan kjøre STT/TTS-paret alene og la videosidevognen være ukonfigurert.
Hvor til neste
- Standard talesti: Tale inn og ut.
- Hvordan sidevogner er koblet og delt: Sidevogner.