AiHummer
Svenska
Logga inKonto
v1.1.x
{ }Swagger

Taltolkning och video

v1.1.x · uppdaterad 2026-07-05

Bortom tal in och ut, AiHummer erbjuder två ytterligare mediakapaciteter: taltolkning och videoförståelse. Både körs på gratis/lokala motorer: översättningen sätts samman från STT/TTS-sidvagnen och LLM du redan har, medan videon körs som sin egen sidvagn åtkomlig via URL.

[!NOTE] Talardiarisering och röstkloning är inte en del av produkten — de funktioner togs bort. Om du såg dem i äldre material, planera inte runt dem: röststacken är STT, TTS, rösttur (/v1/voice/turn), talöversättning och videoförståelse.

Talöversättning

Talöversättning omvandlar ljud på ett språk till talat ljud på ett annat, så att en agent kan serva uppringare på olika språk. Det är en ren översättningspipeline utan agentomgång: den inkommande ljudet transkriberas (STT), texten översätts med en one-shot LLM-completion, och översättningen talas tillbaka (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

Ingen extra sidovagn behövs: pipelinen använder samma gratis/lokala sidovagnar som röstvändningen — faster-whisper (:8001) och edge-tts (:8002) — plus din konfigurerade LLM-leverantör.

Artikel Värde
Slutpunkt POST /v1/voice/translate?target=<lang>
target parameter Mål språk (BCP-47 eller ett vanligt språk namn); krävs
Inmatning Ljud i begärans kropp (Content-Type, standardvärde är audio/ogg)
Utdata Översatt ljud (audio/mpeg)
Svarshuvuden X-Voice-Transcript — källtext, X-Voice-Reply — översättningen
Kräver STT, TTS och en LLM-leverantör konfigurerad
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Videoförståelse

Videoförståelse extraherar vad ett klipp innehåller genom att demuxa ljud och sampla nyckelbilder med ffmpeg — det finns ingen ML-modell i denna sidovagn; den förbereder ljud och ramar för agentens tur.

Artikel Värde
Stöds av ffmpeg (demux + nyckelbilder, ingen ML)
Sidecar-port :8005
Slutpunkt POST /v1/video/understand
Uppkopplad med AIHUMMER_VIDEO_URL

Kablar

Talöversättning behöver ingen särskild variabel: den är aktiv när STT, TTS och en LLM-leverantör är konfigurerade. Videoförståelse aktiveras av dess sidovagns-URL — en kataloginställning du ställer in från administrationsgränssnittet (Administration → Inställningar) eller med aihummer settings set (gateway.env är enbart för bootstrap och ignoreras för det); installationsprogrammet som körs på värden kan tillhandahålla det, eller peka på en instans du redan kör.

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Kapaciteterna är oberoende — aktivera endast de du behöver. En distribution som bara behöver transkription och syntes kan köra STT/TTS-paret ensam och lämna videositens sidvagn okonfigurerad.

Vart härnäst