AiHummer
Deutsch
AnmeldenKonto
v1.0.x
{ }Swagger

Sprachübersetzung & Video

v1.0.x · aktualisiert 2026-07-05

Jenseits sprechen ein und aus, AiHummer bietet zwei zusätzliche Medienfunktionen: Sprachübersetzung und Videoverständnis. Beide laufen auf freie/lokale Motoren: Die Übersetzung wird aus den STT/TTS-Sidecars und dem LLM, das Sie bereits haben, zusammengefügt, während das Video eigenständig läuft Sidecars über die URL erreicht.

[!NOTE] Sprecherdiarisierung und Stimmklonung sind nicht Teil des Produkts — diese Fähigkeiten wurden entfernt. Wenn Sie sie in älterem Material gesehen haben, planen Sie nicht um sie herum: der Sprachstapel ist STT, TTS, die Sprachwende (/v1/voice/turn), Sprachübersetzung und Videowiedergabe.

Sprachübersetzung

Sprachübersetzung verwandelt Audio in einer Sprache in gesprochene Audio in einer anderen, sodass ein Agent Anrufer über Sprachgrenzen hinweg bedienen kann. Es ist ein reine Übersetzungspipeline ohne Agentenwechsel: Der eingehende Ton wird transkribiert (STT), der Text wird mit einer One-Shot-LLM-Vervollständigung übersetzt, und die Übersetzung wird zurückgesprochen (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

Kein zusätzlicher Sidecar wird benötigt: Die Pipeline verwendet dieselben kostenlosen/lokalen Sidecars wie die Sprachsequenz — faster-whisper (:8001) und edge-tts (:8002) — plus Ihr konfigurierter LLM-Anbieter.

Artikel Wert
Endpunkt POST /v1/voice/translate?target=<lang>
target Parameter Zielsprache (BCP-47 oder ein einfacher Sprachname); erforderlich
Eingabe Audio im Anforderungstext (Content-Type, standardmäßig auf audio/ogg)
Ausgabe Übersetztes Audio (audio/mpeg)
Antwort-Header X-Voice-Transcript — Quelltext, X-Voice-Reply — die Übersetzung
Erfordert STT-, TTS- und ein LLM-Anbieter konfiguriert
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Videoverständnis

Videoverstehen extrahiert, was ein Clip enthält, indem Audio demultiplext und Schlüsselbilder abgetastet werden mit ffmpeg — es gibt kein ML-Modell In diesem Sidecar; es bereitet Audio und Frames für den Agenten-Durchgang vor.

Artikel Wert
Unterstützt von ffmpeg (demux + Keyframes, kein ML)
Sidecar-Anschluss :8005
Endpunkt POST /v1/video/understand
Verdrahtet mit AIHUMMER_VIDEO_URL

Verdrahtung

Die Spracherkennung benötigt keine eigene Variable: Sie ist aktiv, sobald STT, TTS und ein LLM-Anbieter konfiguriert sind. Videoverständnis wird durch seine Sidecar-URL aktiviert — eine Katalogeinstellung Sie legen dies über die Admin-Oberfläche fest (Management → Einstellungen) oder mit aihummer settings set (gateway.env ist nur für Bootstrap und wird dafür ignoriert); der host-native Installer kann es bereitstellen oder auf eine Instanz verweisen, die Sie bereits ausführen.

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Die Fähigkeiten sind unabhängig — aktiviere nur die, die du benötigst. Eine Bereitstellung das nur Transkription und Synthese benötigt, kann das STT/TTS-Paar allein ausführen und Lassen Sie das Video-Sidecar unkonfiguriert.

Wohin als Nächstes