AiHummer
Polski
Zaloguj sięKonto
v1.1.x
{ }Swagger

Tłumaczenie mowy i wideo

v1.1.x · zaktualizowany 2026-07-05

Poza mowa wchodząca i wychodząca, AiHummer oferuje dwie dodatkowe funkcje multimedialne: tłumaczenie mowy i zrozumienie wideo. Oba działają na darmowe/lokalne silniki: tłumaczenie jest składane z załączników STT/TTS oraz LLM, który już posiadasz, podczas gdy wideo działa osobno boczne siedzenie dostarczone przez URL.

[!NOTE] Diarization mówcy i klonowanie głosu są nie część produktu — te możliwości zostały usunięte. Jeśli widziałeś je w starszych materiałach, nie planuj wokół nich: stos głosowy to STT, TTS, kolejność głosu (/v1/voice/turn), tłumaczenie mowy i rozumienie wideo.

Tłumaczenie mowy

Tłumaczenie mowy przekształca dźwięk w jednym języku w mówiony dźwięk w innym, dzięki czemu agent może obsługiwać rozmówców w różnych językach. Jest to czysty proces tłumaczenia bez interwencji agenta: przychodzące audio jest transkrybowane (STT), tekst jest tłumaczony przy użyciu jednorazowego uzupełnienia LLM, a tłumaczenie jest odtwarzane w formie mowy (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

Nie jest potrzebny dodatkowy sidecar: pipeline używa tych samych darmowych/lokalnych sidecarów co voice turn — faster-whisper (:8001) i edge-tts (:8002) — plus Twój skonfigurowany dostawca LLM.

Przedmiot Wartość
Punkt końcowy POST /v1/voice/translate?target=<lang>
target parametr Język docelowy (BCP-47 lub zwykła nazwa języka); wymagany
Wejście Dźwięk w treści żądania (Content-Type, domyślnie ustawione na audio/ogg)
Wyjście Przetłumaczony dźwięk (audio/mpeg)
Nagłówki odpowiedzi X-Voice-Transcript — źródło tekstu, X-Voice-Reply — tłumaczenie
Wymaga STT, TTS i dostawca LLM skonfigurowani
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Rozumienie wideo

Zrozumienie wideo wydobywa zawartość klipu poprzez demultipleksację audio i próbkowanie kluczowych klatek z ffmpeg — jest brak modelu ML w tym sidecarze; przygotowuje audio i klatki na turę agenta.

Przedmiot Wartość
Wsparte przez ffmpeg (demultipleksacja + klatki kluczowe, bez ML)
Port sidecar :8005
Punkt końcowy POST /v1/video/understand
Połączony przewodami AIHUMMER_VIDEO_URL

Okablowanie

Tłumaczenie mowy nie wymaga dedykowanej zmiennej: jest aktywne, gdy STT, TTS i dostawca LLM są skonfigurowani. Rozumienie wideo jest włączone przez jego adres URL sidecar — a ustawienie katalogu ustawiasz z interfejsu administracyjnego (Zarządzanie → Ustawienia) lub z aihummer settings set (gateway.env jest wyłącznie dla bootstrap i jest ignorowane w jego przypadku); instalator natywny dla hosta może go udostępnić lub wskazać na działającą już instancję.

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Możliwości są niezależne — włącz tylko te, których potrzebujesz. Wdrożenie który wymaga tylko transkrypcji i syntezy, może działać tylko para STT/TTS i pozostaw panel boczny wideo niekonfigurowany.

Dokąd dalej