Tłumaczenie mowy i wideo
Poza mowa wchodząca i wychodząca, AiHummer oferuje dwie dodatkowe funkcje multimedialne: tłumaczenie mowy i zrozumienie wideo. Oba działają na darmowe/lokalne silniki: tłumaczenie jest składane z załączników STT/TTS oraz LLM, który już posiadasz, podczas gdy wideo działa osobno boczne siedzenie dostarczone przez URL.
[!NOTE] Diarization mówcy i klonowanie głosu są nie część produktu — te możliwości zostały usunięte. Jeśli widziałeś je w starszych materiałach, nie planuj wokół nich: stos głosowy to STT, TTS, kolejność głosu (
/v1/voice/turn), tłumaczenie mowy i rozumienie wideo.
Tłumaczenie mowy
Tłumaczenie mowy przekształca dźwięk w jednym języku w mówiony dźwięk w innym, dzięki czemu agent może obsługiwać rozmówców w różnych językach. Jest to czysty proces tłumaczenia bez interwencji agenta: przychodzące audio jest transkrybowane (STT), tekst jest tłumaczony przy użyciu jednorazowego uzupełnienia LLM, a tłumaczenie jest odtwarzane w formie mowy (TTS).
audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out
Nie jest potrzebny dodatkowy sidecar: pipeline używa tych samych darmowych/lokalnych sidecarów co voice turn — faster-whisper (:8001) i edge-tts (:8002) — plus Twój skonfigurowany dostawca LLM.
| Przedmiot | Wartość |
|---|---|
| Punkt końcowy | POST /v1/voice/translate?target=<lang> |
target parametr |
Język docelowy (BCP-47 lub zwykła nazwa języka); wymagany |
| Wejście | Dźwięk w treści żądania (Content-Type, domyślnie ustawione na audio/ogg) |
| Wyjście | Przetłumaczony dźwięk (audio/mpeg) |
| Nagłówki odpowiedzi | X-Voice-Transcript — źródło tekstu, X-Voice-Reply — tłumaczenie |
| Wymaga | STT, TTS i dostawca LLM skonfigurowani |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<binary audio>
Rozumienie wideo
Zrozumienie wideo wydobywa zawartość klipu poprzez demultipleksację audio i próbkowanie kluczowych klatek z ffmpeg — jest brak modelu ML w tym sidecarze; przygotowuje audio i klatki na turę agenta.
| Przedmiot | Wartość |
|---|---|
| Wsparte przez | ffmpeg (demultipleksacja + klatki kluczowe, bez ML) |
| Port sidecar | :8005 |
| Punkt końcowy | POST /v1/video/understand |
| Połączony przewodami | AIHUMMER_VIDEO_URL |
Okablowanie
Tłumaczenie mowy nie wymaga dedykowanej zmiennej: jest aktywne, gdy STT, TTS i dostawca LLM są skonfigurowani. Rozumienie wideo jest włączone przez jego adres URL sidecar — a ustawienie katalogu ustawiasz z interfejsu administracyjnego (Zarządzanie → Ustawienia) lub z aihummer settings set (gateway.env jest wyłącznie dla bootstrap i jest ignorowane w jego przypadku); instalator natywny dla hosta może go udostępnić lub wskazać na działającą już instancję.
# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] Możliwości są niezależne — włącz tylko te, których potrzebujesz. Wdrożenie który wymaga tylko transkrypcji i syntezy, może działać tylko para STT/TTS i pozostaw panel boczny wideo niekonfigurowany.
Dokąd dalej
- Domyślna ścieżka mowy: Mowa w górę i w dół.
- Jak są okablowane i współdzielone boczne wózki: Sidelivery.