AiHummer
Հայերեն
ՄուտքԱնձնական գրասենյակ
v1.0.x
{ }Swagger

Խոսքի և տեսանյութի թարգմանություն

v1.0.x · թարմացվել է 2026-07-05

Համար խոսք ներսի և բարի կողմի մեջ, AiHummer առաջարկում է երկու լրացուցիչ մեդիա հնարավորություններ: խոսքի թարգմանություն և վիդեոյի ըմբռնում. Երկուսն էլ աշխատում են անվճար/տեղային շարժիչներ: թարգմանությունը կազմում են STT/TTS օգնական մոդուլները և ձեր ունեցած LLM-ը, իսկ վիդեոն աշխատում է ինքնուրույն տրանսպորտային քարշակ հասանելի է URL-ով։

[!NOTE] Խոսափողի դիարիզացիան և ձայնի կլոնավորումը հանդիսանում են ոչ արտադրանքի մի մասը՝ նրանք հնարավորությունները հեռացվել են։ Եթե ​​դրանք տեսել եք հին նյութերում, մի պլանավորեք նրանց շուրջը՝ ձայնային աստիճանը՝ դա STT, TTS, ձայնային անցք (/v1/voice/turn), բառացիորեն թարգմանություն և տեսանյութի ըմբռնում

Ընդհանուր խոսքի թարգմանություն

Խոսքի թարգմանությունը մի լեզվով աուդիո է վերածում մյուս լեզվով բանավոր աուդիոյի, որպեսզի գործակալը կարողանա սպասարկել տարբեր լեզուներով զանգողներին: Սա հանդիսանում է մաքուր թարգմանության կոնվեյեր առանց գործակալի մասնակցության: ներընթեռնող աուդիոձայնը տրանսկրիբացվում է (STT), տեքստը թարգմանվում է մեկ անգամ կատարվող LLM-ի միջոցով, և թարգմանությունը վերծանվում է բանավոր կերպով (TTS).

audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out

Լրացուցիչ սայլդքարը պահանջված չէ՝ կոնվեյերը օգտագործում է այն նույն անվճար/տեղական սայլդքարները, ինչ ձայնային պտույտը — faster-whisper (:8001) և edge-tts (:8002) — հավելյալ ձեր կարգավորված LLM մատակարարը.

Թեմա Արժեք
Վերջնական կետ POST /v1/voice/translate?target=<lang>
target Պարամետր Թիրախային լեզու (BCP-47 կամ լեզվի պարզ անվանում)։ պահանջվում է
Մուտք Աուդիո հարցման տեքստում (Content-Type, ըստ լռության audio/ogg)
Եզրակացություն Թարգմանված աուդիո (audio/mpeg)
Պատասխանի վերնագրեր X-Voice-Transcript — սկզբնական տեքստ, X-Voice-Reply — թարգմանություն
Պահանջում է STT, TTS և LLM մատակարարը կարգավորված է
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg

<binary audio>

Վիդեոյի ըմբռնում

Տվյալ տեսահոլովակի հասկացումը դուրս է բերում կլիպի բովանդակությունը՝ աուդիոյի դեզմուլտիպլեքսավորմամբ և հիմնական կադրերի ընտրությամբ ffmpeg — կա չկա ԱԻ մոդել այս սայդմանյակում; նա պատրաստում է աուդիոն և կադրերը գործիչի ընթացքի համար։

Թեմա Արժեք
Ընդունելի ffmpeg (դեմուլտիպլեքսավորում + հիմնական ֆրեյմեր, առանց ԱԻ)
Պորտ սայդկարա :8005
Վերջնական կետ POST /v1/video/understand
Միացված AIHUMMER_VIDEO_URL

Կապ

Բացատրության թարգմանությունը հատուկ փոփոխական չի պահանջում․ այն ակտիվ է, ինչպես միայն կարգավորվեն STT-ն, TTS-ը և LLM մատակարարը։ Վիդեոյի հասկացումը միանում է իր օժանդակ URL-ի միջոցով՝ a կոնտենտի կարգավորումներ դուք տեղադրում եք վարչարարական ինտերֆեյսից (Կառավարում → Ներմուծումներ) կամ հետ aihummer settings set (gateway.env միայն bootstrap-ի համար է և անտեսվում է նրա համար); հոստում աշխատող տեղադրիչը կարող է այն կարգավորել կամ նշել արդեն աշխատող օրինակը։

# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005

[!TIP] Հնարավորությունները անկախ են՝ միակակորեն միացրեք միայն այնպիսիք, որոնք ձեզ անհրաժեշտ են։ Տեղադրում ինքը պարզապես ցանկանում է տրանսկրիպցիա և սինթեզ, միայն STT/TTS զույգ կարող է գործել և թողեք վիդեո սայդքարը չկոնֆիգուրացված։

Որտեղից հետո