AiHummer
Հայերեն
ՄուտքԱնձնական գրասենյակ
v1.1.x
{ }Swagger

Մուտքային և ելքային խոսք (STT / TTS)

v1.1.x · թարմացվել է 2026-07-05

AiHummer գրիչներ խոսք մտքից և խոսք տուփից դուրս — խոսքի սինթեզի համար վճարովի API անհրաժեշտ չէ: Մուտքային աուդիոկլիպը տառափոխվում է (STT), տեքստը կառավարում է գործակալի սովորական ընթացքն, և պատասխանը արտասանվում է (TTS): Երկուսն էլ շարժիչներ են անվճար և տեղական և գործարկել որպես տրանսպորտային քարշակներ: faster-whisper զանգվածաթարգմանության համար և edge-tts տեքստի սինթեզի համար.

Ինչպես է գործում ձայնային պտույտը

Ձայնի պտույտը սովորական է՝ աուդիոյով երկու ծայրերում գործող գործչի պտույտը՝

  1. Դարպասը ուղարկում է մուտքային աուդիոսիգնալը դեպի STT կողքավագոն (:8001, faster-whisper) և ստանում է կրկին տեքստը:
  2. Այն տեքստը շարժում է սովորական ֆունկցիան կանչող շրջադարձը — նույն երթղիչը, եկանակարը, ինտերմենտներ և հիշողություն որպես տեքստային հաղորդագրություն։
  3. Պատասխանի տեքստը ուղարկվում է TTS կայքարար (:8002, edge-tts) և Ձայնային աուդիոն զանգահարողին վերադարձվում է։

Սա ներկայացված է որպես մեկ վերջնակետ, POST /v1/voice/turn, որպեսզի ալիքը կամ հաճախորդը կարողանան փոխանցել և ստանալ աուդիո առանց անհրաժեշտության ինքնուրույն կազմակերպել այս քայլերը:

Վերջնական կետեր

Մեթոդ Վերջնական կետ Նպատակ
POST /v1/voice/turn Աուդիո մուտք → գործակալի ընթացք → աուդիո ելք
GET /v1/voice/config Ընթացիկ ձայնային կազմաձևը ( շարժիչներ, կարգավորման ձեռնանուշեր )
POST /v1/voice/turn HTTP/1.1
Host: localhost:8780
Content-Type: application/json

{
  "audio": "<base64-encoded clip>",
  "format": "wav"
}

[!NOTE] Խոսքային հնարավորությունները միջուկի մաս են և կապված չեն SIP պլագինի հետ։ SIP-չանն օգտագործում է նույն այդ STT/TTS շարժիչները իր համար local շարժիչ, բայց ձայն մուտք/ելք աշխատում է ցանկացած հաճախորդի համար, որը կանչում է /v1/voice/turn.

Ձայնային սայդքեր

Փորտ Սայդքար Շարժիչ Ռոլ Միացված
8001 STT արագ-հիշատակ խոսք → տեքստ AIHUMMER_STT_URL
8002 ԹԱԿ edge-tts տեքստ → խոսք AIHUMMER_TTS_URL

Երկու շարժական շարժիչներն էլ անվճար և տեղային են՝ ոչինչ չի ուղարկվում վճարովի ձայնային ծառայություններ ապահովողին: Ինչպես յուրաքանչյուր սիդքարով, նրանց հասնում է դարպասը ըստ URL, որպեսզի դուք կարողանաք դրանք գործարկել դարպասի կողքո՞ր կամ մատնանշել ընդհանուր օրինակին.

Կապ

Հոսթ սարքի ծրագրակատարը ինքն է սահմանում STT-ի և TTS-ի URL-ը: Նրանք կատալոգի կարգավորումներ — փոփոխել դրանք վարչարարի ինտերֆեյսից (Կառավարում → Ներմուծումներ) կամ հետ aihummer settings set; gateway.env միայն bootstrap-ի համար և անտեսվում է դրանց համար:

# Voice in/out (auto-configured by the installer)
aihummer settings set AIHUMMER_STT_URL http://127.0.0.1:8001
aihummer settings set AIHUMMER_TTS_URL http://127.0.0.1:8002

[!TIP] Քանի որ յուրաքանչյուր սայդքարը պարզապես URL է, մի քանի գեյթվեյ կարող են կիսվել մեկ STT/TTS-ով օրինակ. Կենտրոնացրեք առավել ծանր խոսքը սերվիսներ փոխարեն յուրաքանչյուրի համար պատճեն սկսելու հոստ.

Աուդիոյի ճանապարհի կարգավորում

Ձայնի որակների կարգավորիչները գտնվում են Մեդիա · Ձայն Կարգավորումների խումբ, որը կարելի է կարգավորել ադմինիստրատորի վեբ ինտերֆեյսի միջոցով՝ կրկնակի տեղակայումը անհրաժեշտ չէ։ Դրանք ընդգրկում են իրական ժամանակում աուդիո փոխանցման ուղին՝

Գրիչ Ինչ է սա վերահսկում
Դուպլեքս Լրիվ երկակի ռեժիմ (լսում խոսքերի ընթացքում) ընդդեմ կիսադւեկայն ռեժիմի
ԱԷԿ Ակուստիկ զտում էհոյի
Հնչյունի ճնշում Զտում է ֆոնային աղմուկը մինչև STT
AGC Ավտոմատ ուժային կառավարման (ստպման մակարդակ)
VAD շեմ Ձայնային ակտիվության հայտնաբերման զգայունություն
Միջամտություն զրույցին Թույլ տալ զանգը զանգողին ընդհատել գործակալի պատասխանն ուղիղ կեսում

GET /v1/voice/config վերադարձնում է արդյունավետ կազմաձև, որպեսզի հաճախորդը կարողանա որոշել ակտիվ շարժիչները և այս կարգավորումները։

Որտեղից հետո