भाषण अनुवाद और वीडियो
पार भाषण अंदर और बाहरAiHummer दो अतिरिक्त मीडिया क्षमताएँ प्रदान करता है: भाषण अनुवाद और वीडियो समझ. दोनों पर चलते हैं मुफ्त/स्थानीय इंजन: अनुवाद STT/TTS साइडकार और आपके पास पहले से मौजूद LLM से इकट्ठा किया जाता है, जबकि वीडियो अपने आप चलता है साइडकार यूआरएल द्वारा पहुँचा गया।
[!NOTE] स्पीकर डायराइजेशन और वॉइस क्लोनिंग हैं नहीं उत्पाद का हिस्सा — वे क्षमताएँ हटा दी गईं। यदि आपने उन्हें पुराने सामग्री में देखा था, तो योजना न बनाएं उनके आसपास: वॉइस स्टैक है STT, TTS, वॉइस टर्न (
/v1/voice/turn), भाषण अनुवाद और वीडियो समझ।
भाषण अनुवाद
भाषण अनुवाद एक भाषा में ऑडियो को दूसरी भाषा में बोले जाने वाले ऑडियो में बदल देता है, ताकि एक एजेंट विभिन्न भाषाओं में कॉल करने वालों की सेवा कर सके। यह एक बिना किसी एजेंट के टर्न के साथ शुद्ध अनुवाद पाइपलाइन: इनबाउंड ऑडियो को ट्रांसक्राइब किया जाता है (STT), टेक्स्ट का अनुवाद वन-शॉट LLM कम्प्लीशन के साथ किया जाता है, और अनुवाद को वापस बोला जाता है (TTS).
audio in ─▶ STT ─▶ translate (LLM) ─▶ TTS ─▶ audio out
किसी अतिरिक्त साइडकार की जरूरत नहीं है: पाइपलाइन वही मुफ्त/स्थानीय साइडकार इस्तेमाल करती है जो वॉइस टर्न इस्तेमाल करता है — faster-whisper (:8001) और edge-tts (:8002) — साथ ही आपका कॉन्फ़िगर किया गया LLM प्रदाता।
| वस्तु | मूल्य |
|---|---|
| अंत बिंदु | POST /v1/voice/translate?target=<lang> |
target पैरामीटर |
लक्ष्य भाषा (BCP-47 या एक साधारण भाषा का नाम); आवश्यक |
| इनपुट | अनुरोध बॉडी में ऑडियो (Content-Type, डिफ़ॉल्ट रूप से audio/ogg) |
| आउटपुट | अनूदित ऑडियो (audio/mpeg) |
| प्रतिक्रिया हेडर | X-Voice-Transcript — स्रोत पाठ, X-Voice-Reply — अनुवाद |
| की आवश्यकता है | STT, TTS और एक LLM प्रदाता कॉन्फ़िगर किया गया |
POST /v1/voice/translate?target=en HTTP/1.1
Host: localhost:8780
Content-Type: audio/ogg
<binary audio>
वीडियो समझ
वीडियो समझना यह बताता है कि एक क्लिप में क्या है, ऑडियो को डिमक्स करके और कीफ़्रेम्स को सैंपल करके एफएफएमपीईजी — है कोई ML मॉडल नहीं इस साइडकार में; यह एजेंट टर्न के लिए ऑडियो और फ्रेम तैयार करता है।
| वस्तु | मूल्य |
|---|---|
| के द्वारा समर्थित | ffmpeg (डिमक्स + कीफ़्रेम, कोई ML नहीं) |
| साइडकार पोर्ट | :8005 |
| अंत बिंदु | POST /v1/video/understand |
| वायर से जुड़ा हुआ | AIHUMMER_VIDEO_URL |
वायरिंग
स्पीच ट्रांसलेशन के लिए किसी समर्पित वेरिएबल की आवश्यकता नहीं है: यह सक्रिय होता है जब STT, TTS और एक LLM प्रदाता कॉन्फ़िगर किया जाता है। वीडियो समझ इसके साइडकार URL द्वारा सक्षम होती है — एक कैटलॉग सेटिंग आप एडमिन यूआई से सेट करते हैं (प्रबंधन → सेटिंग्स) या के साथ aihummer settings set (gateway.env यह केवल बूटस्ट्रैप के लिए है और इसे इसके लिए अनदेखा किया जाता है); होस्ट-नेटिव इंस्टॉलर इसे प्रोविजन कर सकता है, या उस इंस्टेंस की ओर संकेत कर सकता है जिसे आप पहले से चला रहे हैं।
# Optional video sidecar
aihummer settings set AIHUMMER_VIDEO_URL http://127.0.0.1:8005
[!TIP] क्षमताएँ स्वतंत्र हैं — केवल उन्हीं को सक्षम करें जिनकी आपको आवश्यकता है। एक तैनाती जिसे सिर्फ प्रतिलेखन और संश्लेषण की आवश्यकता है, वह अकेले STT/TTS जोड़ी चला सकता है और वीडियो साइटकार को अनकन्फ़िगर्ड छोड़ दें।
अगला कहाँ
- डिफ़ॉल्ट भाषण पथ: भाषण इन और आउट.
- साइडकार कैसे वायर किए जाते हैं और साझा किए जाते हैं: साइडकार.