निरीक्षण योग्यता
AiHummer प्रेक्षणीयता है दो सतहें: यह गेटवे सेवा प्रदान करता है प्रोमिथियस GET /metrics एंडपॉइंट जिसे आप बुनियादी चीज़ों के लिए स्क्रैप कर सकते हैं, और यह वैकल्पिक रूप से कर सकता है OTLP के माध्यम से टेलीमेट्री भेजें एक OpenTelemetry एंडपॉइंट पर जिसे आप कॉन्फ़िगर करते हैं। स्क्रैप /metrics बेसलाइन निगरानी के लिए; ट्रेस और विस्तृत मेट्रिक्स के लिए अपने OTLP कलेक्टर की ओर AiHummer को इंगित करें और बंडल किए गए Grafana डैशबोर्ड के साथ डेटा का दृश्यांकन करें।
[!NOTE] पीप्रोफ़ (
/debug/pprof) है नहीं बेझिझक।
प्रोमेथियस /metrics अंत बिंदु
GET /metrics बिना किसी अतिरिक्त सेटअप के Prometheus टेक्स्ट-फॉर्मेट मेट्रिक्स प्रदान करता है। केवल गैर-संवेदनशील गेज दिखाए जाते हैं — बिल्ड जानकारी, प्रोसेस अपटाइम और रनटाइम, DB कनेक्शन-पूल स्थिति और एक रेडीनेस गेज; कोई टेनेन्ट डेटा नहीं, कोई सीक्रेट्स नहीं, कोई प्रति-रिक्वेस्ट लेबल नहीं। ट्रेस और विस्तृत मेट्रिक्स के लिए, OTLP पुश का उपयोग करें।
OTLP पुश
टेलीमेट्री चालू करने के लिए एक ही वेरिएबल सेट करें:
# gateway.env — export telemetry to your OTLP collector
AIHUMMER_OTEL_ENDPOINT=http://otel-collector:4317
के साथ AIHUMMER_OTEL_ENDPOINT सेट करने पर, गेटवे उस कलेक्टर को टेलीमेट्री भेजता है। वहां से, इसे अपने बैकएंड (Tempo, एक मेट्रिक्स स्टोर, लॉग्स) और Grafana में रूट करें।
पैनिक और त्रुटि प्रबंधन
त्रुटि रिपोर्टें कभी भी बाहर कहीं नहीं भेजी जातीं: गेटवे में न कोई बाहरी त्रुटि-ट्रैकर क्लाइंट है और न ही कोई बाहरी DSN — आपकी त्रुटियों का डेटा कभी आपकी परिधि से बाहर नहीं जाता।
फिर भी पैनिक के प्रति सहनशीलता पूर्ण है:
- HTTP हैंडलर में पैनिक एक सामान्य त्रुटि प्रतिक्रिया बन जाता है (
AIH-…लिफ़ाफ़े वाला 500) — प्रक्रिया समाप्त नहीं होती और बाकी अनुरोधों की सेवा करती रहती है; - पृष्ठभूमि गोरूटीन में पैनिक भी पकड़ लिया जाता है और गेटवे को नहीं गिराता।
दोनों मामले संरचित लॉग में पहुँचते हैं — उन्हें लॉग्स पृष्ठ पर (नीचे) या journalctl के माध्यम से पढ़ें।
एडमिन यूआई में लाइव लॉग
एडमिन यूआई के लॉग्स पृष्ठ गेटवे जर्नल की लाइव टेल है: नई पंक्तियाँ स्वतः कुछ सेकंडों में खींची जाती हैं, जबकि आप नीचे होते हैं तब ऑटोस्क्रॉल होती है। टूलबार में एक लाइन खोज और एक स्तर फ़िल्टर (सभी / त्रुटियाँ / चेतावनियाँ / जानकारी / डिबग)। कई अन्य पृष्ठ (डैशबोर्ड, सत्र, चैनल) भी स्वचालित रूप से ताज़ा होते हैं, और लंबी सूचियाँ (ऑडिट, परिवर्तन, सूचनाएँ आदि) ‘अधिक दिखाएँ’ बटन के साथ पृष्ठ दर पृष्ठ लोड होती हैं।
सभी सेवाओं के पूर्ण लॉग अभी भी systemd में मौजूद हैं — aihummer logs [unit] या journalctl -u aihummer-gateway.
ग्राफ़ाना डैशबोर्ड
तैयार-निर्मित Grafana डैशबोर्ड रिलीज़ के साथ भेजे जाते हैं। इन्हें अपने Grafana इंस्टेंस में इंपोर्ट करें ताकि पैनल्स को ज़ेरो से बनाए बिना परिचालन दृश्य प्राप्त कर सकें।
क्या देखें
ये संकेत हैं जो आपको बताते हैं कि सिस्टम स्वस्थ है और प्रवाह हो रहा है:
| सिग्नल | यह क्यों महत्वपूर्ण है |
|---|---|
| टर्न विलंब | एजेंट टर्न्स की एंड-टू-एंड प्रतिक्रिया क्षमता |
| त्रुटि दर | सफल न होने वाले मोड़ / अनुरोध — परेशानी का पहला संकेत |
| वितरण व्यवस्थाएँ | क्या उत्तर वास्तव में चैनलों तक पहुँच रहे हैं |
| लंबित डिलीवरी | अप्रेषित उत्तरों का बैकलॉग; लगातार वृद्धि का मतलब है कि डिलीवरी अटकी हुई है |
में लगातार वृद्धि लंबित या बार-बार असफल डिलीवरी यह सबसे स्पष्ट प्रारंभिक चेतावनी है कि डिलीवरी रुक रही है — इसे रोलआउट और घटनाओं के दौरान देखें।
सिस्टम एंडपॉइंट्स
OTLP के साथ-साथ, गेटवे छोटे HTTP एंडपॉइंट्स को उजागर करता है जो प्रॉब्स, क्लॉक्स और क्लाइंट डायग्नोस्टिक्स के लिए उपयोगी हैं:
| विधि | अंत बिंदु | उद्देश्य |
|---|---|---|
GET |
/metrics |
प्रॉमेथियस मेट्रिक्स (बिल्ड, रनटाइम, डीबी पूल, रेडीनेस) |
GET |
/healthz |
लाइवनेस + संस्करण |
GET |
/readyz |
तैयारी (Postgres की जांच करता है; यदि डाऊन हो तो 503) |
GET |
/v1/ping |
हल्की पहुँच जांच |
GET |
/v1/time |
सर्वर समय |
POST |
/v1/client-log |
क्लाइंट-साइड लॉग ईवेंट्स प्राप्त करें |
स्वास्थ्य और तत्परता जांच लंबी विस्तार से शामिल हैं systemd और स्वास्थ्य जांच.
अगला कहाँ
- प्रोब और उत्पादन प्री-फ़्लाइट चेकलिस्ट: systemd और स्वास्थ्य जांच.
- रोलिंग अपग्रेड के दौरान क्या देखना है: अपग्रेड नीति.