Observerbarhed
AiHummer overvågelighed har to overflader: gatewayen fungerer som en Prometheus GET /metrics endpoint, du kan skrabe for det grundlæggende, og det kan valgfrit skub telemetri over OTLP til et OpenTelemetry-endpoint, du konfigurerer. Skrab /metrics til baseline-overvågning; til spor og omfattende målinger skal du pege AiHummer på din OTLP-samler og visualisere dataene med de medfølgende Grafana-dashboards.
[!NOTE] pprof (
/debug/pprof) er ikke udsat.
Prometheus /metrics endepunkt
GET /metrics serverer Prometheus tekst-format metrics uden ekstra opsætning. Kun ikke-sensitive målere eksponeres — build-info, proces oppetid og runtime, DB forbindelse-pool tilstand og en readiness-måler; ingen lejerdata, ingen hemmeligheder, ingen per-anmodnings labels. Til traces og avancerede metrics, brug OTLP push.
OTLP push
Indstil en enkelt variabel for at tænde for telemetri:
# gateway.env — export telemetry to your OTLP collector
AIHUMMER_OTEL_ENDPOINT=http://otel-collector:4317
Med AIHUMMER_OTEL_ENDPOINT Set, gatewayet sender telemetri til den pågældende collector. Derfra kan du rute det til din backend (Tempo, en metrics store, logs) og ind i Grafana.
Håndtering af panics og fejl
Fejlrapporter sendes aldrig nogen steder udad: gatewayen indeholder ingen ekstern fejlsporingsklient og ingen ekstern DSN — data om dine fejl forlader aldrig din perimeter.
Modstandsdygtigheden over for panics er ikke desto mindre fuldstændig:
- en panic i en HTTP-handler bliver til et almindeligt fejlsvar (en 500 med en
AIH-…-konvolut) — processen dør ikke og fortsætter med at betjene de øvrige anmodninger; - en panic i en baggrundsgoroutine bliver også opfanget og vælter ikke gatewayen.
Begge tilfælde ender i den strukturerede log — læs dem på siden Logs (nedenfor) eller via journalctl.
Live-logfiler i admin-brugerfladen
Administratorbrugergrænsefladerne Logs siden er en live-oversigt over gateway-loggen: nye linjer hentes automatisk hvert par sekunder, med autoscroll mens du er i bunden. Værktøjslinjen har en linjesøgning og en niveaufilter (alle / fejl / advarsler / info / debug). Flere andre sider (Dashboard, Sessions, Channels) opdateres også automatisk, og lange lister (audit, ændringer, notifikationer og så videre) indlæses side for side med en “Vis mere”-knap.
Fuldstændige logs for hver tjeneste lever stadig i systemd — aihummer logs [unit] eller journalctl -u aihummer-gateway.
Grafana dashboards
Færdiglavede Grafana-dashboards leveres med udgivelsen. Importer dem til din Grafana-instans for at få de operationelle visninger uden at skulle oprette paneler fra bunden.
Hvad man skal se
Dette er de signaler, der fortæller dig, at systemet er sundt, og at omdrejningerne flyder:
| Signal | Hvorfor det betyder noget |
|---|---|
| Svinglatens | End-to-end responsivitet af agentens vendinger |
| Fejlrate | Fejlende ture/anmodninger — det første tegn på problemer |
| Leveringsdispositioner | Om svar faktisk når frem til kanaler |
| Afventende leverancer | Baglog af uleverede svar; vedvarende vækst betyder, at leveringen sidder fast |
En vedvarende stigning i afventende eller gentagne gange mislykkede leveringer er den klareste tidlige advarsel om, at leveringen er ved at bakke op — hold øje med den under udrulninger og hændelser.
Systemendepunkter
Sideløbende med OTLP eksponerer gatewayen små HTTP-endpoints, der er nyttige til prober, ure og klientdiagnostik:
| Metode | Endepunkt | Formål |
|---|---|---|
GET |
/metrics |
Prometheus-målinger (build, runtime, DB-pool, readiness) |
GET |
/healthz |
Live-tilstand + version |
GET |
/readyz |
Klarhed (tjekker Postgres; 503 hvis nede) |
GET |
/v1/ping |
Letvægts tilgængelighedskontrol |
GET |
/v1/time |
Servertid |
POST |
/v1/client-log |
Indtag klient-side loghændelser |
Sundheds- og parathedsprøverne dækkes i detaljer under systemd og sundhedstjek.
Hvor til næste
- Prober og produktions-tjeklisten før flyvning: systemd og sundhedstjek.
- Hvad man skal se under en rullende opgradering: Opgraderingspolitik.