Observerbarhet
AiHummer overvåkelighet har to overflater: portalen fungerer som en Prometheus GET /metrics endepunktet du kan hente for det grunnleggende, og det kan valgfritt send telemetri over OTLP til et OpenTelemetry-endepunkt du konfigurerer. Skrap /metrics for grunnlinjeovervåking; for spor og rike måledata, pek AiHummer mot din OTLP-samler og visualiser dataene med de inkluderende Grafana-dashbordene.
[!NOTE] pprof (
/debug/pprof) er ikke eksponert.
Prometheus /metrics endepunkt
GET /metrics serverer Prometheus tekst-format metrikk uten ekstra oppsett. Kun ikke-sensitive målere eksponeres — byggeinformasjon, prosessens oppetid og kjøretid, tilkoblingspool-tilstand for databasen og en klarhetsmåler; ingen data om leietakere, ingen hemmeligheter, ingen etiketter per forespørsel. For spor og omfattende metrikk, bruk OTLP push.
OTLP push
Sett en enkelt variabel for å slå på telemetri:
# gateway.env — export telemetry to your OTLP collector
AIHUMMER_OTEL_ENDPOINT=http://otel-collector:4317
Med AIHUMMER_OTEL_ENDPOINT sett, gatewayen sender telemetri til den samleren. Derfra, ruter du den til backendet ditt (Tempo, en målelagring, logger) og inn i Grafana.
Håndtering av panics og feil
Feilrapporter sendes aldri noe sted ut: gatewayen inneholder ingen ekstern feilsporingsklient og ingen ekstern DSN — data om feilene dine forlater aldri din egen perimeter.
Motstandsdyktigheten mot panics er likevel fullstendig:
- en panic i en HTTP-behandler blir et vanlig feilsvar (en 500 med en
AIH-…-konvolutt) — prosessen dør ikke og fortsetter å betjene de øvrige forespørslene; - en panic i en bakgrunnsgoroutine fanges også opp og feller ikke gatewayen.
Begge tilfellene havner i den strukturerte loggen — les dem på siden Logger (nedenfor) eller via journalctl.
Direkte logger i administrasjonsgrensesnittet
Administratorgrensesnittet Logger siden er en sanntidsvisning av gateway-journalen: nye linjer hentes automatisk hvert par sekunder, med automatisk rulling mens du er nederst. Verktøylinjen har en linjesøk og en nivåfilter (alle / feil / advarsler / info / feilsøking). Flere andre sider (Dashboard, Søkter, Kanaler) oppdateres også automatisk, og lange lister (revisjon, endringer, varsler og så videre) lastes side for side med en “Vis mer”-knapp.
Fullstendige logger over alle tjenester ligger fortsatt i systemd — aihummer logs [unit] eller journalctl -u aihummer-gateway.
Grafana-dashbord
Ferdige Grafana-dashbord følger med utgivelsen. Importer dem til din Grafana-instans for å få de operative visningene uten å bygge paneler fra bunnen av.
Hva du skal se
Dette er signalene som forteller deg at systemet er sunt og at turene flyter:
| Signal | Hvorfor det betyr noe |
|---|---|
| Svinglatens | Ende-til-ende respons fra agentens turer |
| Feilrate | Feilende forsøk / forespørsler — det første tegnet på problemer |
| Leveringsdisposisjoner | Om svar faktisk når kanalene |
| Utestående leveranser | Etterslep av uleverte svar; vedvarende vekst betyr at leveransen sitter fast |
En vedvarende økning i venter på eller gjentatte ganger mislykkede leveranser er den klareste tidlige advarselen om at leveransen hoper seg opp — følg med på den under utrullinger og hendelser.
Systemendepunkter
Ved siden av OTLP eksponerer gatewayen små HTTP-endepunkter som er nyttige for sonder, klokker og klientdiagnostikk:
| Metode | Endepunkt | Formål |
|---|---|---|
GET |
/metrics |
Prometheus-metrikker (bygg, kjøring, DB-pool, beredskap) |
GET |
/healthz |
Levende + versjon |
GET |
/readyz |
Klarhet (sjekker Postgres; 503 hvis nede) |
GET |
/v1/ping |
Lettvekts rekkeviddekontroll |
GET |
/v1/time |
Servertid |
POST |
/v1/client-log |
Innta klient-side logghendelser |
Helse- og beredskapsprober dekkes i detalj under systemd og helsesjekker.
Hvor til neste
- Prober og produksjons-sjekklisten før flyging: systemd og helsesjekker.
- Hva du bør se etter under en rullende oppgradering: Oppgraderingspolicy.