Observability & Monitoring

Uw klanten horen niet uw monitoring te zijn

Wij verkorten de afstand tussen iets dat misgaat en iemand die het weet. Alerting die afgaat op wat een gebruiker merkt, traces die vertellen waarom, en een stack die uw eigen team daarna beheert. Begin met een gratis health check van wat u vandaag draait.

Vraag de gratis health check aan

Wat we doen

Detectie

Weet het eerder dan support

Alerts geschreven op wat een gebruiker zou merken in plaats van op een drempelwaarde die iemand in 2023 heeft gekozen. Gekoppeld aan een SLO, gerouteerd naar wie kan handelen, en voorzien van een runbook. Wat afgaat zonder dat iemand er iets mee doet, verdwijnt.

Diagnose

Beantwoord de vraag tijdens het incident

Een metric die leidt naar het verzoek dat hem veroorzaakte, en een trace die de trage dependency benoemt. Het verschil tussen weten dat er iets mis is en weten wat u moet terugrollen, en daar gaat de tijd tijdens een incident werkelijk heen.

Kosten

Een rekening die uw business volgt

Retentie, sampling en opslag afgestemd op het volume dat u werkelijk produceert. De meeste omgevingen betalen voor telemetrie die al een jaar niemand bevraagd heeft, en de oplossing is meestal beleid in plaats van een migratie.

Eigenaarschap

Uw team beheert het, niet wij

Alles komt als code in uw eigen repository terecht, met een schriftelijke overdracht en een sessie voor de engineers die het daarna beheren. Niets is van ons in licentie en niets stopt met werken als wij stoppen met praten.

Wat er werkelijk misgaat

Vrijwel elk team dat wij spreken draait al Prometheus. Het installeren was nooit het moeilijke deel. Wat ontbreekt is de afstand tussen iets dat stukgaat en iemand die het weet: een alert geschreven op wat een gebruiker merkt in plaats van op een drempelwaarde waar sinds de installatie niemand naar gekeken heeft, een trace die de trage dependency benoemt, retentie die afgelopen dinsdag nog vasthoudt wanneer u gaat kijken. Verklein die afstand en een storing blijft een incident. Laat hem staan en u hoort het van een klant.

Hoe dat er bij Comper uitzag

Comper had geen enkele observability op hun productieplatform, waardoor infrastructuurproblemen ongemerkt bleven tot iemand het toevallig opmerkte. Wij bouwden de volledige stack op Kubernetes, met centrale opslag en ingestie vanuit meerdere clusters. Binnen enkele weken ontdekte hun eigen team dat services van henzelf regelmatig OOMKilled werden, containerherstarts die niemand ooit had gezien.

“Victor hielp ons snel met het opzetten van observability in onze Kubernetes-clusters. De opzet is hoogbeschikbaar en Victor was gedurende het hele proces goed bereikbaar, ook voor snelle finetuning en het instellen van extra alerts na de installatie. Een absolute aanrader.”

Jouke, Comper

De stack

Wat er geïnstalleerd wordt

Volledig open source, als code beheerd, draaiend in uw eigen infrastructuur. Niets hiervan is van ons om weer weg te halen.

  • Prometheus

    Metrics verzamelen, en de querytaal waarin uw alertregels geschreven staan.

  • Loki

    Logaggregatie geïndexeerd op label in plaats van op inhoud, zodat de opslag in verhouding blijft.

  • Tempo

    Distributed tracing, aan te klikken vanaf de metric of de logregel die de vraag opriep.

  • Pyroscope

    Continue profiling, voor wanneer de service traag is en niets stroomopwaarts dat verklaart.

  • Grafana Alloy

    Eén OpenTelemetry-collector op elke node, in plaats van een agent per signaal.

  • Thanos of Mimir

    Eén overzicht over alle clusters, met downsampling en langetermijnopslag in S3.

Grafana staat daar voor. Welke onderdelen u werkelijk nodig heeft hangt af van waar de gaten zitten, en een stack met drie componenten die u gebruikt is beter dan zes die u niet gebruikt.

Opdrachten

Drie manieren om te beginnen

Gratis

Observability Health Check

Een read-only blik op wat u vandaag draait, uitgeschreven als bevindingen geordend naar wat het meeste zou helpen.

  • Signaal-ruis en alerthygiene
  • Retentie, opslag en kosten
  • Van u, zonder verplichting
Begin hier

1 week

Monitoring Baseline

Prometheus, Grafana en alerting geinstalleerd en afgestemd op een cluster, daarna in beheer bij uw eigen team.

  • Golden-signal dashboards
  • Meldingen op echte condities
  • Overdrachtssessie

3-4 weken

Production Observability Stack

De volledige bouw: metrics, logs, traces en profielen, met langetermijnopslag en alerting gekoppeld aan SLO’s.

  • Grafana Alloy als uniforme collector
  • Langetermijnopslag met downsampling
  • Documentatie en doorloopsessie

Prijzen staan op de prijssectie van de homepage. Multi-cluster en multi-tenant werk offreren wij na een scopinggesprek, en advies gaat tegen EUR 125 per uur.

Veelgestelde vragen

Wij draaien al Prometheus. Wat valt er dan nog te doen?
Meestal drie dingen: retentie, waar de meeste zelfgebouwde stacks stilletjes bij vijftien dagen blijven steken; alerting, doorgaans een set drempelwaarden waar sinds de installatie niemand meer naar gekeken heeft; en de logs en traces die nooit zijn aangesloten, zodat een incident alsnog eindigt in kubectl logs. De installatie is het makkelijke deel en zelden waar de waarde zit.
Wat houdt die gratis health check precies in?
Een read-only blik op wat u vandaag draait, gevolgd door een schriftelijke lijst met bevindingen geordend naar wat het meeste zou helpen: signaal-ruis, alerthygiene, retentie, opslag en kosten. Het kost een kort gesprek en toegang tot uw dashboards. U houdt de bevindingen of wij daarna samenwerken of niet, en er zit geen verplichting aan vast.
Werkt dit alleen op Kubernetes?
Nee. Kubernetes is waar het meeste werk zit, maar dezelfde collectors draaien op gewone virtuele machines en bare metal, en managed clouddiensten worden via hun eigen exporters uitgelezen. Een hybride omgeving is normaal, geen complicatie.
Zelf hosten of SaaS?
Dat hangt af van uw volume, uw team, en wat u verplicht in eigen beheer moet houden. Zelf hosten is boven een bepaald telemetrievolume doorgaans goedkoper en kost u het beheer ervan. Wij hebben beide gebouwd en beheerd, dus u krijgt een schatting van wat elk in de praktijk kost in plaats van een voorkeur. Is Datadog het antwoord, dan heeft dat een eigen pagina.
Hoe lang duurt het?
Een week voor een cluster dat fatsoenlijk gemonitord is, drie tot vier weken voor een volledige productiestack met logs, traces, profielen en langetermijnopslag. Multi-clusterwerk offreren wij na een kort scopinggesprek, omdat het antwoord afhangt van hoeveel er al staat.
Werken jullie met teams buiten Nederland?
Ja. Wij werken op afstand met teams door heel Europa.

Klaar voor een gesprek?

Onafhankelijke observability-specialisten. Wij verkorten de tijd tussen iets dat stukgaat en iemand die het weet, met Prometheus, Grafana, de LGTM-stack en OpenTelemetry. Begin met een gratis health check.

Neem contact op