Prometheus collecte des métriques par scraping et permet de les interroger en PromQL, tandis que Grafana les visualise en tableaux de bord. Ce duo est le standard open source de la supervision dans l'écosystème Kubernetes.
Points clés
- Modèle pull et exporters
- PromQL et tableaux de bord Grafana
- Alerting avec Alertmanager
Modèle pull et exporters
Prometheus va chercher les métriques (pull) en interrogeant périodiquement des endpoints /metrics exposés par les applications ou par des exporters (node_exporter pour l'OS, cAdvisor pour les conteneurs). Il stocke ces séries temporelles dans sa base locale. On enseigne ce modèle pull et la découverte automatique des cibles dans Kubernetes, qui le distingue des outils en push.
PromQL et tableaux de bord Grafana
PromQL permet d'agréger et de calculer sur les métriques : taux d'erreur, percentiles de latence, utilisation CPU par rate() et histogram_quantile(). Grafana se connecte à Prometheus comme source de données et affiche ces requêtes en panneaux. On apprend à construire un dashboard lisible (les quatre signaux dorés : latence, trafic, erreurs, saturation).
Alerting avec Alertmanager
On définit des règles d'alerte en PromQL (par exemple taux d'erreur supérieur à un seuil pendant cinq minutes) ; Alertmanager reçoit les alertes déclenchées, les regroupe, les déduplique et les route vers les bons canaux (e-mail, Slack, PagerDuty). On enseigne à alerter sur des symptômes utilisateurs plutôt que sur des causes, pour éviter la fatigue d'alertes.
En pratique
Scénario. Lab de 3 heures sur k3s : déployer la stack kube-prometheus-stack (Prometheus, Grafana, Alertmanager) via Helm, exposer une application instrumentée, construire un dashboard Grafana des quatre signaux dorés, puis créer une règle d'alerte sur le taux d'erreur routée vers un canal. Livrable : un dashboard opérationnel et une alerte déclenchée puis routée, démontrée en provoquant des erreurs.
Questions fréquentes
Pourquoi Prometheus utilise-t-il un modèle pull plutôt que push ?
Le pull permet à Prometheus de contrôler la fréquence de collecte, de détecter une cible injoignable et de découvrir automatiquement les cibles (notamment dans Kubernetes), simplifiant l'exploitation.
Prometheus stocke-t-il les données à long terme ?
Sa base locale est pensée pour le court/moyen terme. Pour de la rétention longue et le passage à l'échelle, on ajoute des solutions comme Thanos, Cortex ou Mimir.
Pour aller plus loin
Pour approfondir : Apprendre terraform pas a pas · Automatiser avec ansible. Et le reste de nos ressources pour les écoles, OF et formateurs.
Besoin d'un formateur expert ou envie de transmettre ?
tonformateur connecte les écoles et organismes de formation avec des intervenants experts du terrain.
Voir les cours à pourvoir Explorer l'annuaire d'outils →