3.1 - Surveillance et observabilité cloud
L'objectif 3.1 du Cloud+ CV0-004 couvre la surveillance et l'observabilité dans le cloud. Les métriques sont des valeurs numériques de séries temporelles comme le pourcentage de CPU et le taux de requêtes, collectées pour les tableaux de bord et l'analyse. L'alerting envoie une notification quand une métrique franchit un seuil défini, par exemple quand l'usage CPU dépasse une limite, pour que les opérateurs réagissent vite. L'agrégation de journaux rassemble les journaux de nombreux services dans une plateforme unique consultable, rendant le dépannage inter-services praticable. Un SLO (objectif de niveau de service) est une cible mesurable, comme 99,9 % de disponibilité, que le service s'engage à tenir, et il sous-tend les budgets d'erreur et les SLA. Tu dois aussi connaître les traces, les trois piliers de l'observabilité et les tableaux de bord. Attends-toi à des mises en situation demandant le bon concept.
Séries temporelles numériques (CPU %, taux de requêtes) = métriques. Notifier au franchissement d'un seuil = alerting. Journaux de plusieurs services en un lieu consultable = agrégation de journaux. Cible de fiabilité mesurable (99,9 %) = SLO.
Questions d'entraînement
1. Envoyer une notification quand l'usage CPU dépasse un seuil défini est un exemple de :
- Journalisation
- Alerte (bonne réponse)
- Traçage
- Indexation
L'alerte déclenche des notifications quand une métrique franchit un seuil. La journalisation enregistre des événements ; le traçage suit une requête entre services.
2. Rassembler les journaux de nombreux services dans une plateforme unique et interrogeable s'appelle :
- Rotation des journaux
- Agrégation des journaux (bonne réponse)
- Masquage des journaux
- Signature des journaux
L'agrégation des journaux centralise les logs de multiples sources dans un magasin interrogeable (ELK, Loki), permettant corrélation et diagnostic. La rotation ne fait que recycler d'anciens fichiers.
3. Suivre une requête à travers plusieurs microservices pour trouver où elle ralentit relève du :
- Agrégation de métriques
- Journalisation centralisée
- Traçage distribué (bonne réponse)
- Alerte par seuil
Le traçage distribué suit une requête entre services avec le temps de chaque segment, révélant l'étape lente. Les métriques donnent des chiffres agrégés ; les journaux enregistrent des événements.
4. Un objectif mesurable comme 99,9 % de disponibilité que le service s'engage à tenir est un(e) :
- SLI
- SLO (bonne réponse)
- KPI
- MTTR
Un SLO (objectif de niveau de service) est la cible interne d'une métrique, comme 99,9 % de disponibilité. Un SLI est la valeur mesurée ; un SLA est le contrat externe avec pénalités.
5. Déclencher une alerte seulement si le CPU élevé dure plusieurs minutes, pas sur un pic bref, réduit surtout :
- Le bruit d'alertes (bonne réponse)
- Le coût de stockage
- La latence réseau
- La taille de sauvegarde
Exiger qu'un dépassement de seuil persiste une durée filtre les pics passagers, réduisant fausses alertes et fatigue d'alerte. Cela n'affecte ni le stockage, ni la latence, ni les sauvegardes.
6. Les valeurs numériques temporelles comme le pourcentage CPU et le taux de requêtes collectées pour les tableaux de bord sont :
- Traces
- Métriques (bonne réponse)
- Journaux
- Événements
Les métriques sont des mesures numériques temporelles agrégées pour les tendances et les alertes. Les journaux sont des enregistrements textuels d'événements ; les traces suivent une requête entre services.