Est-ce qu'on met en prod aujourd'hui ?

NON.

Si tu veux profiter de ton week-end, évite 🙂
Non, pas de déploiement aujourd’hui

Pas convaincus ?

Oui, mais...

« Il est 16h43, ça passe »

Orange, le 2 juin 2021. 

Vers 16h45, une modification de configuration des call servers d’Orange déclenche un dysfonctionnement national.

À 17h, les équipes techniques ont identifié le problème.

Un bug logiciel est déclenché et perturbe le réseau jusqu'à la nuit : environ 11 800 appels vers les services d'urgence n'ont pas été acheminés. 

À une minute près, Orange aurait probablement préféré attendre le lendemain 😅

Source : conclusions de l’enquête interne d'Orange sur la crise du 2 juin 2021

« C'est vendredi, mais on le fait le matin »

CrowdStrike (société de cybersécurité), le vendredi 19 juillet 2024.

Une mise à jour de configuration est poussée à 04:09 UTC.

Un contenu défectueux fait crasher des millions de machines Windows dans le monde entier.

Microsoft estime à 8,5 millions le nombre de machines touchées (jusqu'à perturber les secteurs de l'aviation, de la santé et le secteur bancaire).

C'est effectivement mieux que vendredi à 17h, mais ça reste un vendredi 😅

Source : article France Info

« C'est juste une maintenance »

Dropbox, le vendredi 10 janvier 2014 à 17h30.

L'équipe lance une maintenance planifiée pour mettre à jour le système d’exploitation de certaines machines.

Un bug dans le script de mise à jour provoque la réinstallation de plusieurs machines qui hébergent encore des données actives.

Certaines machines "master" et leurs répliques sont touchées en même temps : Dropbox tombe ! 😱

La majorité des utilisateurs peuvent de nouveau utiliser Dropbox environ trois heures plus tard, mais la restauration complète des services principaux ne sera terminée que le dimanche à 16h40.

Les équipes ont du passer un très bon week-end 😅

Source : article post mortem de Dropbox

« Jeudi soir ça va, demain on est encore là »

Bing (Microsoft), le jeudi 3 décembre 2009 vers 18h30.

Pendant des tests internes, Microsoft applique un changement de configuration qui a des conséquences inattendues sur la production.

Résultat : Bing devient indisponible pendant environ 30 minutes dans le monde entier.

Une fois le problème identifié, les équipes reviennent à la configuration précédente et le service repart.

C'est vrai. Le lendemain ils étaient encore là.
Mais le lendemain soir aussi du coup 😅

Source : note d'incident sur le blog de Bing

« C'est juste un petit changement de config »

Cloudflare, le vendredi 17 juillet 2020 à 21h12 UTC (23h12 en France).

Les équipes cherchent à résoudre un problème de congestion sur leur réseau et modifient la configuration d’un routeur à Atlanta.

Sauf qu’une erreur dans cette configuration fait converger une grande partie du trafic du backbone Cloudflare vers un seul routeur.

Résultat : le routeur sature, plusieurs datacenters deviennent injoignables et le trafic sur le réseau Cloudflare chute d’environ 50 % pendant 27 minutes (Paris, Londres, Amsterdam, Francfort et de nombreuses villes américaines font partie des zones touchées).

Le réseau était congestionné. Leur week-end allait l’être aussi 😅

Source : article post-mortem de Cloudflare

Et si on allait plus loin ?

À lire pour mieux préparer vos mises en production

On teste autre chose ?

Découvrez mes autres outils