Le vide qui a arrêté Amazon
Le 20 octobre 2025, deux automates d'Amazon se marchent dessus et vident un enregistrement DNS. Quatorze heures et demie de panne, sans la moindre attaque.
60s · 23 juillet 2026 · 3 min de lecture
En bref
DynamoDB confie ses enregistrements DNS à deux composants automatiques. Un retard anormal les a fait entrer en collision : un plan périmé a écrasé le plan à jour, puis le nettoyage automatique l'a supprimé — effaçant toutes les adresses du point d'entrée régional. L'automatisation s'est retrouvée incapable de se réparer, et il a fallu des ingénieurs pour corriger l'annuaire à la main.
Ni attaque, ni panne matérielle
Le 19 octobre 2025 à 23 h 48 (heure du Pacifique), les erreurs explosent sur DynamoDB dans la région us-east-1, en Virginie du Nord. En cascade, EC2, Lambda, les équilibreurs de charge, la console AWS et des milliers d'applications grand public trébuchent. L'incident se termine le 20 octobre à 14 h 20 : quatorze heures et demie au total. AWS est formel dans son post-mortem — la cause est un défaut latent dans son propre système d'automatisation DNS.
Deux composants, un annuaire
Un service comme DynamoDB maintient des centaines de milliers d'enregistrements DNS pour piloter sa flotte d'équilibreurs de charge. Deux composants s'en chargent, séparés volontairement pour la robustesse. Le DNS Planner surveille la santé et la capacité des équilibreurs, puis produit périodiquement un « plan » : la liste des serveurs qui doivent recevoir le trafic. Le DNS Enactor applique ce plan dans Route 53. Pour la résilience, trois Enactors tournent en parallèle et indépendamment, dans trois zones de disponibilité.
La collision, étape par étape
- Un Enactor subit des retards anormaux et doit réessayer sur plusieurs points d'entrée.
- Pendant ce temps, le Planner produit plusieurs générations de plans plus récents.
- Un second Enactor applique rapidement l'un de ces plans récents, puis déclenche le nettoyage des plans nettement plus anciens.
- Au même instant, le premier Enactor applique enfin son plan périmé et écrase le plan récent — sa vérification d'ancienneté, faite une seule fois au départ, était devenue obsolète.
- Le nettoyage supprime alors ce plan périmé : toutes les adresses IP du point d'entrée régional disparaissent d'un coup.
dynamodb.us-east-1.amazonaws.com -> (aucune adresse)
Les serveurs tournent. Le nom existe. Mais plus rien ne pointe vers eux. 14 h 30
entre le début de l'incident et le retour à la normale
source : AWS (post-mortem officiel)
Pourquoi ça a duré si longtemps
Le DNS est restauré dès 2 h 25, mais la panne continue. Le gestionnaire de serveurs physiques d'EC2 (DWFM) dépend de DynamoDB pour ses vérifications d'état : privé de base de données, il a perdu ses « baux » sur les machines. En tentant de tous les rétablir d'un coup, il entre en effondrement congestif — il n'avance plus. Les ingénieurs limitent le débit et redémarrent sélectivement des hôtes à 4 h 14, puis absorbent un arriéré de propagation réseau. EC2 ne redevient normal qu'à 13 h 50.
Ce qu'on imagine
- Une cyberattaque massive
- Un data center en feu
La réalité
- Deux automates au même instant
- Un enregistrement DNS vidé
→ Les pannes les plus larges naissent souvent d'un détail de concurrence.
À retenir
- →L'incident court du 19 octobre 2025 à 23 h 48 au 20 octobre à 14 h 20 (heure du Pacifique) : quatorze heures et demie.
- →Cause racine : une situation de concurrence latente entre deux DNS Enactors, qui a laissé un enregistrement DNS vide pour dynamodb.us-east-1.amazonaws.com.
- →Le plan actif supprimé, l'automatisation ne pouvait plus se corriger : une intervention manuelle a été nécessaire.
- →La cascade a touché EC2, Lambda, NLB, la console et bien d'autres — mais les instances EC2 déjà lancées ont continué à fonctionner.
- →AWS a désactivé cette automatisation dans le monde entier avant de la corriger.
Sources · la preuve
- [01] Summary of the Amazon DynamoDB Service Disruption in the Northern Virginia (US-EAST-1) Region Amazon Web Services · aws.amazon.com Post-mortem officiel : architecture DNS Planner / DNS Enactor, chronologie et mesures correctives.
- [02] AWS Outage Analysis: October 20, 2025 ThousandEyes · thousandeyes.com Mesure externe de l'incident et décomposition du mécanisme de la race condition.
- [03] A single DNS race condition brought AWS to its knees The Register · theregister.com Couverture du post-mortem et de l'enregistrement DNS vide.
- [04] Summary of the Amazon DynamoDB Service Disruption — lecture annotée Ernest Chiang · ernestchiang.com Découpage annoté du rapport officiel (DynamoDB, EC2, NLB, autres services).