Derrière chaque application qui reste disponible malgré une charge imprévue se trouve souvent une équipe DevOps ou SRE (Site Reliability Engineering), chargée de faire le pont entre développement et exploitation.
Un rôle de plus en plus stratégique
Automatisation, infrastructure as code, monitoring et gestion des incidents sont devenus centraux à mesure que les architectures se complexifient et se distribuent sur plusieurs environnements cloud, rendant la fiabilité des systèmes plus difficile à garantir manuellement.
Une culture de la résilience plutôt que de la perfection
La discipline valorise désormais une culture dite de « chaos engineering », qui consiste à provoquer volontairement des pannes contrôlées pour vérifier la résilience réelle des systèmes plutôt que de simplement espérer qu’ils ne tombent jamais en panne.