Dans de nombreuses organisations, les problèmes liés aux systèmes informatiques ne découlent pas d’un manque de données, mais plutôt de la difficulté des équipes à comprendre les données dont elles disposent déjà. Que ce soit à cause de systèmes hérités obsolètes ou de plateformes modernes de Smart Ops, la fiabilité des infrastructures informatiques est désormais un sujet central lors des réunions de direction. Des technologies comme l’Observabilité, l’Ingénierie de la fiabilité des sites (SRE) ou encore l’Intelligence artificielle pour les opérations informatiques (AIOps) transforment la manière dont les entreprises gèrent leurs opérations numériques.
Prenons l’exemple d’un distributeur agricole de taille moyenne un lundi matin : son système de prise de commandes a ralenti, déclenchant quarante alertes en dix minutes. Une cellule de crise a été réunie, chaque équipe affirmant que ses systèmes fonctionnaient normalement. Après deux heures de diagnostic, la cause racine a été identifiée : un processus issu d’une application vieille de quinze ans avait débordé dans la journée, saturant la base de données partagée. La résolution du problème n’a pris que dix minutes, mais le temps consacré à son diagnostic a dépassé la centaine d’heures. Résultat : deux tournées de livraison ont dû être annulées, et les détaillants clients ont dû prévenir le service commercial.
Ce type de situation est courant dans de nombreuses organisations et révèle une contradiction : malgré l’accès à des volumes colossaux de données opérationnelles, répondre à des questions pourtant basiques — que se passe-t-il ?, quel est le coût pour l’entreprise ?, où agir ? — reste un défi. Le nombre de signaux et d’alertes a augmenté bien plus vite que la capacité des équipes à les interpréter. Selon une enquête de l’ITIC menée en 2024, une heure d’indisponibilité d’un système coûte plus de 300 000 dollars à plus de 90 % des entreprises de taille moyenne et grande, sans compter les pénalités ou les problèmes juridiques. Pour les directeurs financiers, cela souligne une leçon claire : le coût du temps de diagnostic est souvent sous-estimé. Réduire ce temps peut avoir un impact significatif sur la rentabilité.
Les exigences réglementaires influencent également la manière dont les entreprises gèrent les risques informatiques. Pour les banques et les assureurs, le Digital Operational Resilience Act (DORA) place la responsabilité ultime des risques liés à l’information sur les épaules des équipes dirigeantes, imposant une classification et un signalement rapides des incidents majeurs. De même, les entreprises relevant de la directive Network and Information Security 2 (NIS2), comme celles des secteurs de l’énergie, des transports ou de la santé, doivent faire valider leurs stratégies de gestion des risques par la direction, qui peut même engager sa responsabilité personnelle. Dans les deux cas, la même question sera posée après un incident : quelles mesures avaient été mises en place pour détecter, comprendre et contenir le problème ?
Les systèmes de surveillance traditionnels répondent à des questions simples, comme le dépassement d’un seuil ou le bon fonctionnement d’un serveur. L’Observabilité, en revanche, permet de répondre à des questions plus complexes et inattendues en reliant les journaux (logs), les métriques et les traces tout au long d’un processus métier, du terminal du client jusqu’à la base de données. Dans l’exemple cité, une traçabilité de bout en bout aurait permis de relier la lenteur perçue à l’ancien processus. Toutefois, cela nécessite l’instrumentation de toutes les applications, y compris les plus anciennes, car une plateforme d’observabilité ne voit que ce qui lui est fourni. Des normes ouvertes comme OpenTelemetry permettent de le faire sans dépendre de fournisseurs spécifiques. Il est également crucial de sélectionner les données collectées, car stocker l’intégralité des informations en permanence peut alourdir les coûts de stockage sans améliorer la compréhension.
L’Observabilité et la détection des failles de sécurité s’appuient de plus en plus sur les mêmes données. Les financer séparément revient à payer deux fois pour une moitié d’analyse. La SRE offre un langage commun entre les équipes informatiques et les métiers, reconnaissant que la fiabilité absolue est trop coûteuse et doit être équilibrée. Un objectif de disponibilité à 99,9 % autorise environ 43 minutes d’interruption par mois, ce qui aide à prioriser entre développement et stabilité. Avec des objectifs clairs, des rapports exempts de reproches et l’automatisation des tâches routinières, la fiabilité devient un engagement partagé.
L’AIOps apporte principalement des capacités de tri : regroupement des alertes, détection des anomalies et suggestion de causes. Cependant, elle ne peut améliorer un système informatique mal observé ou mal cartographié. Avec des données incomplètes, elle peut générer des corrélations trompeuses. Ainsi, l’AIOps intervient après l’Observabilité, jamais à sa place. Les agents d’IA capables d’agir en production deviennent de nouveaux acteurs du système informatique, capables de redémarrer un service, d’annuler un déploiement ou de modifier une configuration. Il faudra définir leurs droits, suivre leurs actions et contrôler leurs décisions, car une automatisation opaque peut transformer un gain d’efficacité en nouveau risque opérationnel.
Les systèmes hérités, qu’il s’agisse de mainframes, d’anciens systèmes de planification des ressources d’entreprise (ERP) ou de processus nocturnes, resteront au cœur de nombreux systèmes informatiques encore longtemps. Le défi consiste à rendre les opérations qui les entourent plus intelligentes, dans le bon ordre : identifier les chemins critiques, les instrumenter, fixer des objectifs de fiabilité, automatiser les tâches répétitives et maîtrisées, puis confier à l’IA la corrélation, et seulement ensuite une partie contrôlée de l’action. Chaque membre du comité de direction peut évaluer la situation de l’entreprise en se posant une seule question. Pour le PDG : quel est le parcours client dont l’interruption coûte le plus cher, et son objectif de fiabilité est-il formalisé ? Pour le DAF : durant le dernier incident majeur, combien d’heures ont été consacrées au diagnostic plutôt qu’à la réparation ? Pour le RSSI : quelles actions automatisées sont actuellement exécutées en production sans validation humaine, et qui les a autorisées ? Trois réponses floues suffisent déjà à tracer une feuille de route. La fiabilité d’un système informatique ne se mesure plus au nombre d’alertes traitées, mais à la capacité de l’entreprise à comprendre, anticiper et décider. À ce niveau, ce n’est plus une question d’opérations. C’est une question de gestion.
Fiabilité des systèmes informatiques et supervision par la direction dans les organisations modernes
Contenu réécrit par une IA à partir de sources de presseComment ça marche
it-reliabilityobservabilityaiopsexecutive-committeelegacy-systemsdora-regulation



