NetApp IT a pris la décision d’adopter DII – Data Infrastructure Insights – après mûre réflexion. Ce changement représentait bien plus qu’un simple changement d’outil ; il s’agissait d’un engagement envers une observabilité unifiée à travers l’infrastructure hybride de NetApp IT.


Le déploiement d'applications modernes repose sur la visibilité : observer, comprendre et agir sur ce qui se passe au sein d'environnements conteneurisés dynamiques. Notre équipe d'ingénierie de plateforme chez NetApp IT a été confrontée à un défi bien connu : garantir l'observabilité et la sécurité en temps réel de nos clusters Kubernetes, sans complexité ni coût supplémentaires.
Ce qui avait commencé comme une expérience a rapidement évolué vers le remplacement d'un outil standard du secteur par l'une de nos propres solutions NetApp : NetApp Data Infrastructure Insights (DII).
Auparavant, nous utilisions Sysdig pour superviser nos clusters Kubernetes, misant sur ses fonctionnalités d'observabilité et de sécurité. Cependant, avec l'intégration d'une nouvelle suite de sécurité SDLC moderne à notre plateforme, nous avons dû revoir notre stratégie d'outillage.
Parallèlement, DII gagnait rapidement en maturité. Après avoir évalué ses capacités d'observabilité, nous avons stratégiquement décidé de mettre hors service Sysdig Monitor, de réaffecter nos licences à Sysdig Secure pour la protection en temps réel et d'adopter DII comme plateforme principale de surveillance et de diagnostic.
« Ce n'est pas une décision que nous avons prise à la légère », a déclaré David Fox, NetApp Platform Engineering Team Lead. « Nous avons soumis DII à la même rigueur que n'importe quel outil externe. Nous devions être certains qu'il nous fournirait les informations nécessaires, notamment en cas de problème en production. »
Pour notre équipe, l'observabilité est essentielle. Nous devons réagir rapidement aux problèmes tels que les déconnexions ou les ralentissements de performance. DII est devenue notre plateforme de référence pour identifier les causes profondes et résoudre rapidement les incidents.
Lorsque les développeurs signalent des problèmes, nous utilisons DII pour suivre des indicateurs tels que l'utilisation du processeur, la pression sur la mémoire, l'utilisation de l'hôte et les taux d'erreur. DII nous aide à corréler les pics de ressources avec les configurations ou les limites des pods, ce qui nous permet d'identifier les conteneurs atteignant leur limite de processeur, par exemple, avant qu'ils ne provoquent des perturbations plus importantes.
Un autre atout majeur de DII réside dans sa capacité de suivi des modifications. Nous pouvons retracer les modifications apportées aux manifestes d'application au fil du temps et les corréler avec les rapports d'incidents. Si un problème est apparu il y a trois jours, DII nous indique précisément ce qui a changé et à quel moment. Cette perspective historique est essentielle pour résoudre les problèmes intermittents.
Notre expérience avec DII n'a pas été sans embûches. Les premières versions ne proposaient pas toutes les fonctionnalités de Sysdig et des problèmes de compatibilité sont apparus. Mais nous n'avons pas été seuls : nous avons collaboré étroitement avec l'équipe produit de DII, en soumettant des demandes d'amélioration et en validant les nouvelles fonctionnalités au fur et à mesure de leur mise en service.
« À bien des égards, nous avons agi à la fois comme client et comme collaborateur », a déclaré Fox. « Nous avons contribué à façonner l’orientation de DII, et cela a été un aspect unique et enrichissant de cette aventure. »
Cette étroite collaboration signifie que le service informatique de NetApp influence directement le développement de l’outil — une position rare et précieuse lorsqu’on travaille avec des solutions internes.
À mesure que DII continue d'évoluer, nous nous orientons vers une intégration plus poussée entre les plateformes, une automatisation accrue et une prise en charge des environnements multi-clusters et multi-cloud.
Nous tirons parti de services comme Amazon FSx for NetApp ONTAP pour étendre cette visibilité à notre encombrement cloud public. Avec FSx for ONTAP, nous maintenons des normes cohérentes d'observabilité et d'automatisation à la fois sur site et dans le cloud, grâce à Trident et à une intégration étroite à la plateforme DII.
DII devient également une pierre angulaire de notre stratégie d'observabilité et de FinOps, fournissant des informations à grande échelle sur la santé, les performances, les coûts et le comportement des applications.
Ce changement va bien au-delà d'une simple modification des outils : il s'inscrit dans notre engagement envers l'excellence opérationnelle, la résilience de la plateforme et la fourniture d'une observabilité unifiée sur l'infrastructure hybride de NetApp IT.
Robert Rubin est le directeur de l'ingénierie de plateforme chez NetApp, responsable de la création et du support de notre plateforme de développement moderne. Dans son rôle, il permet un développement et un déploiement de logiciels plus rapides, plus sûrs et plus intelligents. Rob veille à ce que les développeurs puissent déployer des applications traditionnelles et d'IA/ML hautement évolutives et résilientes dans un environnement de cloud hybride aussi efficacement que possible.