NetApp IT ha deciso di adottare DII – Data Infrastructure Insights – e non è stata una scelta presa alla leggera. Il cambiamento è stato molto più di una semplice sostituzione di strumenti; è stato un impegno verso un'osservabilità unificata dell'infrastruttura ibrida di NetApp IT.


La distribuzione di applicazioni moderne si basa sulla visibilità: vedere, comprendere e agire su ciò che accade all'interno di ambienti containerizzati dinamici. Il nostro team di platform engineering di NetApp IT si è trovato di fronte a una sfida ben nota: garantire osservabilità e sicurezza real-time su tutti i nostri cluster Kubernetes, senza aggiungere complessità o costi.
Quello che era iniziato come un esperimento si è presto evoluto nella sostituzione di uno strumento standard del settore con una delle nostre soluzioni NetApp: NetApp Data Infrastructure Insights (DII).
In precedenza usavamo Sysdig per monitorare i nostri cluster Kubernetes, affidandoci alle sue funzionalità di osservabilità e sicurezza. Tuttavia, quando abbiamo introdotto una nuova suite di sicurezza SDLC moderna sulla nostra piattaforma, abbiamo dovuto rivedere la nostra strategia di strumenti.
Contemporaneamente, DII stava maturando rapidamente. Dopo aver valutato le sue capacità di osservabilità, abbiamo deciso strategicamente di dismettere Sysdig Monitor, riassegnare le nostre licenze a Sysdig Secure per la protezione in fase di esecuzione e adottare DII come piattaforma principale di monitoraggio e diagnostica.
"Non è stata una decisione presa alla leggera", ha affermato David Fox, NetApp Platform Engineering Team Lead. "Abbiamo sottoposto DII allo stesso esame approfondito che faremmo con qualsiasi strumento esterno. Dovevamo essere certi che ci avrebbe fornito le informazioni necessarie, soprattutto quando le cose vanno male in produzione."
Per il nostro team, l'osservabilità è fondamentale. Dobbiamo rispondere rapidamente a problemi come interruzioni di connessione o rallentamenti delle prestazioni. DII è diventata la nostra piattaforma di riferimento per identificare le cause principali e risolvere rapidamente gli incidenti.
Quando gli sviluppatori segnalano problemi, utilizziamo DII per monitorare metriche come l'utilizzo della CPU, la pressione della memoria, l'utilizzo dell'host e i tassi di errore. DII ci aiuta a correlare i picchi di risorse con le configurazioni o i limiti dei pod, permettendoci di identificare i container che raggiungono il limite massimo di CPU, ad esempio, prima che causino interruzioni più ampie.
Un altro elemento rivoluzionario è la funzionalità di tracciamento delle modifiche di DII. Possiamo tracciare le modifiche ai manifest delle applicazioni nel tempo e correlarle con i report degli incidenti. Se qualcosa ha iniziato a non funzionare tre giorni fa, DII ti mostra esattamente cosa è cambiato e quando. Questa prospettiva storica è essenziale per risolvere i problemi intermittenti.
Il nostro percorso con DII non è stato privo di intoppi. Le prime versioni non offrivano la piena parità di funzionalità con Sysdig e presentavano problemi di compatibilità. Ma non abbiamo affrontato tutto da soli: abbiamo collaborato a stretto contatto con il team di prodotto DII, inviando richieste di miglioramento e validando le nuove funzionalità man mano che venivano rese disponibili.
"Per molti aspetti, abbiamo agito sia come clienti che come collaboratori", ha affermato Fox. "Abbiamo contribuito a definire la direzione di DII, e questo è stato un aspetto unico e gratificante di questo percorso."
Questa stretta collaborazione fa sì che l’IT di NetApp influenzi direttamente lo sviluppo dello strumento, una posizione rara e preziosa quando lavori con soluzioni interne.
Con la continua evoluzione di DII, stiamo puntando a una maggiore integrazione tra piattaforme, maggiore automazione e supporto per ambienti multi-cluster e multi-cloud.
Sfruttiamo servizi come Amazon FSx for NetApp ONTAP per estendere questa visibilità alla nostra presenza nel cloud pubblico. Con FSx for ONTAP, manteniamo standard coerenti di osservabilità e automazione sia negli ambienti on-prem che in quelli cloud, grazie a Trident e all'integrazione stretta nella piattaforma DII.
DII sta diventando anche un elemento fondamentale della nostra strategia di osservabilità e di FinOps, fornendo informazioni su salute, prestazioni, costi e comportamento delle applicazioni su larga scala.
Questo cambiamento va oltre la semplice modifica degli strumenti: fa parte del nostro impegno per l'eccellenza operativa, la resilienza della piattaforma e la fornitura di un'osservabilità unificata nell'infrastruttura ibrida IT di NetApp.
Robert Rubin è il Direttore dell'Ingegneria della Piattaforma presso NetApp, responsabile della creazione e del supporto della nostra moderna piattaforma per sviluppatori. Nel suo ruolo permette uno sviluppo e un deployment del software più rapidi, sicuri e intelligenti. Rob fa in modo che gli sviluppatori possano distribuire applicazioni tradizionali e AI/ML altamente scalabili e resilienti in un ambiente cloud ibrido nel modo più efficiente possibile.