La decisión de NetApp IT de adoptar DII – Data Infrastructure Insights – no fue una decisión ligera. El cambio fue más que una simple modificación de herramientas; fue un compromiso con la observabilidad unificada en toda la infraestructura híbrida de NetApp IT.


La entrega moderna de aplicaciones se basa en la visibilidad: ver, comprender y actuar en función de lo que ocurre en entornos dinámicos contenedorizados. Nuestro equipo de ingeniería de plataformas en NetApp IT se enfrentó a un reto habitual: garantizar la observabilidad y la seguridad en tiempo real en todos nuestros clústeres de Kubernetes, sin aumentar la complejidad ni el coste.
Lo que comenzó como un experimento pronto se convirtió en reemplazar una herramienta estándar del sector por una de nuestras propias soluciones de NetApp: NetApp Data Infrastructure Insights (DII).
Anteriormente utilizábamos Sysdig para supervisar nuestros clústeres de Kubernetes, aprovechando sus funciones de observabilidad y seguridad. Sin embargo, al incorporar a nuestra plataforma una nueva y moderna suite de seguridad para el ciclo de vida del desarrollo de software (SDLC), tuvimos que replantearnos nuestra estrategia de herramientas.
Al mismo tiempo, DII estaba madurando rápidamente. Tras evaluar sus capacidades de observabilidad, decidimos estratégicamente dejar de utilizar Sysdig Monitor, reasignar nuestras licencias a Sysdig Secure para la protección en tiempo de ejecución y adoptar DII como nuestra plataforma principal de monitorización y diagnóstico.
«No fue una decisión que tomáramos a la ligera», afirmó David Fox, jefe del equipo de ingeniería de la plataforma de NetApp. «Sometimos a DII al mismo escrutinio al que someteríamos a cualquier herramienta externa. Teníamos que estar seguros de que nos proporcionaría la información que necesitábamos, especialmente cuando surgen problemas en producción».
Para nuestro equipo, la observabilidad es fundamental. Necesitamos responder rápido a problemas como la pérdida de conexiones o la ralentización del rendimiento. DII se ha convertido en nuestra plataforma de referencia para identificar las causas raíz y resolver incidentes rápido.
Cuando los desarrolladores señalan problemas, utilizamos DII para realizar un seguimiento de métricas como el uso de CPU, la presión de memoria, la utilización del host y las tasas de error. DII nos ayuda a correlacionar los picos de recursos con las configuraciones o límites de los pods, lo que nos permite identificar contenedores que alcanzan su límite de CPU, por ejemplo, antes de que causen interrupciones más amplias.
Otra característica revolucionaria es la capacidad de DII para realizar un seguimiento de los cambios. Podemos rastrear los cambios en los manifiestos de las aplicaciones a lo largo del tiempo y correlacionarlos con los informes de incidencias. Si algo empezó a fallar hace tres días, DII nos muestra exactamente qué cambió y cuándo. Esa perspectiva histórica es esencial para resolver problemas intermitentes.
Nuestra experiencia con DII no fue del todo fluida. Las primeras versiones no ofrecían todas las funciones que sí tenía Sysdig y surgieron algunos problemas de compatibilidad. Pero no lo hicimos solos: colaboramos estrechamente con el equipo de producto de DII, enviando solicitudes de mejora y validando las nuevas funcionalidades a medida que se iban incorporando.
«En muchos sentidos, hemos actuado tanto como cliente como colaborador», dijo Fox. «Hemos ayudado a definir la dirección de DII, y ese ha sido un aspecto único y gratificante de este viaje».
Esta estrecha colaboración significa que el equipo de TI de NetApp influye directamente en el desarrollo de la herramienta, una posición poco común y valiosa cuando trabajas con soluciones internas.
A medida que DII sigue evolucionando, avanzamos hacia una mayor integración entre plataformas, mayor automatización y compatibilidad con entornos multiclúster y multinube.
Estamos aprovechando servicios como Amazon FSx for NetApp ONTAP para ampliar esta visibilidad a nuestra infraestructura en la nube pública. Con FSx for ONTAP, mantenemos estándares coherentes de observabilidad y automatización tanto en entornos locales como en la nube, gracias a Trident y a una integración estrecha con la plataforma DII.
DII también se está convirtiendo en una piedra angular de nuestra estrategia más amplia de observabilidad y FinOps, proporcionando información sobre el estado, el rendimiento, el coste y el comportamiento de las aplicaciones a gran escala.
Este cambio va más allá de una simple sustitución de herramientas: forma parte de nuestro compromiso con la excelencia operativa, la resiliencia de la plataforma y la oferta de una observabilidad unificada en toda la infraestructura híbrida de TI de NetApp.
Robert Rubin es el director de ingeniería de plataformas en NetApp, responsable de desarrollar y dar soporte a nuestra moderna plataforma para desarrolladores. En su puesto, permite un desarrollo y una implementación de software más rápidos, seguros e inteligentes. Rob se asegura de que los desarrolladores puedan implementar aplicaciones tradicionales y de IA/ML altamente escalables y resilientes en un entorno de nube híbrida de la forma más eficiente posible.