NetApp TI decidiu adotar o DII – Data Infrastructure Insights – e essa não foi uma decisão tomada de forma leviana. A mudança representou mais do que uma simples troca de ferramentas; foi um compromisso com a observabilidade unificada em toda a infraestrutura híbrida de TI da NetApp.


A entrega de aplicações modernas depende de visibilidade—ver, entender e agir de acordo com o que está acontecendo em ambientes conteinerizados dinâmicos. Nossa equipe de engenharia de plataforma na NetApp IT enfrentou um desafio comum: garantir observabilidade e segurança em tempo real em nossos clusters Kubernetes, sem aumentar a complexidade ou o custo.
O que começou como uma experiência logo evoluiu para a substituição de uma ferramenta padrão do setor por uma de nossas próprias soluções NetApp: NetApp Data Infrastructure Insights (DII).
Anteriormente, usávamos o Sysdig para monitorar nossos clusters Kubernetes, confiando em seus recursos de observabilidade e recursos de segurança. No entanto, ao introduzirmos um novo conjunto moderno de segurança SDLC em nossa plataforma, precisamos reavaliar nossa estratégia de ferramentas.
Ao mesmo tempo, o DII estava amadurecendo rapidamente. Após avaliarmos suas capacidades de observabilidade, decidimos estrategicamente desativar o Sysdig Monitor, realocar nossas licenças para o Sysdig Secure para proteção em tempo de execução e adotar o DII como sua principal plataforma de monitoramento e diagnóstico.
“Não foi uma decisão que tomamos de ânimo leve”, disse David Fox, Líder da Equipe de Engenharia de Plataforma da NetApp. “Submetemos o DII ao mesmo rigor que submeteríamos a qualquer ferramenta externa. Precisávamos ter confiança de que ele nos daria o insight de que precisávamos, especialmente quando as coisas dão errado em produção.”
Para nossa equipe, a observabilidade é fundamental. Precisamos responder rapidamente a problemas como quedas de conexão ou lentidão no desempenho. O DII se tornou nossa plataforma principal para identificar as causas raiz e resolver incidentes com agilidade.
Quando os desenvolvedores sinalizam problemas, usamos o DII para monitorar métricas como uso de CPU, pressão de memória, utilização do host e taxas de erro. O DII nos ajuda a correlacionar picos de recursos com configurações ou limites de pods, permitindo identificar contêineres que estão atingindo seu limite de CPU, por exemplo, antes que causem interrupções mais amplas.
Outro diferencial importante é a capacidade de rastreamento de alterações do DII. Podemos rastrear as alterações nos manifestos dos aplicativos ao longo do tempo e correlacioná-las com os relatórios de incidentes. Se algo começou a apresentar problemas há três dias, o DII mostra exatamente o que mudou e quando. Essa perspectiva histórica é essencial para solucionar problemas intermitentes.
Nossa jornada com o DII não foi tranquila. As primeiras versões não tinham paridade total de recursos com o Sysdig, e havia obstáculos de compatibilidade. Mas não fizemos isso sozinhos — trabalhamos em estreita colaboração com a equipe de produto do DII, enviando solicitações de melhorias e validando novas capacidades à medida que eram disponibilizadas.
“De muitas maneiras, atuamos tanto como cliente quanto como colaborador”, disse Fox. “Ajudamos a moldar a direção do DII, e esse foi um aspecto único e gratificante dessa jornada.”
Essa estreita colaboração significa que a equipe de TI da NetApp influencia diretamente o desenvolvimento da ferramenta, uma posição rara e valiosa ao trabalhar com soluções internas.
À medida que a DII continua a evoluir, estamos avançando para uma integração mais profunda entre plataformas, maior automação e suporte para ambientes multi-cluster e várias nuvens.
Estamos aproveitando serviços como Amazon FSx for NetApp ONTAP para estender essa visibilidade à nossa presença na nuvem pública. Com o FSx for ONTAP, mantemos padrões consistentes de observabilidade e automação em ambientes locais e na nuvem, com o Trident e integração completa à plataforma DII.
A DII também está se tornando um pilar fundamental de nossa estratégia mais ampla de observabilidade e FinOps, fornecendo insights sobre saúde, desempenho, custo e comportamento de aplicativos em grande escala.
Essa mudança é mais do que uma simples alteração de ferramentas; faz parte do nosso compromisso com a excelência operacional, a resiliência da plataforma e a entrega de observabilidade unificada em toda a infraestrutura híbrida de TI da NetApp.
Robert Rubin é o Diretor de Engenharia de Plataforma da NetApp, responsável por construir e dar suporte à nossa moderna plataforma de desenvolvimento. Em sua função, ele possibilita um desenvolvimento e implantação de software mais rápidos, seguros e inteligentes. Rob garante que os desenvolvedores consigam implantar aplicações tradicionais e de IA/ML altamente escaláveis e resilientes em um ambiente de nuvem híbrida da forma mais eficiente possível.