NetApp IT 부서가 DII(Data Infrastructure Insights)를 도입하기로 한 결정은 결코 가볍게 내린 것이 아니었습니다. 이는 단순한 도구 변경 이상의 의미를 지녔으며, NetApp IT 부서의 하이브리드 인프라 전반에 걸쳐 통합된 관찰 가능성을 확보하겠다는 의지를 보여주는 것이었습니다.


최신 애플리케이션 배포는 가시성, 즉 동적 컨테이너 환경 내에서 발생하는 상황을 파악하고 이해하며 대응하는 데 달려 있습니다. NetApp IT의 플랫폼 엔지니어링 팀은 익숙한 과제에 직면했습니다. 바로 복잡성이나 비용을 추가하지 않고 Kubernetes 클러스터 전반에 걸쳐 실시간 관찰 가능성과 보안을 보장하는 것이었습니다.
실험으로 시작된 것이 곧 업계 표준 툴을 당사의 NetApp 솔루션인 NetApp Data Infrastructure Insights(DII)로 대체하는 것으로 발전했습니다.
이전에는 Sysdig를 사용하여 Kubernetes 클러스터를 모니터링했으며, 그 관찰 가능성 및 보안 기능에 의존했습니다. 그러나 새로운 최신 SDLC 보안 제품군을 플랫폼에 도입하면서 툴링 전략을 재평가해야 했습니다.
동시에 DII는 빠르게 발전하고 있었습니다. DII의 관찰 가능성 기능을 평가한 후, 우리는 전략적으로 Sysdig Monitor를 단종하고 런타임 보호를 위해 라이선스를 Sysdig Secure로 재배정하며, DII를 핵심 모니터링 및 진단 플랫폼으로 채택하기로 결정했습니다.
NetApp 플랫폼 엔지니어링 팀 리더인 데이비드 폭스는 "쉽게 내린 결정이 아니었습니다."라고 말했습니다. "우리는 DII를 다른 외부 툴과 동일한 기준으로 검토했습니다. 특히 운영 환경에서 문제가 발생했을 때 필요한 통찰력을 제공해 줄 것이라는 확신이 필요했습니다."
저희 팀에게 관찰 가능성은 매우 중요합니다. 연결 끊김이나 성능 저하와 같은 문제에 신속하게 대응해야 합니다. Data Infrastructure Insights는 근본 원인을 파악하고 문제를 빠르게 해결하는 데 있어 저희가 가장 신뢰하는 플랫폼이 되었습니다.
개발자가 문제를 보고하면 DII를 사용하여 CPU 사용량, 메모리 사용량, 호스트 활용률 및 오류율과 같은 지표를 추적합니다. DII는 리소스 급증과 Pod 구성 또는 제한 사항 간의 상관관계를 파악하는 데 도움이 되므로, 예를 들어 더 광범위한 장애를 일으키기 전에 컨테이너가 CPU 사용량 제한에 도달하는 것을 식별할 수 있습니다.
또 다른 획기적인 기능은 DII의 변경 추적 기능입니다. 애플리케이션 매니페스트의 변경 사항을 시간 경과에 따라 추적하고 이를 장애 보고서와 연관시킬 수 있습니다. 만약 어떤 문제가 3일 전에 발생하기 시작했다면, DII는 정확히 무엇이 언제 변경되었는지 보여줍니다. 이러한 이력 분석은 간헐적인 문제를 해결하는 데 필수적입니다.
DII와의 협력 과정이 순탄했던 것은 아닙니다. 초기 버전은 Sysdig와 기능적으로 완전히 동일하지 않았고 호환성 문제도 있었습니다. 하지만 저희는 혼자서 해결하려 하지 않았습니다. DII 제품 팀과 긴밀히 협력하여 기능 개선을 요청하고 새로운 기능이 출시될 때마다 검증했습니다.
폭스는 "여러 면에서 우리는 고객이자 협력자 역할을 모두 수행해 왔습니다."라고 말했습니다. "DII의 방향을 설정하는 데 도움을 주었고, 이는 이번 여정에서 특별하고 보람 있는 부분이었습니다."
이러한 긴밀한 협력 덕분에 NetApp IT 부서는 툴 개발에 직접적인 영향을 미칠 수 있으며, 이는 내부 솔루션 개발에 있어 매우 드물고 귀중한 기회입니다.
Data Infrastructure Insights가 지속적으로 발전함에 따라, 플랫폼 간의 더욱 심층적인 통합, 자동화 강화, 멀티 클러스터 및 멀티 클라우드 환경 지원을 향해 나아가고 있습니다.
저희는 Amazon FSx for NetApp ONTAP과 같은 서비스를 활용하여 퍼블릭 클라우드 환경까지 가시성을 확장하고 있습니다. FSx for ONTAP을 통해 Trident로 구동되고 DII 플랫폼에 긴밀하게 통합된 상태에서 온프레미스 및 클라우드 환경 전반에 걸쳐 일관된 관찰 가능성 및 자동화 표준을 유지하고 있습니다.
DII는 또한 광범위한 관찰 가능성 및 FinOps 전략의 핵심 요소가 되어 대규모로 상태, 성능, 비용 및 애플리케이션 동작에 대한 통찰력을 제공합니다.
이러한 변화는 단순한 툴 교체 이상의 의미를 지닙니다. 이는 NetApp IT의 하이브리드 인프라 전반에 걸쳐 운영 우수성, 플랫폼 복원력 및 통합된 관찰 가능성을 제공하려는 당사의 노력의 일환입니다.
로버트 루빈은 NetApp의 플랫폼 엔지니어링 디렉터로, 최신 개발자 플랫폼 구축 및 지원을 담당하고 있습니다. 그는 더욱 빠르고 안전하며 스마트한 소프트웨어 개발 및 배포를 가능하게 하는 역할을 맡고 있습니다. 루빈은 개발자들이 확장성과 복원력이 뛰어난 기존 애플리케이션과 AI/ML 애플리케이션을 하이브리드 클라우드 환경에서 최대한 효율적으로 배포할 수 있도록 지원합니다.