NetApp IT 采用 DII(Data Infrastructure Insights)的决定并非轻率之举。这一转变不仅仅是工具层面的变革,更是对 NetApp IT 混合基础设施统一可观察性的郑重承诺。


现代应用程序交付依赖于可见性——查看、理解并根据动态容器化环境中发生的事情采取行动。我们 NetApp IT 平台工程团队面临着一个熟悉的挑战:在不增加复杂性或成本的情况下,确保 Kubernetes 集群的实时可观察性和安全性。
从实验开始,很快就演变为用我们自己的 NetApp 解决方案之一取代行业标准工具:NetApp Data Infrastructure Insights(DII)。
我们之前使用 Sysdig 来监控我们的 Kubernetes 集群,依赖于其可观察性和安全功能。但是,当我们在平台上引入新的现代 SDLC 安全套件时,我们需要重新评估工具策略。
与此同时,DII 正在迅速成熟。在评估其可观察性功能后,我们战略性地决定淘汰 Sysdig Monitor,将许可证重新分配给 Sysdig Secure 以用于运行时保护,并采用 DII 作为我们的核心监控和诊断平台。
NetApp 平台工程团队负责人 David Fox 表示:"这不是我们轻易做出的决定。""我们对 DII 进行了与任何外部工具相同的审查。我们必须确信它能为我们提供所需的洞察,尤其是在生产环境中出现问题时。"
对于我们的团队来说,可观察性至关重要。我们需要快速响应连接中断或性能下降等问题。Data Infrastructure Insights 已成为我们识别根本原因和快速解决事件的首选平台。
当开发人员标记问题时,我们使用 DII 来跟踪 CPU 使用率、内存压力、主机使用率和错误率等指标。DII 帮助我们将资源峰值与 Pod 配置或限制相关联,使我们能够识别达到 CPU 上限的容器,例如,在它们造成更大范围中断之前。
另一个改变游戏规则的是 DII 的变更跟踪能力。我们可以随着时间的推移跟踪应用程序清单的变化,并将其与事件报告相关联。如果三天前出现问题,DII 会告诉我们确切的变化内容和时间。这种历史视角对于解决间歇性问题至关重要。
我们与 DII 的旅程并非一帆风顺。早期版本缺乏与 Sysdig 完全相同的功能,并且存在兼容性障碍。但我们并非孤军奋战,我们与 DII 产品团队紧密合作,提交增强请求,并在新功能上线时对其进行验证。
"在许多方面,我们既是客户又是合作者,"Fox 说。"我们帮助塑造了 DII 的方向,这是这段旅程中一个独特而有益的方面。"
这种紧密的协作意味着 NetApp IT 直接影响工具的开发——在使用内部解决方案时,这是一个罕见且有价值的位置。
随着 DII 的不断发展,我们正在推动跨平台的深度集成、自动化程度的提高以及对多集群和多云环境的支持。
我们正在利用 Amazon FSx for NetApp ONTAP 等服务,将这种可见性扩展到我们的公共云足迹中。借助 FSx for ONTAP,我们在本地和云环境中保持一致的可观察性和自动化标准,由 Trident 提供支持并与 DII 平台紧密集成。
DII 也正在成为我们更广泛的可观察性和 FinOps 战略的基石,大规模地提供有关健康状况、性能、成本和应用程序行为的洞察。
这种转变不仅仅是一种工具变革,而是我们对卓越运营、平台弹性以及在整个 NetApp IT 混合基础设施中提供统一可观察性的承诺的一部分。
Robert Rubin 是 NetApp 的平台工程总监,负责构建和支持我们的现代开发人员平台。在他的职位上,他实现了更快、更安全、更智能的软件开发和部署。Rob 确保开发人员能够在混合云环境中尽可能高效地部署高可扩展性和弹性的传统及 AI/ML 应用程序。