跳轉至主要內容

利用 NetApp Data Infrastructure Insights 重新定義營運可視性

NetApp IT 部門決定採用 DII(Data Infrastructure Insights)並非輕率之舉。這不僅是工具的更換,更是對 NetApp IT 混合基礎架構統一可觀測性的承諾。

目錄

分享本頁

NetApp 拱門標誌
Rob Rubin

現代應用程式交付依賴於可見度——觀察、理解並應對動態容器化環境中發生的一切。我們 NetApp IT 部門的平台工程團隊面臨著一個熟悉的挑戰:如何在不增加複雜性或成本的情況下,確保 Kubernetes 叢集的即時可觀測性和安全性。

最初只是一個實驗,但很快就演變成用我們自己的 NetApp 解決方案之一—— NetApp Data Infrastructure Insights (DII)——取代業界標準工具。

重新思考堆疊:從 Sysdig 到 DII

我們之前使用 Sysdig 來監控 Kubernetes 叢集,主要依靠其可觀測性和安全功能。然而,隨著我們在平台上引入新的現代化 SDLC 安全套件,我們需要重新評估工具策略。

同時,DII 也在快速發展成熟。在評估其可見度功能後,我們策略性地決定停用 Sysdig Monitor,將授權重新分配給 Sysdig Secure 以用於執行階段保護,並採用 DII 作為我們的核心監控與診斷平台。

「這不是一個我們輕易做出的決定,」 NetApp 平台工程團隊主管 David Fox 表示。「我們對 DII 進行了與任何外部工具相同的嚴格審查。我們必須確信它能為我們提供所需的洞察力,特別是在生產環境中發生問題時。」

即時故障排除和根本原因分析

對我們的團隊而言,可觀測性至關重要。我們需要快速回應諸如連線中斷或效能下降等問題。DII 已成為我們識別根本原因並快速解決事件的首選平台。

當開發人員提交問題時,我們會使用 DII 來追蹤 CPU 使用率、記憶體容量壓力、主機使用率和錯誤率等計量。DII 可以幫助我們將資源峰值與 Pod 配置或限制關聯起來,使我們能夠在容器達到 CPU 上限之前,及時發現並解決可能造成更大範圍故障的問題。

DII 的變更追蹤功能是另一項顛覆性創新。我們可以追蹤應用程式清單隨時間推移的變更,並將其與事件報告關聯起來。如果某個問題在三天前開始出現,DII 可以準確地顯示變更內容和變更時間。這種歷史視角對於解決間歇性問題至關重要。

平台建構:從早期挑戰到策略協同作業

我們與 DII 的合作並非無縫。早期版本缺乏與 Sysdig 完整的功能同位元檢查,相容性方面也存在一些問題。但我們並非孤軍奮戰——我們與 DII 產品團隊緊密合作,提交功能增強請求,並在新功能上線後進行驗證。

"在很多方面,我們既是客戶又是合作夥伴,"Fox 表示。"我們幫助塑造了 DII 的發展方向,這是這段旅程中獨特而令人欣慰的部分。"

這種緊密的協同作業意味著 NetApp IT 可以直接影響工具的開發——在使用內部解決方案時,這是一個難得且寶貴的地位。

拓展可見度:雲端、成本與未來之路

隨著 DII 持續演進,我們正朝著跨平台更深入的整合、更高的自動化,以及對多叢集和多雲環境的支援邁進。

我們正在利用 Amazon FSx for NetApp ONTAP 等服務,將這種可見度擴展到我們的公有雲實體佔用空間。借助 FSx for ONTAP,我們能夠在內部部署和雲端環境中維持一致的可觀測性與自動化標準,該服務由 Trident 提供支援,並與 DII 平台緊密整合。

DII 也正在成為我們更廣泛的可觀測性和 FinOps 策略的基石,大規模地提供有關健全狀況、效能、成本和應用程式行為的見解。

這種轉變不僅僅是工具的改變,更是我們對卓越營運績效、平台彈性,以及在 NetApp IT 混合基礎架構中提供統一可觀測性的承諾的一部分。

NetApp 拱門標誌

Rob Rubin

Robert Rubin 是 NetApp 的平台工程總監,負責建構和支援我們現代化的開發者平台。在他的職責中,他協助實現更快、更安全、更智慧的軟體開發和部署。Rob 致力於確保開發者能夠在混合雲環境中盡可能有效地部署易擴充的且具有恢復能力的傳統應用程式及 AI/ML 應用程式。

查看 Rob Rubin 的所有文章