Zum Hauptinhalt springen

Operative Transparenz neu definiert mit NetApp Data Infrastructure Insights

NetApp ITs Entscheidung, DII – Data Infrastructure Insights – einzuführen, war keine leichte. Die Umstellung war mehr als nur eine Änderung der Tools, sie bedeutete ein Bekenntnis zu einheitlicher Observability in der NetApp IT-Hybridinfrastruktur.

Inhalt

Diese Seite teilen

NetApp Bogen-Logo
Rob Rubin

Moderne Anwendungsbereitstellung basiert auf Transparenz, also dem Erkennen, Verstehen und Handeln in dynamischen containerisierten Umgebungen. Unser Platform Engineering Team bei NetApp IT stand vor einer bekannten Herausforderung: die Gewährleistung von Echtzeit-Observability und Sicherheit in unseren Kubernetes-Clustern, ohne zusätzliche Komplexität oder Kosten.

Was als Experiment begann, entwickelte sich bald zur Ablösung eines branchenüblichen Tools durch eine unserer eigenen NetApp Lösungen: NetApp Data Infrastructure Insights (DII).

Neues Denken über den Stack: Von Sysdig zu DII

Bisher nutzten wir Sysdig zur Überwachung unserer Kubernetes-Cluster und verließen uns dabei auf dessen Observability- und Sicherheitsfunktionen. Mit der Einführung einer neuen modernen SDLC-Sicherheitssuite auf unserer Plattform war es jedoch notwendig, unsere Tooling-Strategie zu überdenken.

Gleichzeitig entwickelte sich DII rasant weiter. Nach der Evaluierung seiner Observability-Funktionen wurde strategisch beschlossen, Sysdig Monitor außer Betrieb zu nehmen, die Lizenzen für den Laufzeitschutz auf Sysdig Secure umzuleiten und DII als zentrale Plattform für Monitoring und Diagnose einzusetzen.

„Wir haben uns diese Entscheidung nicht leicht gemacht“, sagte David Fox, NetApp Platform Engineering Team Lead. „Wir haben DII denselben strengen Prüfungen unterzogen wie jedes externe Tool. Es musste sichergestellt sein, dass es uns die benötigten Einblicke liefert, insbesondere wenn im Produktivbetrieb Probleme auftreten.“

Echtzeit-Fehlerbehebung und Ursachenanalyse

Für unser Team ist Observability geschäftskritisch. Eine schnelle Reaktion auf Probleme wie Verbindungsabbrüche oder Leistungseinbußen ist erforderlich. DII ist zur bevorzugten Plattform geworden, um Ursachen zu identifizieren und Vorfälle schnell zu beheben.

Wenn Entwickler Probleme melden, nutzen wir DII, um Kennzahlen wie CPU-Auslastung, Speicherauslastung, Host-Auslastung und Fehlerraten zu erfassen. DII hilft uns, Ressourcenspitzen mit Pod-Konfigurationen oder Limits zu korrelieren, sodass beispielsweise Container identifiziert werden können, die ihre CPU-Grenze erreichen, bevor sie größere Störungen verursachen.

Ein weiterer entscheidender Vorteil ist die Änderungsnachverfolgungsfunktion von DII. Änderungen an Anwendungsmanifesten lassen sich im Zeitverlauf nachvollziehen und mit Störungsberichten korrelieren. Wenn beispielsweise vor drei Tagen ein Fehler auftrat, zeigt DII genau, was sich wann geändert hat. Diese historische Übersicht ist unerlässlich für die Lösung sporadisch auftretender Probleme.

Die Plattform gestalten: Von anfänglichen Herausforderungen bis zur strategischen Zusammenarbeit

Unsere Zusammenarbeit mit DII verlief nicht reibungslos. Frühe Versionen boten nicht die vollständige Parität mit Sysdig, und es gab Kompatibilitätsprobleme. Aber wir waren nicht auf uns allein gestellt, sondern arbeiteten eng mit dem DII Produktteam zusammen, reichten Verbesserungsvorschläge ein und validierten neue Funktionen, sobald diese verfügbar waren.

„In vielerlei Hinsicht haben wir sowohl als Kunde als auch als Partner agiert“, sagte Fox. „Wir haben dazu beigetragen, die Richtung von DII mitzugestalten, und das war ein einzigartiger und lohnender Aspekt dieser Reise.“

Durch diese enge Zusammenarbeit hat die NetApp IT direkten Einfluss auf die Entwicklung des Tools, eine seltene und wertvolle Position bei der Arbeit mit internen Lösungen.

Erweiterte Transparenz: Cloud, Kosten und der Weg in die Zukunft

Da sich DII ständig weiterentwickelt, wird auf eine tiefere Integration über verschiedene Plattformen hinweg, eine verstärkte Automatisierung sowie die Unterstützung von Multi-Cluster- und Multi-Cloud-Umgebungen hingearbeitet.

Wir nutzen Dienste wie Amazon FSx for NetApp ONTAP, um diese Sichtbarkeit auf unsere Public-Cloud-Präsenz auszuweiten. Mit FSx for ONTAP bleiben die Standards für Observability und Automatisierung sowohl in On-Prem- als auch in Cloud-Umgebungen konsistent, unterstützt durch Trident und eng in die DII Plattform integriert.

DII entwickelt sich außerdem zu einem Eckpfeiler unserer umfassenderen Observability- und FinOps-Strategie und liefert Einblicke in Zustand, Leistung, Kosten und Anwendungsverhalten im großen Maßstab.

Dieser Wandel ist mehr als nur eine Änderung der Tools, er ist Teil unseres Engagements für operative Exzellenz, Plattformstabilität und die Bereitstellung einheitlicher Observability in der NetApp IT-Hybridinfrastruktur.

NetApp Bogen-Logo

Rob Rubin

Robert Rubin ist Director of Platform Engineering bei NetApp und verantwortlich für den Aufbau und die Unterstützung unserer modernen Entwicklerplattform. In seiner Rolle ermöglicht er eine schnellere, sicherere und intelligentere Softwareentwicklung und -bereitstellung. Rob stellt sicher, dass Entwickler in einer hybriden Cloud-Umgebung hochskalierbare und ausfallsichere traditionelle sowie KI/ML-Anwendungen so effizient wie möglich bereitstellen können.

Alle Beiträge von Rob Rubin anzeigen
Data Infrastructure Insights: Operative Transparenz neu definiert | NetApp