Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Einführung in prediktives AIOps
- Überblick über prediktive Analysen im IT-Betrieb
- Datenquellen für Vorhersagen (Logs, Metriken, Ereignisse)
- Wichtige Konzepte in der Zeitreihenprognose und Anomalie-Mustern
Gestaltung von Modellen zur Störungsvorhersage
- Kennzeichnung historischer Störungen und des Systemverhaltens
- Auswahl und Training von Modellen (z. B. LSTM, Random Forest, AutoML)
- Bewertung der Modellleistung und Umgang mit falsch-positiven Treffern
Datenerfassung und Feature Engineering
- Erfassung und Abgleich von Log- und Metrikdaten für die Modelleinbindung
- Extraktion von Merkmalen aus strukturierten und unstrukturierten Daten
- Behandlung von Rauschen und fehlenden Daten in operativen Pipelines
Automatisierung der Ursachenanalyse (RCA)
- Graphbasierte Korrelation von Diensten und Infrastruktur
- Verwendung von ML, um wahrscheinliche Ursachen aus Ereignisketten abzuleiten
- Visualisierung der RCA mit Topologie-bewussten Dashboards
Behebung und Workflow-Automatisierung
- Integration mit Automatisierungsplattformen (z. B. Ansible, Rundeck)
- Auslösung von Rollbacks, Neustarts oder Traffic-Umleitungen
- Prüfung und Dokumentation automatisierter Eingriffe
Skalierung intelligenter AIOps-Pipelines
- MLOps für Observability: Re-Training und Versionierung von Modellen
- Durchführung von Vorhersagen in Echtzeit über verteilte Knoten hinweg
- Best Practices für den Einsatz von AIOps in Produktivumgebungen
Fallstudien und praktische Anwendungen
- Analyse realer Störungdaten mit prediktiven AIOps-Modellen
- Einführung von RCA-Pipelines mit synthetischen und Produktionsdaten
- Übersicht über Branchenuse-Cases: Cloud-Ausfälle, Instabilität von Microservices, Netzwerkdegradierungen
Zusammenfassung und nächste Schritte
Voraussetzungen
- Erfahrung mit Monitoring-Systemen wie Prometheus oder ELK
- Fundierte Kenntnisse in Python und Grundlagen des Machine Learning
- Vertrautheit mit Workflows für das Incident Management
Zielgruppe
- Senior Site Reliability Engineers (SREs)
- IT-Automatisierungsarchitekten
- DevOps- und Observability-Plattform-Leiter