Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Einführung in AIOps
- Was ist AIOps und warum ist es wichtig
- Traditionelle Überwachung vs. AIOps-gestützte Observability
- AIOps-Architektur und Kernkomponenten
Erfassung und Normalisierung von Betriebsdaten
- Arten von Observability-Daten: Metriken, Protokolle und Traces
- Dateneingabe aus verschiedenen Quellen (Server, Container, Cloud)
- Nutzung von Agents und Exportern (Prometheus, Beats, Fluentd)
Datenkorrelation und Anomalieerkennung
- Zeitreihenekorrelation und statistische Methoden
- Einsatz von ML-Modellen zur Anomalieerkennung
- Erfassung von Vorfällen in verteilten Systemen
Alarmierung und Reduzierung von Rauschen
- Gestaltung intelligenter Alarmregeln und Schwellenwerte
- Unterdrückung, Deduplizierung und Gruppierung von Alarmen
- Integration mit Alertmanager, Slack, PagerDuty oder Opsgenie
Ursachenanalyse und Visualisierung
- Nutzung von Dashboards zur Visualisierung von Metriken und Trenderkennung
- Untersuchung von Ereignissen und Zeitplänen zur Ursachenanalyse (RCA)
- Nachverfolgung von Problemen über Ebenen hinweg mit verteilten Tracing-Tools
Automatisierung und Behebung
- Auslösung automatisierter Skripte oder Workflows aus Vorfällen
- Integration mit ITSM-Systemen (ServiceNow, Jira)
- Anwendungsfälle: Selbstheilung, Skalierung, Verkehrslenkung
Open-Source- und kommerzielle AIOps-Plattformen
- Übersicht der Tools: Prometheus, Grafana, ELK, Moogsoft, Dynatrace
- Evaluierungskriterien für die Auswahl einer AIOps-Plattform
- Demo und Praxis mit einem ausgewählten Stack
Zusammenfassung und nächste Schritte
Voraussetzungen
- Verständnis der Konzepte des IT-Betriebs und der Systemüberwachung
- Erfahrung mit Überwachungstools oder Dashboards
- Vertrautheit mit grundlegenden Protokoll- und Metrikformaten
Zielgruppe
- Betriebsteams, die für Infrastruktur und Anwendungen zuständig sind
- Site Reliability Engineers (SREs)
- IT-Überwachungs- und Observability-Teams