Kontakt aufnehmen

Schulungsübersicht

Die Landschaft der KI-Observability

  • Von Dashboards zu Gesprächen: Der Wandel hin zur KI-augmentierten Observability
  • Fähigkeiten von LLMs, die für Observability relevant sind: Zusammenfassung, Schlussfolgerung, Mustererkennung
  • Architekturmuster: Einbettung von KI in bestehende Observability-Stacks

Natürlichsprachige Abfrage von Telemetriedaten

  • Von Text zu PromQL: Übersetzung natürlicher Sprache in Monitoring-Abfragen
  • NL-Abfragen für Elasticsearch, OpenSearch und Loki Log-Speicher
  • SQL-Generierung aus natürlicher Sprache für strukturierte Telemetriedaten
  • Erstellung eines Query-Assistant-Agents mit Tool-Nutzung und Kontextbewusstsein

LLM-gestützte Log-Analyse

  • Automatisches Parsing und Strukturiere von Logs mit LLMs
  • Anomalieerkennung in Log-Streams mittels Embedding-Ähnlichkeit
  • Log-Klusterung und Mustererkennung im grossen Massstab
  • Generierung menschenlesbarer Erklärungen aus rohen Log-Sequenzen

Intelligente Alarmierung und Incident-Anreicherung

  • Korrelation und Deduplizierung von Alerts mit semantischem Verständnis
  • Automatisches Sammeln von Incident-Kontext aus Runbooks, vergangenen Incidents und Dokumentationen
  • Smarte Alarm-Routing basierend auf Inhaltsverständnis und Team-Expertise
  • Reduzierung der Alert-Müdigkeit durch KI-gesteuerte Lärmreduktion

KI-unterstützte Root-Cause-Analyse

  • Hypothesengenerierung aus der Korrelation multipler Telemetriekquellen
  • Evidenzkette: Verbindung von Symptomen über Metriken, Logs und Traces hinweg
  • Geführte Fehlersuche mit interaktiven AI-Diagnosesitzungen
  • Erstellung eines Root-Cause-Analyse-Agents mit progressiver Untersuchung

Automatisierte Incident-Behandlung und Kommunikation

  • Generierung von Incident-Zusammenfassungen und Status-Updates aus Telemetriedaten
  • Automatisches Erstellen von Postmortem-Berichten mit Zeitleisten-Rekonstruktion
  • Auf die Zielgruppe zugeschnittene Kommunikation für technische und executive Stakeholder
  • Vorschläge für Runbooks und automatische Vorschläge zur Behebung

ML für Observability

  • Zeitreihen-Prognose für Kapazitätsplanung und Anomalievorhersage
  • Foundation-Modelle zur Zero-Shot-Anomalieerkennung bei Metriken
  • Embedding-basierte Erfassung von Service-Abhängigkeiten und Topologie-Erkennung
  • Ausbildung und Bereitstellung leichtgewichtiger ML-Modelle neben Observability-Pipelines

Bereitstellung in der Produktion und Ethik

  • Latenz- und Kostenaspekte für Echtzeit-KI-Observability
  • Datenschutz: Sicherstellen, dass LLMs keine sensiblen Telemetriedaten preisgeben
  • Menschliche Aufsicht: Wann die AI-Diagnose durch Operator-Bestätigung benötigt wird
  • Wirkungsmessung: MTTD, MTTR und Metriken zur On-Call-Erfahrung

Voraussetzungen

  • Erfahrung mit Observability-Tools wie Prometheus, Grafana, Datadog oder OpenTelemetry.
  • Vertrautheit mit Konzepten des Log-Managements und der Metriken.
  • Grundlegende Python-Skripting-Kenntnisse für die Datenverarbeitung.

Zielgruppe

  • SRE- und Observability-Ingenieurinnen und -Ingenieure, die KI-ergänzte Tools übernehmen.
  • Platform-Ingenieurinnen und -Ingenieure, die Monitoring-Pipelines der nächsten Generation aufbauen.
  • DevOps-Leitende, die die Integration von LLMs in Incident-Arbeitsabläufe bewerten.
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien