Kontakt aufnehmen

Schulungsübersicht

Einführung in agentische KI für den Betrieb

  • Von statischen Runbooks zu schlussfolgernden Agenten: Die Evolution der IT-Automatisierung
  • Anatomie eines Agenten: Schlussfolgerungszyklus, Werkzeugnutzung, Gedächtnis und Planung
  • Wann automatisieren vs. wann Menschen in der Schleife lassen

Agenten-Frameworks und Architekturen

  • Einzelagenten-Muster: ReAct, Plan-and-Execute und Tool-Calling-Loops
  • Multigent-Architekturen: Supervisor-, Hierarchie- und Schwarmmuster
  • Framework-Vergleich: LangGraph, CrewAI, AutoGen und individuelle Agenten
  • Aufbau des ersten Betriebsagenten: Monitoring abfragen, Diagnose stellen, Vorschläge machen

Werkzeugintegration für den IT-Betrieb

  • Verbindung von Agenten zu APIs von Prometheus, Grafana, Datadog und PagerDuty
  • Log-Abfragen mit Agenten: Integration von Elasticsearch, Loki und Splunk
  • Nutzung von Infrastruktur-Tools: kubectl, Terraform, Ansible über Agentenaktionen
  • Gestaltung sicherer Werkzeugschnittstellen mit Parametervalidierung und Idempotenz

Automatisierte Incident-Response

  • Automatisierte Incident-Triage: Klassifizierung der Schweregrade und Routing
  • Generierung von Root-Cause-Hypothesen und Evidenzsammmlung
  • Automatisierte Behebung: Aktionen wie Neustart, Skalierung, Rollback und Failover
  • Aufbau eines Incident-Runbook-Agenten mit gestuften Autonomiegraden

Sicherheit, Guardrails und Human-in-the-Loop

  • Klassifizierung von Aktionen: nur Lesen, geringes Risiko, hohes Risiko und destruktiv
  • Genehmigungsinstanzen und Eskalationsrichtlinien für kritische Operationen
  • Guardrail-Muster: Aktions-WhiteLists, Blast-Radius-Grenzen und Rollback-Garantien
  • Prüfpfade und Entscheidungsherkunft für Compliance

Multigent-Orchestrierung für komplexe Incidents

  • Koordination spezialisierter Agenten: Triage-Agent, Diagnose-Agent, Remediation-Agent
  • Kommunikation zwischen Agenten und Verwaltung des gemeinsamen Kontexts
  • Konfliktlösung, wenn Agenten widersprüchliche Aktionen vorschlagen
  • End-to-End-Simulation eines Major Incidents mit Multigent-Reaktion

Observability und Bewertung

  • Tracking von Agenten-Schlussfolgerungsketten zur Fehlersuche und Prüfung
  • Bewertung der Entscheidungsqualität von Agenten: Präzision, Recall, Time-to-Resolution
  • Feedback-Schleifen: Lernen aus Operator-Overrides und Ergebnissen
  • Kostenverfolgung und Token-Ökonomie für Betriebsagenten

Produktionsbereitstellung und Betrieb

  • Bereitstellung von Agenten als Dienste: APIs, Webhooks und geplante Jobs
  • Graduelles Hinausrollen der Autonomie: Von Schattenmodus bis zur vollständigen automatischen Behebung
  • Runbook für Agentenausfälle: Was passiert, wenn der Agent selbst ausfällt
  • Aufbau des Business Cases und Messung der ROI für autonome Betriebsabläufe

Voraussetzungen

  • Erfahrung mit IT-Betrieb, DevOps oder SRE-Praktiken.
  • Grundkenntnisse in Python-Skripting und REST-APIs.
  • Grundlegendes Verständnis der Fähigkeiten von LLMs und Prompt Engineering.

Zielgruppe

  • SRE- und DevOps-Engineers, die KI-gestützte Automatisierung erkunden.
  • Plattform-Engineers, die selbstheilende Infrastrukturen aufbauen.
  • IT-Betriebsleiter, die agentische KI für das Incident-Management evaluieren.
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien