Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in agentische KI für den Betrieb
- Von statischen Runbooks zu schlussfolgernden Agenten: Die Evolution der IT-Automatisierung
- Anatomie eines Agenten: Schlussfolgerungszyklus, Werkzeugnutzung, Gedächtnis und Planung
- Wann automatisieren vs. wann Menschen in der Schleife lassen
Agenten-Frameworks und Architekturen
- Einzelagenten-Muster: ReAct, Plan-and-Execute und Tool-Calling-Loops
- Multigent-Architekturen: Supervisor-, Hierarchie- und Schwarmmuster
- Framework-Vergleich: LangGraph, CrewAI, AutoGen und individuelle Agenten
- Aufbau des ersten Betriebsagenten: Monitoring abfragen, Diagnose stellen, Vorschläge machen
Werkzeugintegration für den IT-Betrieb
- Verbindung von Agenten zu APIs von Prometheus, Grafana, Datadog und PagerDuty
- Log-Abfragen mit Agenten: Integration von Elasticsearch, Loki und Splunk
- Nutzung von Infrastruktur-Tools: kubectl, Terraform, Ansible über Agentenaktionen
- Gestaltung sicherer Werkzeugschnittstellen mit Parametervalidierung und Idempotenz
Automatisierte Incident-Response
- Automatisierte Incident-Triage: Klassifizierung der Schweregrade und Routing
- Generierung von Root-Cause-Hypothesen und Evidenzsammmlung
- Automatisierte Behebung: Aktionen wie Neustart, Skalierung, Rollback und Failover
- Aufbau eines Incident-Runbook-Agenten mit gestuften Autonomiegraden
Sicherheit, Guardrails und Human-in-the-Loop
- Klassifizierung von Aktionen: nur Lesen, geringes Risiko, hohes Risiko und destruktiv
- Genehmigungsinstanzen und Eskalationsrichtlinien für kritische Operationen
- Guardrail-Muster: Aktions-WhiteLists, Blast-Radius-Grenzen und Rollback-Garantien
- Prüfpfade und Entscheidungsherkunft für Compliance
Multigent-Orchestrierung für komplexe Incidents
- Koordination spezialisierter Agenten: Triage-Agent, Diagnose-Agent, Remediation-Agent
- Kommunikation zwischen Agenten und Verwaltung des gemeinsamen Kontexts
- Konfliktlösung, wenn Agenten widersprüchliche Aktionen vorschlagen
- End-to-End-Simulation eines Major Incidents mit Multigent-Reaktion
Observability und Bewertung
- Tracking von Agenten-Schlussfolgerungsketten zur Fehlersuche und Prüfung
- Bewertung der Entscheidungsqualität von Agenten: Präzision, Recall, Time-to-Resolution
- Feedback-Schleifen: Lernen aus Operator-Overrides und Ergebnissen
- Kostenverfolgung und Token-Ökonomie für Betriebsagenten
Produktionsbereitstellung und Betrieb
- Bereitstellung von Agenten als Dienste: APIs, Webhooks und geplante Jobs
- Graduelles Hinausrollen der Autonomie: Von Schattenmodus bis zur vollständigen automatischen Behebung
- Runbook für Agentenausfälle: Was passiert, wenn der Agent selbst ausfällt
- Aufbau des Business Cases und Messung der ROI für autonome Betriebsabläufe
Voraussetzungen
- Erfahrung mit IT-Betrieb, DevOps oder SRE-Praktiken.
- Grundkenntnisse in Python-Skripting und REST-APIs.
- Grundlegendes Verständnis der Fähigkeiten von LLMs und Prompt Engineering.
Zielgruppe
- SRE- und DevOps-Engineers, die KI-gestützte Automatisierung erkunden.
- Plattform-Engineers, die selbstheilende Infrastrukturen aufbauen.
- IT-Betriebsleiter, die agentische KI für das Incident-Management evaluieren.
14 Stunden