Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
EXO Infrastructure as Code
- Übersicht über EXO-Bereitstellungsmuster: Single-Node-, Multi-Node- und RDMA-Cluster
- Automatisierung der Installation von Abhängigkeiten (Xcode, uv, Node.js, Rust) mittels Konfigurationsverwaltung
- Nutzung von Nix Flakes für reproduzierbare EXO-Builds und Entwicklerumgebungen
- Erstellung von Ansible Playbooks oder Shell-Skripten für die unbeaufsichtigte Cluster-Bereitstellung
Reproduzierbare Builds und CI-Integration
- Festlegen der Abhängigkeiten (Pinning) und Bauen des Dashboards in CI-Pipelines
- Ausführen von EXO-Smoke-Tests in GitHub Actions oder GitLab-CI-Läufern
- Erstellung von Golden Images und Snapshot-basierten Rollback-Workflows für macOS- und Linux-VMs
- Versiionieren benutzerdefinierter Modellkarten neben dem Anwendungscode
Cluster-Erkennung und Automatisierung des Netzwerkconfigs
- Konfiguration von mDNS und statischem DNS für eine zuverlässige Entdeckung von libp2p-Knoten
- Automatisierte Erstellung von Netzwerkprofilen und Thunderbolt-Brückenverwaltung unter macOS
- Nutzung benutzerdefinierter Namespaces (EXO_LIBP2P_NAMESPACE) zur Trennung von Dev-, Staging- und Prod-Clustern
- Firewall-Regeln und Netzwerkksegmentierung für Multi-Tenant-Umgebungen
Speicher- und Modell-Lebenszyklusverwaltung
- Entwicklung von EXO_MODELS_DIRS- und EXO_MODELS_READ_ONLY_DIRS-Strategien
- Mounten von NFS- oder SAN-Shares als schreibgeschützte Modellrepositorys für eine schnelle Bereitstellung
- Bereinigen veralteter Caches und Festlegen von Richtlinien zur Beibehaltung versionierter Gewichtungen
- Automatisiertes Vorab-Downloaden von Modellen und Gesundheitschecks vor Rollout-Aktualisierungen
Monitoring und Alarmierung
- Leiten der EXO-Logs an eine zentrale Logging-Plattform (ELK, Loki oder Splunk)
- Erstellen von Grafana-Dashboards auf Basis der EXO_TRACING_ENABLED-Ausgabe
- Alarmierung bei Änderungen der Cluster-Mitgliedschaft, Out-of-Memory-Ereignissen und Latenzspitzen bei der Inferenz
- Korrelation von Hardware-Telemetriedaten (macmon) mit Leistungseinbußen der Modelle
Updates, Rollbacks und Disaster Recovery
- Staging von EXO-Binary-Updates auf einem Canary-Knoten vor dem Fleet-weiten Rollout
- Modell-Level-Rollback: Wechseln zwischen quantisierten Versionen ohne Neu-Download
- Sichern und Wiederherstellen des Cluster-Zustands, benutzerdefinierter Namespaces und zwischengespeicherter Gewichtungen
- Dokumentieren von Recovery-Runbooks für Szenarien eines kompletten Cluster-Rebuilds
Security-Härtung und Compliance
- Anwenden von TLS auf der Reverse-Proxy-Schicht (nginx, traefik) für das Dashboard und die API
- Implementierung der API-Ratenbegrenzung und IP-Whitelisting für EXO-Endpunkte
- Trennung der Cluster mittels VLANs und Zero-Trust-Netzwerkrichtlinien
- Auditieren von Zugriffen und Führen eines Inventars der bereitgestellten Modelle und Versionen
Voraussetzungen
- Erfahrung mit DevOps-Praktiken (CI/CD, IaC, Container-Orchestrierung)
- Kenntnisse in der Systemadministration und Paketverwaltung unter macOS oder Linux
- Verständnis für Netzwerkprinzipien, DNS und Speicherkonzepte
Zielgruppe
- DevOps-Ingenieure
- Infrastrukturarchitekten
- SREs, die für on-premise-KI-Arbeitslasten verantwortlich sind
21 Stunden
Erfahrungsberichte (2)
Craig war extrem engagiert im Training und hat stets darauf geachtet, dass wir aufmerksam sind. Er passte die Beispiele an unsere täglichen Aktivitäten an und gab immer eine Antwort, wenn danach gefragt wurde, auch wenn die Information nicht im Präsentationsmaterial enthalten war.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Kurs - DevOps Foundation®
Maschinelle Übersetzung
Hoher Einsatz und Fachwissen des Trainers
Jacek - Softsystem
Kurs - DevOps Engineering Foundation (DOEF)®
Maschinelle Übersetzung