Kontakt aufnehmen

Schulungsübersicht

EXO Infrastructure as Code

  • Übersicht über EXO-Bereitstellungsmuster: Single-Node-, Multi-Node- und RDMA-Cluster
  • Automatisierung der Installation von Abhängigkeiten (Xcode, uv, Node.js, Rust) mittels Konfigurationsverwaltung
  • Nutzung von Nix Flakes für reproduzierbare EXO-Builds und Entwicklerumgebungen
  • Erstellung von Ansible Playbooks oder Shell-Skripten für die unbeaufsichtigte Cluster-Bereitstellung

Reproduzierbare Builds und CI-Integration

  • Festlegen der Abhängigkeiten (Pinning) und Bauen des Dashboards in CI-Pipelines
  • Ausführen von EXO-Smoke-Tests in GitHub Actions oder GitLab-CI-Läufern
  • Erstellung von Golden Images und Snapshot-basierten Rollback-Workflows für macOS- und Linux-VMs
  • Versiionieren benutzerdefinierter Modellkarten neben dem Anwendungscode

Cluster-Erkennung und Automatisierung des Netzwerkconfigs

  • Konfiguration von mDNS und statischem DNS für eine zuverlässige Entdeckung von libp2p-Knoten
  • Automatisierte Erstellung von Netzwerkprofilen und Thunderbolt-Brückenverwaltung unter macOS
  • Nutzung benutzerdefinierter Namespaces (EXO_LIBP2P_NAMESPACE) zur Trennung von Dev-, Staging- und Prod-Clustern
  • Firewall-Regeln und Netzwerkksegmentierung für Multi-Tenant-Umgebungen

Speicher- und Modell-Lebenszyklusverwaltung

  • Entwicklung von EXO_MODELS_DIRS- und EXO_MODELS_READ_ONLY_DIRS-Strategien
  • Mounten von NFS- oder SAN-Shares als schreibgeschützte Modellrepositorys für eine schnelle Bereitstellung
  • Bereinigen veralteter Caches und Festlegen von Richtlinien zur Beibehaltung versionierter Gewichtungen
  • Automatisiertes Vorab-Downloaden von Modellen und Gesundheitschecks vor Rollout-Aktualisierungen

Monitoring und Alarmierung

  • Leiten der EXO-Logs an eine zentrale Logging-Plattform (ELK, Loki oder Splunk)
  • Erstellen von Grafana-Dashboards auf Basis der EXO_TRACING_ENABLED-Ausgabe
  • Alarmierung bei Änderungen der Cluster-Mitgliedschaft, Out-of-Memory-Ereignissen und Latenzspitzen bei der Inferenz
  • Korrelation von Hardware-Telemetriedaten (macmon) mit Leistungseinbußen der Modelle

Updates, Rollbacks und Disaster Recovery

  • Staging von EXO-Binary-Updates auf einem Canary-Knoten vor dem Fleet-weiten Rollout
  • Modell-Level-Rollback: Wechseln zwischen quantisierten Versionen ohne Neu-Download
  • Sichern und Wiederherstellen des Cluster-Zustands, benutzerdefinierter Namespaces und zwischengespeicherter Gewichtungen
  • Dokumentieren von Recovery-Runbooks für Szenarien eines kompletten Cluster-Rebuilds

Security-Härtung und Compliance

  • Anwenden von TLS auf der Reverse-Proxy-Schicht (nginx, traefik) für das Dashboard und die API
  • Implementierung der API-Ratenbegrenzung und IP-Whitelisting für EXO-Endpunkte
  • Trennung der Cluster mittels VLANs und Zero-Trust-Netzwerkrichtlinien
  • Auditieren von Zugriffen und Führen eines Inventars der bereitgestellten Modelle und Versionen

Voraussetzungen

  • Erfahrung mit DevOps-Praktiken (CI/CD, IaC, Container-Orchestrierung)
  • Kenntnisse in der Systemadministration und Paketverwaltung unter macOS oder Linux
  • Verständnis für Netzwerkprinzipien, DNS und Speicherkonzepte

Zielgruppe

  • DevOps-Ingenieure
  • Infrastrukturarchitekten
  • SREs, die für on-premise-KI-Arbeitslasten verantwortlich sind
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (2)

Kommende Kurse

Verwandte Kategorien