Kontakt aufnehmen

Schulungsübersicht

Einführung in EXO und lokales KI-Clustering

  • Übersicht über das EXO-Framework und das exo-explore-Ökosystem
  • Vergleich von zentralisierter Cloud-Inferenz vs. verteilter lokaler Inferenz
  • Architektur: libp2p-Geräteerkennung, MLX-Backend, Dashboard und API-Schichten
  • Hardware-Anforderungen: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, gemeinsamer Speicher

Installation von EXO auf macOS

  • Einrichten von Xcode, Metal Toolchain und macOS-Voraussetzungen
  • Installation von uv, Node.js, Rust Nightly-Toolchain
  • Installation der gepinnten macmon-Fork zur Überwachung von Apple Silicon
  • Klonen des Repositorys und Erstellen des Dashboards mit npm
  • Ausführen von EXO aus dem Quellcode und Überprüfung des Dashboards unter localhost:52415

Installation von EXO auf Linux

  • Installieren von Abhängigkeiten über apt oder Homebrew auf Linux
  • Konfigurieren von uv, Node.js 18+ und Rust Nightly
  • Erstellen des Dashboards und Ausführen von EXO im CPU-only-Modus
  • Verzeichnisstruktur: XDG Base Directory-Pfade für Konfiguration, Daten, Cache und Logs

Automatische Geräteeerkennung und Clusterbildung

  • Verständnis der libp2b-basierten Auto-Erkennung über lokale Netzwerke
  • Konfigurieren benutzerdefinierter Namespaces mit EXO_LIBP2P_NAMESPACE zur Cluster-Isolierung
  • Überprüfen der Knotenmitgliedschaft im Dashboard-Clusteransicht
  • Umgang mit Erkennungsfehlern und Netzwerksegmentierungsproblemen

Aktivieren von RDMA über Thunderbolt 5

  • RDMA-Architektur und die Behauptung einer Reduktion der Latenzzeit um 99 Prozent
  • Aktivieren von RDMA im macOS-Wiederherstellungsmodus mit rdma_ctl
  • Kabelanforderungen und Porttopologie-Einschränkungen auf Mac Studio
  • Übereinstimmung der macOS-Versionen auf allen Cluster-Knoten
  • Behandlung von RDMA-Erkennungs- und DHCP-Konfigurationsproblemen

Bereitstellung von Fronttier-Modellen

  • Verwenden des Dashboards zum Laden und Sharding von DeepSeek v3.1, Qwen3-235B und Llama-Familienmodellen
  • Vorschau der Instanzplatzierungen mit dem /instance/previews-API-Endpunkt
  • Erstellen von Modellinstanzen mit Pipeline- oder Tensor-Parallel-Sharding
  • Konfigurieren benutzerdefinierter Modellspezifikationen aus dem HuggingFace-Hub

Überwachung und Fehlerbehebung

  • Lesen von EXO-Logs und Verständnis für verteilte Nachverfolgung
  • Interpretieren der Cluster-Gesundheit in der Dashboard-Clusteransicht
  • Diagnose von Worker-Knotenausfällen und Wiederverbindungsverhalten
  • Nutzung von EXO_TRACING_ENABLED für Leistungsengpassanalysen

Clusterwartung und Updates

  • Aktualisieren der EXO-Binärdateien und Dashboard-Wiederaufbauverfahren
  • Migrieren von Modellcaches und Verwalten vorab heruntergeladener Modelle über NFS
  • Sanftes Entfernen von Knoten und Ausbalancieren der Lasten

Voraussetzungen

  • Grundkenntnisse in Netzwerk fundamentals (IP, Subnetting, Firewalls)
  • Erfahrung mit der macOS- oder Linux-Befehlszeilenadministration
  • Vertrautheit mit Python-Paketverwaltung (pip/uv) und Node.js-Tools

Zielgruppe

  • Systemadministratoren
  • DevOps-Ingenieure
  • KI-Infrastrukturarchitekten, die für On-Premise-LLM-Bereitstellungen verantwortlich sind
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien