Kontakt aufnehmen
 Dauer 21 Stunden

Schulungsübersicht

Einführung in die Skalierung von Ollama

  • Architektur von Ollama und Skalierungsaspekte
  • Gängige Engpässe in Multi-User-Deployments
  • Best Practices für die infrastrukturelle Eignung

Ressourcenzuweisung und GPU-Optimierung

  • Effiziente Strategien für CPU- und GPU-Auslastung
  • Betrachtungen zu Speicher und Bandbreite
  • Ressourcenbeschränkungen auf Container-Ebene

Deployment mit Containern und Kubernetes

  • Containerisierung von Ollama mit Docker
  • Betrieb von Ollama in Kubernetes-Clustern
  • Lastverteilung und Service Discovery

Autoscaling und Batching

  • Gestaltung von Autoscaling-Policies für Ollama
  • Batching-Techniken für die Optimierung der Durchlaufrate
  • Abwägung zwischen Latenz und Durchlaufrate

Latenz-Optimierung

  • Profilierung der Inferenz-Performance
  • Caching-Strategien und Modell-Warm-up
  • Reduzierung von I/O- und Kommunikations-Overhead

Überwachung und Observability

  • Integration von Prometheus für Metriken
  • Aufbau von Dashboards mit Grafana
  • Benachrichtigungen und Incident Response für die Ollama-Infrastruktur

Kostenmanagement und Skalierungsstrategien

  • Kostenbewusste GPU-Zuweisung
  • Überlegungen zu Cloud- vs. On-Premise-Deployment
  • Strategien für nachhaltiges Skalieren

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Erfahrung in der Linux-Systemadministration
  • Verständnis von Containerisierung und Orchestrierung
  • Vertrautheit mit dem Deployment von Machine-Learning-Modellen

Zielgruppe

  • DevOps-Ingenieure
  • ML-Infrastrukturbereiche
  • Site-Reliability-Engineers (SRE)

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien