Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 21 Stunden
Schulungsübersicht
Einführung in die Skalierung von Ollama
- Architektur von Ollama und Skalierungsaspekte
- Gängige Engpässe in Multi-User-Deployments
- Best Practices für die infrastrukturelle Eignung
Ressourcenzuweisung und GPU-Optimierung
- Effiziente Strategien für CPU- und GPU-Auslastung
- Betrachtungen zu Speicher und Bandbreite
- Ressourcenbeschränkungen auf Container-Ebene
Deployment mit Containern und Kubernetes
- Containerisierung von Ollama mit Docker
- Betrieb von Ollama in Kubernetes-Clustern
- Lastverteilung und Service Discovery
Autoscaling und Batching
- Gestaltung von Autoscaling-Policies für Ollama
- Batching-Techniken für die Optimierung der Durchlaufrate
- Abwägung zwischen Latenz und Durchlaufrate
Latenz-Optimierung
- Profilierung der Inferenz-Performance
- Caching-Strategien und Modell-Warm-up
- Reduzierung von I/O- und Kommunikations-Overhead
Überwachung und Observability
- Integration von Prometheus für Metriken
- Aufbau von Dashboards mit Grafana
- Benachrichtigungen und Incident Response für die Ollama-Infrastruktur
Kostenmanagement und Skalierungsstrategien
- Kostenbewusste GPU-Zuweisung
- Überlegungen zu Cloud- vs. On-Premise-Deployment
- Strategien für nachhaltiges Skalieren
Zusammenfassung und nächste Schritte
Voraussetzungen
- Erfahrung in der Linux-Systemadministration
- Verständnis von Containerisierung und Orchestrierung
- Vertrautheit mit dem Deployment von Machine-Learning-Modellen
Zielgruppe
- DevOps-Ingenieure
- ML-Infrastrukturbereiche
- Site-Reliability-Engineers (SRE)