Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Grundlagen des Tencent-Hunyuan-Produktivbetriebs
- Überblick über Szenarien für das Serving von Tencent-Hunyuan-Modellen
- Eigenschaften produktionsreifer grosser Modelle und MoE-Architekturen
- Häufige Engpässe bei Latenz, Durchsatz und Kosten
- Definition von Service-Level Objectives (SLOs) für Inferenzanforderungen
Bereitstellungsarchitektur und Serving-Flow
- Komponenten eines produktionsreifen Inference-Stacks
- Entscheidungskriterien zwischen containerisierter, On-Premise- und Cloud-Bereitstellung
- Grundlagen des Modelldownloads, Request-Routings und GPU-Zuweisung
- Design für Zuverlässigkeit und operationale Einfachheit
Latenzoptimierung in der Praxis
- Einsatz optimierter Inferenz-Engines wie TensorRT, wo geeignet
- KV-Cache-Konzepte und praktisches Cache-Tuning
- Reduktion von Startzeit, Warmup-Phase und Antwort-Overhead
- Messung der Zeit bis zum ersten Token (TTFT) und der Token-Generierungsgeschwindigkeit
Durchsatz, Batching und GPU-Effizienz
- Strategien für Continuous Batching und Request-Batching
- Steuerung von Konkurrenz und Warteschlangenverhalten
- Verbesserung der GPU-Auslastung ohne Beeinträchtigung der User Experience
- Bewältigung von Long-Context-Anforderungen und Mixed-Workloads
Quantisierung und Kostenkontrolle
- Warum Quantisierung für das produktionsreife Serving wichtig ist
- Praktische Trade-offs von FP16, INT8 und anderen gängigen Präzisionsoptionen
- Balance zwischen Modellqualität, Latenz und Infrastrukturkosten
- Erstellung einer einfachen Checkliste zur Kostenoptimierung
Operationen, Monitoring und Readiness-Review
- Auto-Scaling-Auslöser für Inferenzdienste
- Monitoring von Latenz, Durchsatz, Cache-Nutzung und GPU-Gesundheit
- Grundlagen von Logging, Alerting und Incident Response
- Review einer Referenzbereitstellung und Erstellung eines Verbesserungsplans
Voraussetzungen
- Basisverständnis von Deployment und Inferenz-Workflows für grosse Sprachmodelle (LLMs)
- Erfahrung mit Containern, Cloud- oder On-Premise-Infrastrukturen sowie API-basierten Diensten
- Praktische Kenntnisse in Python oder Systemengineering-Aufgaben
Zielgruppe
- ML-Ingenieur*innen, die LLMs in den Produktivbetrieb überführen
- Plattform-Engineering-Teams, die für GPU-basierte Inferenzdienste zuständig sind
- Solution Architects, die skalierbare AI-Serving-Plattformen entwerfen