Kontakt aufnehmen

Schulungsübersicht

Grundlagen des Tencent-Hunyuan-Produktivbetriebs

  • Überblick über Szenarien für das Serving von Tencent-Hunyuan-Modellen
  • Eigenschaften produktionsreifer grosser Modelle und MoE-Architekturen
  • Häufige Engpässe bei Latenz, Durchsatz und Kosten
  • Definition von Service-Level Objectives (SLOs) für Inferenzanforderungen

Bereitstellungsarchitektur und Serving-Flow

  • Komponenten eines produktionsreifen Inference-Stacks
  • Entscheidungskriterien zwischen containerisierter, On-Premise- und Cloud-Bereitstellung
  • Grundlagen des Modelldownloads, Request-Routings und GPU-Zuweisung
  • Design für Zuverlässigkeit und operationale Einfachheit

Latenzoptimierung in der Praxis

  • Einsatz optimierter Inferenz-Engines wie TensorRT, wo geeignet
  • KV-Cache-Konzepte und praktisches Cache-Tuning
  • Reduktion von Startzeit, Warmup-Phase und Antwort-Overhead
  • Messung der Zeit bis zum ersten Token (TTFT) und der Token-Generierungsgeschwindigkeit

Durchsatz, Batching und GPU-Effizienz

  • Strategien für Continuous Batching und Request-Batching
  • Steuerung von Konkurrenz und Warteschlangenverhalten
  • Verbesserung der GPU-Auslastung ohne Beeinträchtigung der User Experience
  • Bewältigung von Long-Context-Anforderungen und Mixed-Workloads

Quantisierung und Kostenkontrolle

  • Warum Quantisierung für das produktionsreife Serving wichtig ist
  • Praktische Trade-offs von FP16, INT8 und anderen gängigen Präzisionsoptionen
  • Balance zwischen Modellqualität, Latenz und Infrastrukturkosten
  • Erstellung einer einfachen Checkliste zur Kostenoptimierung

Operationen, Monitoring und Readiness-Review

  • Auto-Scaling-Auslöser für Inferenzdienste
  • Monitoring von Latenz, Durchsatz, Cache-Nutzung und GPU-Gesundheit
  • Grundlagen von Logging, Alerting und Incident Response
  • Review einer Referenzbereitstellung und Erstellung eines Verbesserungsplans

Voraussetzungen

  • Basisverständnis von Deployment und Inferenz-Workflows für grosse Sprachmodelle (LLMs)
  • Erfahrung mit Containern, Cloud- oder On-Premise-Infrastrukturen sowie API-basierten Diensten
  • Praktische Kenntnisse in Python oder Systemengineering-Aufgaben

Zielgruppe

  • ML-Ingenieur*innen, die LLMs in den Produktivbetrieb überführen
  • Plattform-Engineering-Teams, die für GPU-basierte Inferenzdienste zuständig sind
  • Solution Architects, die skalierbare AI-Serving-Plattformen entwerfen
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien