Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
KI-Souveränität und lokale Bereitstellung von LLMs
- Risiken von Cloud-LLMs: Datenspeicherung, Training anhand von Eingaben, ausländische Rechtsprechung.
- Ollama-Architektur: Model Server, Registry und OpenAI-kompatible API.
- Vergleich mit vLLM, llama.cpp und Text Generation Inference.
- Modelllizenzen: Bedingungen für Llama, Mistral, Qwen und Gemma.
Installation und Hardware-Einrichtung
- Ollama auf Linux mit CUDA- und ROCm-Unterstützung installieren.
- Alternative CPU-only-Implementierung und AVX/AVX2-Optimierung.
- Docker-Bereitstellung und persistenter Volume-Mapping.
- Multi-GPU-Einrichtung und Strategien zur VRAM-Zuteilung.
Modellverwaltung
- Modelle aus dem Ollama-Registry abrufen: ollama pull llama3.
- GGUF-Modelle von HuggingFace und TheBloke importieren.
- Quantisierungsstufen: Q4_K_M, Q5_K_M, Q8_0 sowie deren Vor- und Nachteile.
- Modellwechsel und Grenzen des gleichzeitigen Ladens von Modellen.
Benutzerdefinierte Modelfiles
- Syntax für Modelfile verfassen: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Tuning von Temperature, top_p und repeat_penalty.
- Engineering von System-Prompts für rollenspezifisches Verhalten.
- Erstellen und Veröffentlichen benutzerdefinierter Modelle im lokalen Registry.
API-Integration
- OpenAI-kompatibles /v1/chat/completions-Endpunkt.
- Streaming-Antworten und JSON-Modus.
- Integration mit LangChain, LlamaIndex und benutzerdefinierten Anwendungen.
- Authentifizierung und Rate Limiting über Reverse Proxy.
Performance-Optimierung
- Gewichtung des Kontextfensters und KV-Cache-Management.
- Batch-Inference und parallele Anfragenverarbeitung.
- Zuteilung von CPU-Threads und NUMA-Bewusstsein.
- Überwachung der GPU-Auslastung und Speichersituation.
Sicherheit und Compliance
- Netzwerkisolierung für Model Serving Endpunkte.
- Eingabe-Filterung und Output-Moderations-Pipelines.
- Audit-Logging von Prompts und Completion-Antworten.
- Modell-Herkunftsnachweis und Hash-Verifizierung.
Voraussetzungen
- Fortgeschrittene Kenntnisse in Linux- und Containerverwaltung.
- Grundlegendes Verständnis von Machine Learning und Transformer-Modellen auf hoher Ebene.
- Bekanntschaft mit REST-APIs und JSON.
Zielgruppe
- KI-Ingenieure und Entwickler, die Cloud-LLM-APIs ersetzen möchten.
- Organisationen mit sensiblen Daten, die den Einsatz von Cloud-Modellen verhindern.
- Bundesbehörden und Verteidigungsteams, die vollständig abgeschottete (air-gapped) Sprachmodelle erfordern.
14 Stunden