Kurs · Schulung · Workshop
Plattform Engineering für AI Applikationen
Platform Engineering für AI-Applikationen: Deployment, Betrieb und Optimierung von Large Language Models und AI-Workloads mit Inferenz-Engines, LLM-Gateways, Monitoring und LLMOps.
Dieser praxisorientierte Kurs vermittelt Platform Engineers, DevOps Engineers und SREs die notwendigen Kenntnisse und Fähigkeiten, um AI-Applikationen und Large Language Models professionell zu betreiben. Die Teilnehmenden lernen, wie sie LLM-Infrastruktur aufbauen, Inferenz-Engines konfigurieren, Performance optimieren und AI-Workloads in Produktion betreiben. Der Kurs behandelt die gesamte Bandbreite von selbst-gehosteter Model-Inferenz über optimierte Inferenz-Engines (vLLM, TensorRT-LLM) bis hin zu LLM-Gateways, Monitoring und Fine-Tuning. Die Teilnehmenden arbeiten mit realen AI-Infrastruktur-Projekten, die Model-Deployment, GPU-Ressourcen-Management, Batching-Strategien, Caching-Optimierung und Observability umfassen. Der Kurs wird sich mit der Konfiguration von Inferenz-Servern, Performance-Tuning, Cost-Optimierung, Monitoring-Setup und LLMOps-Praktiken befassen.
Trainer
Stimmen unserer Teilnehmer:innen
We had high expectations from the DevOps AI training from letsboot.ch and they were all met or overachieved. We had 3 great days with enough theory, the right amount of practical tasks as well as a lot of real-life examples and answers to our questions. For us the real life experience was gold. The lab environment is very well prepared and organized, you have everything there with a pretty modern interface and quite intuitive if you know your way a bit around a linux console. This was a great training and when we need trainings, letsboot.ch will be the first I ask.
Head of Digital Services Operations Technology and Infrastructure






Diese Kunden haben Kurse im gleichen Themen-Cluster bei uns gebucht.Mehr Kunden →
Inhalt
Der Kurs besteht aus den folgenden Themen und kann je nach Publikum erweitert oder angepasst werden. Die Beispiele im Kurs konzentrieren sich auf weit verbreitete AI/ML-Frameworks und Platform-Engineering-Praktiken. Für Inhouse-Kurse gibt es eine Auswahl an Technologien und Deployment-Szenarien, die gewählt werden können, um besser zum Publikum zu passen.
– Grundlagen und Theorie zu AI und Large Language Models:
- Historie der Künstlichen Intelligenz und Neuronaler Netze
- LLM-Architekturen (Transformer, Attention-Mechanismus)
- Model-Typen (Instruct, Chat, Code, Embedding)
- Wording: Tokens, Quantisierung, Gewichte, Layer, Context Window
- Open Source vs. Open Weight vs. Commercial Models
- Multimodalität und andere Neuronale Netze – AI/ML Frameworks und Standards:
- ONNX und Model-Interchange-Formate
- Hugging Face Transformers und Model Hub
- Standards: MCP (Model Context Protocol), OpenAI API-Kompatibilität – Self-Hosted Model-Inferenz und Deployment:
- Ollama für schnelles Model-Deployment
- On-Premises Model-Weight-Storage
- Model-Download und -Verwaltung
- Erste Inferenz-Tests und Prompting – Inferenz-Engines und Performance-Optimierung:
- Inferenz-Engines: vLLM, TensorRT-LLM, Triton Inference Server
- Batching-Strategien (Static vs. Dynamic Batching)
- Caching-Strategien (KV-Cache, Prompt Caching)
- Parallelisierung (Tensor Parallelism, Pipeline Parallelism)
- Quantisierung (INT8, INT4, GPTQ, AWQ, GGUF)
- Performance-Metriken (Latency, Throughput, TTFT, TPOT) – GPU-Infrastruktur und Ressourcen-Management:
- GPU-Auswahl und -Sizing für LLM-Workloads
- CUDA, ROCm und GPU-Driver-Management
- GPU-Sharing und Multi-Tenancy
- Kubernetes GPU-Scheduling und Resource Quotas
- Cost-Optimierung für GPU-Workloads – LLM-Gateways und API-Management:
- LiteLLM: Installation, Konfiguration und Backends
- Model Load Balancing und Fallback-Strategien
- Rate Limiting und Cost Tracking
- API-Key-Management und Authentication
- Multi-Model-Routing und A/B-Testing – Guardrails und Content-Filtering:
- Konzepte und Notwendigkeit von Guardrails
- Content-Filter-Implementierung
- Input/Output-Validierung
- Safety und Compliance – Model-Serving-Patterns und Architekturen:
- REST API und gRPC für Model-Serving
- Synchrone vs. Asynchrone Inferenz
- Streaming-Responses und Server-Sent Events
- Model-Versioning und Canary Deployments
- Blue-Green Deployments für Models – Monitoring und Observability für AI-Workloads:
- Metriken: Inter-Token Latency, Throughput, Token/s
- Prometheus-Integration für LLM-Metriken
- Grafana Dashboards für AI-Monitoring
- OpenTelemetry für Distributed Tracing
- Log-Aggregation für Inferenz-Logs
- Cost-Tracking und Resource-Utilization – Retrieval Augmented Generation (RAG) Infrastructure:
- Vector-Datenbanken (Pinecone, Weaviate, Qdrant, Milvus)
- Embedding-Models und Deployment
- Chunking-Strategien und Indexierung
- Hybrid Search und Reranking
- RAG-Pipeline-Orchestrierung – Fine-Tuning und Model-Anpassung:
- Fine-Tuning-Konzepte und Use Cases
- LoRA (Low-Rank Adaptation) und QLoRA
- Full Fine-Tuning vs. Parameter-Efficient Fine-Tuning
- Training-Infrastructure und GPU-Requirements
- Model-Evaluation und Validation – LLMOps für LLMs:
- Model-Registry und Versioning (MLflow, Weights & Biases)
- Experiment-Tracking und Reproducibility
- Model-Lifecycle-Management
- CI/CD für Model-Deployment
- Automated Model-Testing und Validation – Tool-Calling und Function-Calling:
- Tool-Calling-Konzepte und Implementierung
- Function-Calling-APIs
- Integration externer Tools und Services
- Agentic Workflows (Unterschied zu Agentic Coding) – Security und Compliance für AI-Workloads:
- Model-Security und Supply Chain
- Data Privacy und GDPR-Compliance
- Network-Security für Model-Serving
- Audit-Logging und Compliance-Reporting – Cloud-Provider und Managed Services:
- AWS SageMaker, Bedrock und EC2 für LLMs
- Azure OpenAI Service und Azure ML
- Google Cloud Vertex AI und GKE
- Hybrid und Multi-Cloud-Strategien – Best Practices und Zukunftstrends:
- Emerging Technologies in AI Infrastructure
- Cost-Optimierung und Sustainability
- Performance-Tuning und Benchmarking
- Team-Organisation für AI-Platform-Teams
Der Kurs kombiniert theoretische Grundlagen mit intensiven praktischen Übungen. Die Teilnehmenden arbeiten mit realen AI-Infrastruktur-Projekten und lernen, wie sie LLM-Workloads professionell betreiben.
Der effektive Kursinhalt kann, abhängig von Trainer, Durchführung, Dauer und Konstellation der Teilnehmer:innen, von obigen Angaben abweichen.
In-House Kurs anfragen
Öffentlichen Termin anfragen
Kein passender öffentlicher Termin dabei? Trag dich unverbindlich ein – sobald genug Interesse besteht, planen wir einen neuen öffentlichen Termin und informieren dich zuerst.
Mehr über AI Platform Engineering
Platform Engineering für AI-Applikationen repräsentiert eine neue Disziplin im Bereich der IT-Infrastruktur. Mit dem rasanten Aufstieg von Large Language Models und generativer AI entstehen neue Herausforderungen für Platform Engineers: GPU-Ressourcen-Management, Inferenz-Optimierung, Cost-Management und die Skalierung von AI-Workloads. Platform Engineers lernen, wie sie die Brücke zwischen AI/ML-Teams und Production-Infrastruktur schlagen und AI-Applikationen zuverlässig, performant und kosteneffizient betreiben.Weitere Ressourcen:
History
MLOps entstand als Disziplin, um die Lücke zwischen Data-Science-Experimenten und produktionsreifem Maschinenlernbetrieb zu schliessen. Tools wie MLflow (2018) und Kubeflow (2018) standardisierten Experiment-Tracking, Model-Versioning und Deployment-Pipelines für klassische ML-Modelle. Mit dem Durchbruch von Transformer-Modellen und LLMs ab 2022 – angestossen durch GPT-3 und später ChatGPT – entstanden neue Herausforderungen: Modelle mit Milliarden von Parametern erfordern GPU-Cluster, spezialisierte Inferenz-Engines und neue Beobachtbarkeitskonzepte.
LLMOps etablierte sich als Erweiterung von MLOps speziell für Large Language Models. Werkzeuge wie vLLM mit seinem PagedAttention-Algorithmus ermöglichen bis zu 24-fach höheren Durchsatz gegenüber traditionellen Ansätzen. LLM-Gateways wie LiteLLM vereinheitlichen den Zugriff auf verschiedene Modelle und Provider. Platform Engineers stehen heute vor der Aufgabe, diese komplexen Stacks produktionsreif zu betreiben – eine Rolle, die das Feld des AI Platform Engineering geboren hat.

