Kurs · Schulung · Workshop

Plattform Engineering für AI Applikationen

Platform Engineering für AI-Applikationen: Deployment, Betrieb und Optimierung von Large Language Models und AI-Workloads mit Inferenz-Engines, LLM-Gateways, Monitoring und LLMOps.

Dieser praxisorientierte Kurs vermittelt Platform Engineers, DevOps Engineers und SREs die notwendigen Kenntnisse und Fähigkeiten, um AI-Applikationen und Large Language Models professionell zu betreiben. Die Teilnehmenden lernen, wie sie LLM-Infrastruktur aufbauen, Inferenz-Engines konfigurieren, Performance optimieren und AI-Workloads in Produktion betreiben. Der Kurs behandelt die gesamte Bandbreite von selbst-gehosteter Model-Inferenz über optimierte Inferenz-Engines (vLLM, TensorRT-LLM) bis hin zu LLM-Gateways, Monitoring und Fine-Tuning. Die Teilnehmenden arbeiten mit realen AI-Infrastruktur-Projekten, die Model-Deployment, GPU-Ressourcen-Management, Batching-Strategien, Caching-Optimierung und Observability umfassen. Der Kurs wird sich mit der Konfiguration von Inferenz-Servern, Performance-Tuning, Cost-Optimierung, Monitoring-Setup und LLMOps-Praktiken befassen.

Stimmen unserer Teilnehmer:innen

We had high expectations from the DevOps AI training from letsboot.ch and they were all met or overachieved. We had 3 great days with enough theory, the right amount of practical tasks as well as a lot of real-life examples and answers to our questions. For us the real life experience was gold. The lab environment is very well prepared and organized, you have everything there with a pretty modern interface and quite intuitive if you know your way a bit around a linux console. This was a great training and when we need trainings, letsboot.ch will be the first I ask.
Mihail Mihail
Head of Digital Services Operations Technology and Infrastructure

Diese Kunden haben Kurse im gleichen Themen-Cluster bei uns gebucht.Mehr Kunden →

Inhalt

Der Kurs besteht aus den folgenden Themen und kann je nach Publikum erweitert oder angepasst werden. Die Beispiele im Kurs konzentrieren sich auf weit verbreitete AI/ML-Frameworks und Platform-Engineering-Praktiken. Für Inhouse-Kurse gibt es eine Auswahl an Technologien und Deployment-Szenarien, die gewählt werden können, um besser zum Publikum zu passen.

– Grundlagen und Theorie zu AI und Large Language Models:

  • Historie der Künstlichen Intelligenz und Neuronaler Netze
  • LLM-Architekturen (Transformer, Attention-Mechanismus)
  • Model-Typen (Instruct, Chat, Code, Embedding)
  • Wording: Tokens, Quantisierung, Gewichte, Layer, Context Window
  • Open Source vs. Open Weight vs. Commercial Models
  • Multimodalität und andere Neuronale Netze – AI/ML Frameworks und Standards:
  • ONNX und Model-Interchange-Formate
  • Hugging Face Transformers und Model Hub
  • Standards: MCP (Model Context Protocol), OpenAI API-Kompatibilität – Self-Hosted Model-Inferenz und Deployment:
  • Ollama für schnelles Model-Deployment
  • On-Premises Model-Weight-Storage
  • Model-Download und -Verwaltung
  • Erste Inferenz-Tests und Prompting – Inferenz-Engines und Performance-Optimierung:
  • Inferenz-Engines: vLLM, TensorRT-LLM, Triton Inference Server
  • Batching-Strategien (Static vs. Dynamic Batching)
  • Caching-Strategien (KV-Cache, Prompt Caching)
  • Parallelisierung (Tensor Parallelism, Pipeline Parallelism)
  • Quantisierung (INT8, INT4, GPTQ, AWQ, GGUF)
  • Performance-Metriken (Latency, Throughput, TTFT, TPOT) – GPU-Infrastruktur und Ressourcen-Management:
  • GPU-Auswahl und -Sizing für LLM-Workloads
  • CUDA, ROCm und GPU-Driver-Management
  • GPU-Sharing und Multi-Tenancy
  • Kubernetes GPU-Scheduling und Resource Quotas
  • Cost-Optimierung für GPU-Workloads – LLM-Gateways und API-Management:
  • LiteLLM: Installation, Konfiguration und Backends
  • Model Load Balancing und Fallback-Strategien
  • Rate Limiting und Cost Tracking
  • API-Key-Management und Authentication
  • Multi-Model-Routing und A/B-Testing – Guardrails und Content-Filtering:
  • Konzepte und Notwendigkeit von Guardrails
  • Content-Filter-Implementierung
  • Input/Output-Validierung
  • Safety und Compliance – Model-Serving-Patterns und Architekturen:
  • REST API und gRPC für Model-Serving
  • Synchrone vs. Asynchrone Inferenz
  • Streaming-Responses und Server-Sent Events
  • Model-Versioning und Canary Deployments
  • Blue-Green Deployments für Models – Monitoring und Observability für AI-Workloads:
  • Metriken: Inter-Token Latency, Throughput, Token/s
  • Prometheus-Integration für LLM-Metriken
  • Grafana Dashboards für AI-Monitoring
  • OpenTelemetry für Distributed Tracing
  • Log-Aggregation für Inferenz-Logs
  • Cost-Tracking und Resource-Utilization – Retrieval Augmented Generation (RAG) Infrastructure:
  • Vector-Datenbanken (Pinecone, Weaviate, Qdrant, Milvus)
  • Embedding-Models und Deployment
  • Chunking-Strategien und Indexierung
  • Hybrid Search und Reranking
  • RAG-Pipeline-Orchestrierung – Fine-Tuning und Model-Anpassung:
  • Fine-Tuning-Konzepte und Use Cases
  • LoRA (Low-Rank Adaptation) und QLoRA
  • Full Fine-Tuning vs. Parameter-Efficient Fine-Tuning
  • Training-Infrastructure und GPU-Requirements
  • Model-Evaluation und Validation – LLMOps für LLMs:
  • Model-Registry und Versioning (MLflow, Weights & Biases)
  • Experiment-Tracking und Reproducibility
  • Model-Lifecycle-Management
  • CI/CD für Model-Deployment
  • Automated Model-Testing und Validation – Tool-Calling und Function-Calling:
  • Tool-Calling-Konzepte und Implementierung
  • Function-Calling-APIs
  • Integration externer Tools und Services
  • Agentic Workflows (Unterschied zu Agentic Coding) – Security und Compliance für AI-Workloads:
  • Model-Security und Supply Chain
  • Data Privacy und GDPR-Compliance
  • Network-Security für Model-Serving
  • Audit-Logging und Compliance-Reporting – Cloud-Provider und Managed Services:
  • AWS SageMaker, Bedrock und EC2 für LLMs
  • Azure OpenAI Service und Azure ML
  • Google Cloud Vertex AI und GKE
  • Hybrid und Multi-Cloud-Strategien – Best Practices und Zukunftstrends:
  • Emerging Technologies in AI Infrastructure
  • Cost-Optimierung und Sustainability
  • Performance-Tuning und Benchmarking
  • Team-Organisation für AI-Platform-Teams

Der Kurs kombiniert theoretische Grundlagen mit intensiven praktischen Übungen. Die Teilnehmenden arbeiten mit realen AI-Infrastruktur-Projekten und lernen, wie sie LLM-Workloads professionell betreiben.

Der effektive Kursinhalt kann, abhängig von Trainer, Durchführung, Dauer und Konstellation der Teilnehmer:innen, von obigen Angaben abweichen.

In-House Kurs anfragen

Mit dem Absenden akzeptierst du unsere Datenschutzbestimmungen.

Öffentlichen Termin anfragen

Kein passender öffentlicher Termin dabei? Trag dich unverbindlich ein – sobald genug Interesse besteht, planen wir einen neuen öffentlichen Termin und informieren dich zuerst.

Anzahl Teilnehmende (ungefähr)

Mehr als 3 Teilnehmende? Am besten direkt einen Wunschtermin als In-House Kurs anfragen.

Mit dem Absenden akzeptierst du unsere Datenschutzbestimmungen.

Mehr über AI Platform Engineering

Platform Engineering für AI-Applikationen repräsentiert eine neue Disziplin im Bereich der IT-Infrastruktur. Mit dem rasanten Aufstieg von Large Language Models und generativer AI entstehen neue Herausforderungen für Platform Engineers: GPU-Ressourcen-Management, Inferenz-Optimierung, Cost-Management und die Skalierung von AI-Workloads. Platform Engineers lernen, wie sie die Brücke zwischen AI/ML-Teams und Production-Infrastruktur schlagen und AI-Applikationen zuverlässig, performant und kosteneffizient betreiben.

Weitere Ressourcen:

History

MLOps entstand als Disziplin, um die Lücke zwischen Data-Science-Experimenten und produktionsreifem Maschinenlernbetrieb zu schliessen. Tools wie MLflow (2018) und Kubeflow (2018) standardisierten Experiment-Tracking, Model-Versioning und Deployment-Pipelines für klassische ML-Modelle. Mit dem Durchbruch von Transformer-Modellen und LLMs ab 2022 – angestossen durch GPT-3 und später ChatGPT – entstanden neue Herausforderungen: Modelle mit Milliarden von Parametern erfordern GPU-Cluster, spezialisierte Inferenz-Engines und neue Beobachtbarkeitskonzepte.

LLMOps etablierte sich als Erweiterung von MLOps speziell für Large Language Models. Werkzeuge wie vLLM mit seinem PagedAttention-Algorithmus ermöglichen bis zu 24-fach höheren Durchsatz gegenüber traditionellen Ansätzen. LLM-Gateways wie LiteLLM vereinheitlichen den Zugriff auf verschiedene Modelle und Provider. Platform Engineers stehen heute vor der Aufgabe, diese komplexen Stacks produktionsreif zu betreiben – eine Rolle, die das Feld des AI Platform Engineering geboren hat.