Job detail for (Senior) AI Platform Engineer (m/f/d)
Use AI to assess how you fit
Du brennst für Kubernetes, Plattform-Engineering und moderne AI-Technologien? Du möchtest nicht nur einzelne Modelle deployen, sondern die Infrastruktur und Plattformen schaffen, auf denen innovative AI-Anwendungen zuverlässig, sicher und skalierbar betrieben werden?
Dann bist du bei uns genau richtig.
Als (Senior) AI Platform Engineer (m/f/d) entwickelst, betreibst und optimierst du moderne AI- und ML-Plattformen für unsere Kunden. Du arbeitest mit Kubernetes, GPU-Infrastrukturen, Infrastructure as Code sowie modernen CI/CD-, MLOps- und LLMOps-Ansätzen und unterstützt Unternehmen dabei, Generative AI und Machine Learning erfolgreich in den produktiven Einsatz zu bringen.
Dich erwarten spannende Projekte in Branchen, technologischer und ein Team aus Cloud-, Plattform-, Data- und AI-Spezialisten, das Innovation nicht nur diskutiert, sondern täglich umsetzt.
Aufgaben
Planung, Aufbau und Betrieb von hochverfügbaren AI/ML-Plattformen und -Services, insbesondere auf Basis von Kubernetes in On-Premises-, Hybrid- und Cloud-Umgebungen.
Design und Umsetzung skalierbarer GPU-Infrastrukturen innerhalb von Kubernetes-Clustern – inklusive GPU-Scheduling und -Sharing (z. B. Kueue, KAI-Scheduler, Run:ai, NVIDIA MIG/Time-Slicing) mit Blick auf Auslastung und Kosteneffizienz.
Aufbau und Betrieb von Model-Serving- und Inferenz-Diensten (z. B. vLLM, NVIDIA Triton, KServe, NVIDIA NIM, Ray) für klassische ML-Modelle und Large Language Models.
Entwicklung und Betrieb von MLOps-/LLMOps-Workflows für produktive GenAI-Services – inklusive Guardrails & Policies, Evaluierung, sowie Kosten- und Qualitätsmonitoring.
Bereitstellung von Fine-Tuning- und Re-Training-Workflows (z. B. LoRA, Re-Training) auf der Plattform.
Monitoring, Troubleshooting und Performance-Tuning von AI-Plattformen (u. a. GPU-Auslastung, Inferenz-Latenz, Durchsatz), um höchste Performance und Verfügbarkeit sicherzustellen.
Beratung unserer Kunden in Bezug auf Best Practices, AI-Governance, Datensicherheit und Datenschutz im Kontext von AI-Plattformen auf Kubernetes.
Enge Zusammenarbeit mit Data-Science-, Data-Platform- und zur Sicherstellung der nahtlosen Integration von AI-Lösungen.
Qualifikation
Mindestens 3 Jahre Erfahrung im Betrieb und der Optimierung von Plattformen und Services at Scale in Kubernetes-Umgebungen, egal ob On-Premise oder in der Cloud.
Fundierte Kenntnisse in der Architektur und dem Betrieb von skalierbaren Lösungen unter Verwendung von Kubernetes, idealerweise inklusive GPU-Workloads.
in Python, idealerweise ergänzt um Golang oder Java.
Erfahrung mit mindestens einem Model-Serving-Framework (z. B. vLLM, NVIDIA Triton, KServe) sowie erste oder vertiefte Erfahrung mit MLOps-Werkzeugen (z. B. MLflow, Kubeflow, ClearML).
Erfahrung mit Infrastructure-as-Code-Tools wie Ansible und Terraform sowie CI/CD- und GitOps-Werkzeugen (z. B. Argo CD, Flux).
Sehr gute Kommunikationsfähigkeiten in Deutsch und Englisch. Idealerweise hast du bereits Kunden beraten und kannst technische Themen vermitteln – vom Engineering-Team bis zum Management.
Für die Senior-Rolle zusätzlich:
Mindestens 5 Jahre einschlägige Erfahrung im Plattform-Engineering.
Architektur-Ownership: Du verantwortest das Design von AI-Plattformen end-to-end und triffst technologische .
Technische Führung in Kundenprojekten (Lead-Rolle) sowie Mentoring von Kolleginnen und Kollegen.
Darüber hinaus verfügst du idealerweise über:
Erfahrung mit Cloud-AI-Diensten (z. B. AWS SageMaker/Bedrock, Azure ML/Azure OpenAI/Azure AI Foundry) und deren Integration mit Kubernetes-Workloads.
Kenntnisse im Betrieb von LLM-basierten Architekturen, z. B. RAG-Pipelines, und Embedding-Services sowie Agentic-AI-Ansätze und Model Context Protocol (MCP).
Verständnis von System-Level-Grundlagen des LLM-Servings (Rate Limiting, Token Streaming, Load Balancing) und LLM-Konzepten wie Reasoning, Tool Calling und Prompt Templates.
Erfahrung mit neuen Serving-Bausteinen wie llm-d oder Kubernetes Inference Gateway.
Kenntnisse in der Absicherung von AI-Plattformen, z. B. TLS, RBAC und Network Policies innerhalb von Kubernetes-Umgebungen, sowie Grundverständnis von AI-Governance (z. B. EU AI Act).
im Bereich relevanter Technologien (z. B. Certified Kubernetes Administrator/Developer, NVIDIA-).
Bereitschaft zu gelegentlichen Reisen im DACH-Raum.
Benefits
Wir bieten dir u.a.:
Betriebliche Altersvorsorge
Teamorientierte mit regelmäßigen Teamevents
Gezielte Förderung deiner fachlichen
Corporate Benefits Programm
Flexible Arbeitszeiten
Moderner Arbeitsplatz mit zeitgemäßer Ausstattung
Remote-Work-Möglichkeiten
Wir freuen uns auf deine Online-Bewerbung und darauf, mehr über dich zu erfahren.
We get IT done. 🚀
Find Jobs in Germany on Arbeitnow [Skills: IT]