Job detail for Lead / Principal AI Infrastructure Architect
Use AI to assess how you fit
Wir suchen einen Lead / Principal AI Infrastructure Architect, der die durchgängige Verantwortung für den Entwurf, die Bereitstellung und die Optimierung der Infrastruktur für groß angelegte Workloads im Bereich Künstliche Intelligenz (KI) und maschinelles Lernen (ML) übernimmt. Der Schwerpunkt der Rolle liegt auf der Architektur und , einschließlich GPU-Clustern, Plattformen für verteiltes Training, Infrastruktur für Model-Serving, Netzwerktechnik, Speicherlösungen, Orchestrierung sowie cloudbasierten KI/ML-Plattformen. Sie übersetzen Geschäftsziele, Service-Level-Anforderungen, und technische in robuste . Sie evaluieren alternative Lösungen, treffen fundierte und stellen sicher, dass die Plattformen auf Leistung, Skalierbarkeit, Zuverlässigkeit, Sicherheit und Kosteneffizienz ausgelegt sind. Als technische Führungskraft übernehmen Sie die Leitung, etablieren Engineering-Standards und Best Practices, betreuen (mentoren) Ingenieure und Architekten und arbeiten eng mit Kunden und Stakeholdern zusammen, um und Roadmaps zu definieren. Requirements Absolut. Ich habe diese auf die gleiche Weise bereinigt: Formulierungen und Wiederholungen wurden entfernt, die Sprache gestrafft und , technische Anforderungen sowie Fü klar voneinander abgegrenzt – bei gleichzeitiger Wahrung des Senioritätsniveaus und der . # Lead / Principal AI Infrastructure Architect ## Über die Position Wir suchen einen Lead / Principal AI Infrastructure Architect, der die durchgängige Verantwortung für den Entwurf, die Bereitstellung und die Optimierung der Infrastruktur für groß angelegte Workloads im Bereich Künstliche Intelligenz (KI) und maschinelles Lernen (ML) übernimmt. Der Schwerpunkt der Rolle liegt auf der Architektur und , einschließlich GPU-Clustern, Plattformen für verteiltes Training, Infrastruktur für Model-Serving, Netzwerktechnik, Speicherlösungen, Orchestrierung sowie cloudbasierten KI/ML-Plattformen. Sie übersetzen Geschäftsziele, Service-Level-Anforderungen, und technische in robuste . Sie evaluieren alternative Lösungen, treffen fundierte und stellen sicher, dass die Plattformen auf Leistung, Skalierbarkeit, Zuverlässigkeit, Sicherheit und Kosteneffizienz ausgelegt sind. Als technische Führungskraft übernehmen Sie die Leitung, etablieren Engineering-Standards und Best Practices, betreuen (mentoren) Ingenieure und Architekten und arbeiten eng mit Kunden und Stakeholdern zusammen, um und Roadmaps zu definieren. ## Kernaufgaben ### KI/ML- * Übernahme der für Architektur und Design der Infrastruktur für groß angelegte KI/ML-Systeme – vom ersten Konzept bis zur Implementierung und Bereitstellung. * Entwurf der Infrastruktur für verteiltes KI/ML-Training, Inferenz und Model-Serving-Workloads. * Architektur und Optimierung des gesamten Rechen-Stacks, einschließlich Rechenleistung, GPUs/Beschleunigern, Netzwerktechnik, Speicher, Orchestrierung und Model-Serving. * Evaluierung von und Treffen fundierter Entscheidungen auf der Basis von Leistung, Skalierbarkeit, Zuverlässigkeit, Kosten, Sicherheit und . * Sicherstellung, dass die mit vereinbarten geschäftlichen SLAs, technischen Standards und betrieblichen Anforderungen im Einklang stehen. ### GPU- und Distributed Computing * Entwurf und Optimierung groß angelegter GPU- und Cluster für KI/ML-Workloads. * Evaluierung und Auswahl geeigneter GPU-/ basierend auf den Anforderungen der Workloads. * Entwurf von und Interconnect-Architekturen für verteiltes Training. * Architektur von Speicherlösungen, die KI/ML-Workloads mit hohem Durchsatz unterstützen. * Identifizierung und Behebung von Infrastruktur-Engpässen, die sich auf Training, Inferenz, Durchsatz oder Skalierbarkeit auswirken. * Optimierung der Infrastruktur hinsichtlich Leistung, , Auslastung und Kosten. ### Cloud-KI/ML-Architektur * Fungieren als technischer Experte für mindestens eine der großen Hyperscaler-Plattformen, wie z. B. AWS, Microsoft Azure oder Google Cloud. * Anwendung fundierter Kenntnisse in den Bereichen Cloud-KI/ML-Dienste, , Beschleuniger (Accelerators), Netzwerk, Speicher, Orchestrierung und Preismodelle. * Bewertung von Cloud- und Empfehlung von Lösungen, die den Anforderungen an Workload, Sicherheit, Leistung und Kosten entsprechen. * Entwurf skalierbarer Cloud- und Hybrid-Infrastrukturen für KI/ML-Workloads auf Unternehmens- und Großskalenebene. * Identifizierung von Möglichkeiten zur Optimierung der Cloud-Auslastung und der . ### und Governance * Leitung von Bewertungen und Überprüfungen bestehender und geplanter KI/ML-. * Identifizierung von Architekturlücken, technischen Risiken, Leistungsengpässen, und . * Festlegung von Strategien zur Problembehebung und Erarbeitung technischer Empfehlungen. * Etablierung von , Mustern (Patterns) und Best Practices für die KI-Infrastruktur. * Dokumentation von , Annahmen, Abwägungen (Trade-offs) und technischen Begründungen. * Sicherstellung der Einhaltung relevanter Sicherheits-, Regulierungs-, Governance- und Kundenstandards. ### Infrastruktur-Roadmap und Kapazitätsplanung * Definition und Pflege der Technologie-Roadmap für die KI/ML-Infrastruktur. * Entwicklung von Kapazitätsplänen unter Berücksichtigung der Anforderungen von Geschäftsbereichen, Produkten und KI/ML-Workloads. * Prognose des Bedarfs an Rechenleistung, Speicher, Netzwerkkapazität und Beschleunigern. * Entwicklung von Kostenmodellen für die Infrastruktur und Identifizierung von Möglichkeiten zur . * Planung der technologischen , des Workload-Wachstums und der Plattform-Skalierbarkeit. ### Automatisierung, Bereitstellung und Betrieb * Entwurf von Bereitstellungs- und für eine zuverlässige, reproduzierbare und skalierbare KI/ML-Infrastruktur. * Etablierung geeigneter CI/CD- und Infrastructure-as-Code-Ansätze für KI/ML-Plattformen und -Workloads. * Unterstützung der automatisierten Bereitstellung von KI-Systemen, Modellen und Datenpipelines in . * Definition von zur Gewährleistung von Zuverlässigkeit, Skalierbarkeit und . * Etablierung von Strategien für Monitoring und Observability über Infrastruktur- und MLOps-Umgebungen hinweg. * Definition und Überwachung von SLAs. Find more English Speaking Jobs in Germany on Arbeitnow [Skills: Information Technology, Information Technology and Services]