Apple

Leitung Governance & Operations, Infrastruktur & Planung

PythonSQL
Automatische Übersetzung. Prüfe das Original.

Über die Stelle

Apples Platform Acceleration & Compute Efficiency (PACE) ist ein hochwirksames Team, das an der kritischen Schnittstelle unserer ML-Organisationen, der zugrunde liegenden Compute-Infrastruktur und der Kernplattform-Tools operiert. Unsere Mission ist es, Apples Software-Engineering-Teams mit effizientem, skalierbarem Compute zu unterstützen. Durch die Beseitigung operativer Reibungsverluste und die Optimierung des breiteren machine learning-Ökosystems beschleunigen wir direkt die Entwicklungsgeschwindigkeit im gesamten Unternehmen. Wir suchen eine Gründungs-Operations-Leitung mit einer Leidenschaft für das Management des ML-Compute-Lebenszyklus, um unsere Governance- und Operationsfunktion aufzubauen und zu leiten. Dies ist eine einmalige Gelegenheit, die Roadmap zu entwickeln und ein erstklassiges, hochrangiges Operationsteam aufzubauen. Sie werden eng mit den Tool- und Analyseleitungen zusammenarbeiten, um die Governance-Systeme, Telemetrie-Frameworks, Auslastungs-Dashboards und analytischen Modelle zu definieren, die PACE und Apples ML-Führung ein klares, kontinuierlich aktualisiertes Bild der Computernutzung vermitteln. Erfolg in dieser Rolle bedeutet null Projektverschiebungen aufgrund von Prozess-, Plattform- oder Fehlpriorisierung. Die Beherrschung dieser Rolle bedeutet, wichtige Produktivitätskennzahlen zu etablieren und zu verfolgen und proaktiv Probleme zu lösen, um diese Kennzahlen konstant hoch zu halten. Ihre Arbeit wird Kern-ML-Analysen sowohl für die interne Entwicklung als auch für das Inference-Serving ermöglichen. Die meisten Operations-Rollen beinhalten endlose Runbooks. Diese Rolle ist für jemanden, der auch Ingenieur und Künstler im Herzen ist. Ihre Operations-Arbeit wird ein hochwirksames Team befähigen, Entscheidungen zu treffen, die erhebliche Auswirkungen auf Apples Finanzergebnisse haben.

BESCHREIBUNG

  1. Übernahme des täglichen Betriebs der von Ihnen entworfenen Systeme. Sie werden ein skalierbares Hub-and-Spoke-Supportmodell entwerfen und beaufsichtigen, das funktionsübergreifende On-Call-Teams der Stufe 1, Teamleiter der Stufe 2 und eine dedizierte technische Eskalationsgruppe der Stufe 3, die Sie aufbauen und verwalten werden, umfasst.
  1. Übernahme und Weiterentwicklung der Governance-Tools und zugehörigen Systeme von PACE, um sicherzustellen, dass Anfragen nach Rechenressourcen, Zuweisungen und Nutzungsdaten korrekt erfasst werden, um eine schnelle Analyse im großen Maßstab zu unterstützen.
  1. Schließen von Abdeckungslücken, während sich Apples ML-Ökosystem auf neue Hardware (GPUs, TPUs und kundenspezifische Siliziumchips) und Workloads (Inferenz, On-Device) ausdehnt, wobei Leistung, Kosten und Kompatibilität abgewogen werden.
  1. Zusammenarbeit mit dem Data & Analytics Lead zur Pflege der analytischen Schicht, Erstellung von Dashboards, Berichten und automatisierten Warnmeldungen, die Effizienzmöglichkeiten aufzeigen und Infrastruktureinsparungen verfolgen.
  1. Identifizierung von Systemanomalien und operativen Engpässen, die die Auslastung beeinträchtigen und die Kosten erhöhen, und Erstellung von Finanzmodellen, die technische Kennzahlen in umsetzbare Erkenntnisse für die Führungsebene übersetzen.
  1. Zusammenarbeit mit Apples ML-Engineering-Teams, Bereitstellung datengesteuerter Analysen zur Optimierung der Foundation Models, Inferenz-Workloads und Plattform-Tools, die für ihren Erfolg auf Ihre Daten angewiesen sind.
  1. Entwurf robuster Governance-Prozesse und automatisierter Operationen, die speziell für die Bewältigung von ML-Anforderungen im Apple-Maßstab entwickelt wurden.
  1. Zusammenarbeit bei der Erstellung strategischer Analysen, die exekutive Entscheidungen über ML-Compute-Investitionen, -Zuweisungen und -Strategien informieren und Apples ML-Wachstum und Feature-Entwicklung direkt beeinflussen.

MINDESTQUALIFIKATIONEN

  1. BS in Informatik, Data Science, Computer Engineering oder gleichwertige praktische Erfahrung
  1. 5+ Jahre in einer Governance/Operations-Rolle, Data Engineering, Analytics Engineering, Technical Program Management oder in einer groß angelegten Compute- oder Cloud-Umgebung
  1. Organisiert, prozessorientiert und komfortabel im Umgang mit operativen Systemen, auf die andere täglich angewiesen sind
  1. Umfangreiche funktionsübergreifende Erfahrung in der Zusammenarbeit mit fähigen Ingenieuren, Managern, EPMs und Führungskräften
  1. Nachgewiesene Erfahrung im Entwurf und Betrieb komplexer Systeme und Prozesse von Grund auf
  1. KI-affin und in der Lage, sich schnell an KI-Workflows und Empowerment anzupassen
  1. Direkte Erfahrung in der Verwaltung von SRE und hierarchischen technischen Supportsystemen
  1. SQL und Erfahrung im Aufbau von Analyse-Dashboards oder Datenprodukten (Tableau, Looker, Grafana oder ähnlich)
  1. Erfahrung im Entwurf von Datenmodellen oder Telemetrie-Schemata für Infrastruktur-, Kapazitäts- oder Nutzungsdaten
  1. Fähigkeit, rohe technische Kennzahlen in klare Geschäftsberichte für Ingenieure und Führungskräfte zu übersetzen

BEVORZUGTE QUALIFIKATIONEN

  1. Erfahrung mit Python für Datenanalyse (pandas, Notebooks) oder Entwicklung von leichten Pipelines
  1. Vertrautheit mit Konzepten der ML-Trainingsinfrastruktur: GPU-Auslastung, Training-Durchsatz und Planungseffizienz, auch wenn Sie diese nicht direkt optimiert haben
  1. Vorerfahrung in FinOps, Kapazitätsplanung, Cloud-Kostenmanagement oder IT-Governance
  1. Erfahrung im Aufbau oder Betrieb von Datenanalysesystemen
  1. Hintergrund in automatisierten Alarmen oder Anomalieerkennung für Infrastrukturmetriken

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026