Roku
Apple
Leitung Governance & Operations, Infrastruktur & Planung
Über die Stelle
Apples Platform Acceleration & Compute Efficiency (PACE) ist ein hochwirksames Team, das an der kritischen Schnittstelle unserer ML-Organisationen, der zugrunde liegenden Compute-Infrastruktur und der Kernplattform-Tools operiert. Unsere Mission ist es, Apples Software-Engineering-Teams mit effizientem, skalierbarem Compute zu unterstützen. Durch die Beseitigung operativer Reibungsverluste und die Optimierung des breiteren machine learning-Ökosystems beschleunigen wir direkt die Entwicklungsgeschwindigkeit im gesamten Unternehmen. Wir suchen eine Gründungs-Operations-Leitung mit einer Leidenschaft für das Management des ML-Compute-Lebenszyklus, um unsere Governance- und Operationsfunktion aufzubauen und zu leiten. Dies ist eine einmalige Gelegenheit, die Roadmap zu entwickeln und ein erstklassiges, hochrangiges Operationsteam aufzubauen. Sie werden eng mit den Tool- und Analyseleitungen zusammenarbeiten, um die Governance-Systeme, Telemetrie-Frameworks, Auslastungs-Dashboards und analytischen Modelle zu definieren, die PACE und Apples ML-Führung ein klares, kontinuierlich aktualisiertes Bild der Computernutzung vermitteln. Erfolg in dieser Rolle bedeutet null Projektverschiebungen aufgrund von Prozess-, Plattform- oder Fehlpriorisierung. Die Beherrschung dieser Rolle bedeutet, wichtige Produktivitätskennzahlen zu etablieren und zu verfolgen und proaktiv Probleme zu lösen, um diese Kennzahlen konstant hoch zu halten. Ihre Arbeit wird Kern-ML-Analysen sowohl für die interne Entwicklung als auch für das Inference-Serving ermöglichen. Die meisten Operations-Rollen beinhalten endlose Runbooks. Diese Rolle ist für jemanden, der auch Ingenieur und Künstler im Herzen ist. Ihre Operations-Arbeit wird ein hochwirksames Team befähigen, Entscheidungen zu treffen, die erhebliche Auswirkungen auf Apples Finanzergebnisse haben.
BESCHREIBUNG
- Übernahme des täglichen Betriebs der von Ihnen entworfenen Systeme. Sie werden ein skalierbares Hub-and-Spoke-Supportmodell entwerfen und beaufsichtigen, das funktionsübergreifende On-Call-Teams der Stufe 1, Teamleiter der Stufe 2 und eine dedizierte technische Eskalationsgruppe der Stufe 3, die Sie aufbauen und verwalten werden, umfasst.
- Übernahme und Weiterentwicklung der Governance-Tools und zugehörigen Systeme von PACE, um sicherzustellen, dass Anfragen nach Rechenressourcen, Zuweisungen und Nutzungsdaten korrekt erfasst werden, um eine schnelle Analyse im großen Maßstab zu unterstützen.
- Schließen von Abdeckungslücken, während sich Apples ML-Ökosystem auf neue Hardware (GPUs, TPUs und kundenspezifische Siliziumchips) und Workloads (Inferenz, On-Device) ausdehnt, wobei Leistung, Kosten und Kompatibilität abgewogen werden.
- Zusammenarbeit mit dem Data & Analytics Lead zur Pflege der analytischen Schicht, Erstellung von Dashboards, Berichten und automatisierten Warnmeldungen, die Effizienzmöglichkeiten aufzeigen und Infrastruktureinsparungen verfolgen.
- Identifizierung von Systemanomalien und operativen Engpässen, die die Auslastung beeinträchtigen und die Kosten erhöhen, und Erstellung von Finanzmodellen, die technische Kennzahlen in umsetzbare Erkenntnisse für die Führungsebene übersetzen.
- Zusammenarbeit mit Apples ML-Engineering-Teams, Bereitstellung datengesteuerter Analysen zur Optimierung der Foundation Models, Inferenz-Workloads und Plattform-Tools, die für ihren Erfolg auf Ihre Daten angewiesen sind.
- Entwurf robuster Governance-Prozesse und automatisierter Operationen, die speziell für die Bewältigung von ML-Anforderungen im Apple-Maßstab entwickelt wurden.
- Zusammenarbeit bei der Erstellung strategischer Analysen, die exekutive Entscheidungen über ML-Compute-Investitionen, -Zuweisungen und -Strategien informieren und Apples ML-Wachstum und Feature-Entwicklung direkt beeinflussen.
MINDESTQUALIFIKATIONEN
- BS in Informatik, Data Science, Computer Engineering oder gleichwertige praktische Erfahrung
- 5+ Jahre in einer Governance/Operations-Rolle, Data Engineering, Analytics Engineering, Technical Program Management oder in einer groß angelegten Compute- oder Cloud-Umgebung
- Organisiert, prozessorientiert und komfortabel im Umgang mit operativen Systemen, auf die andere täglich angewiesen sind
- Umfangreiche funktionsübergreifende Erfahrung in der Zusammenarbeit mit fähigen Ingenieuren, Managern, EPMs und Führungskräften
- Nachgewiesene Erfahrung im Entwurf und Betrieb komplexer Systeme und Prozesse von Grund auf
- KI-affin und in der Lage, sich schnell an KI-Workflows und Empowerment anzupassen
- Direkte Erfahrung in der Verwaltung von SRE und hierarchischen technischen Supportsystemen
- SQL und Erfahrung im Aufbau von Analyse-Dashboards oder Datenprodukten (Tableau, Looker, Grafana oder ähnlich)
- Erfahrung im Entwurf von Datenmodellen oder Telemetrie-Schemata für Infrastruktur-, Kapazitäts- oder Nutzungsdaten
- Fähigkeit, rohe technische Kennzahlen in klare Geschäftsberichte für Ingenieure und Führungskräfte zu übersetzen
BEVORZUGTE QUALIFIKATIONEN
- Erfahrung mit Python für Datenanalyse (pandas, Notebooks) oder Entwicklung von leichten Pipelines
- Vertrautheit mit Konzepten der ML-Trainingsinfrastruktur: GPU-Auslastung, Training-Durchsatz und Planungseffizienz, auch wenn Sie diese nicht direkt optimiert haben
- Vorerfahrung in FinOps, Kapazitätsplanung, Cloud-Kostenmanagement oder IT-Governance
- Erfahrung im Aufbau oder Betrieb von Datenanalysesystemen
- Hintergrund in automatisierten Alarmen oder Anomalieerkennung für Infrastrukturmetriken
