Roku
Avride
Software Engineer – ML Platform
ÜBER DAS TEAM
Das ML Platform Team bei Avride baut die Infrastruktur, die das Training und die Datenverarbeitung von ML-Modellen im großen Maßstab für autonomes Fahren ermöglicht. Wir sitzen zwischen Cloud Platform und ML-Ingenieuren und wandeln Low-Level-Compute-, Speicher- und Netzwerkprimitive in eine ML-Plattform um, die Teams tatsächlich nutzen – skalierbare Orchestrierung, verteilte Rechenleistung und produktionsreife Tools für den gesamten Modelllebenszyklus.
ÜBER DIE ROLLE
Als ML Platform Engineer bei Avride werden Sie kritische Teile des ML-Stacks verantworten: Workflow-Orchestrierung, verteilte Ausführung, Ressourcengovernance, Performance. Sie werden gestalten, wie ML-Teams im gesamten Unternehmen Experimente durchführen und Modelle im großen Maßstab trainieren. Sie werden die Abstraktionen und Dienste erstellen, die Trainings-Workloads zuverlässig, kosteneffizient und schnell machen und ML-Teams helfen, im großen Maßstab auf Kubernetes mit starker Zuverlässigkeit und exzellenter Entwicklererfahrung zu arbeiten.
WAS SIE TUN WERDEN
- Aufbau und Skalierung unserer ML-Compute-Plattform auf Kubernetes unter Verwendung von Argo Workflows für die Orchestrierung von Training, Evaluierung und Datenverarbeitung
- Entwurf und Implementierung von Kernplattformfunktionen, einschließlich eines Ray-basierten internen SDK für verteilte Ausführung und mandantenfähige Ressourcengovernance – Planung, Prioritäten, Quoten und Durchsetzung von Richtlinien für GPU, CPU, Speicher und IO
- Verbesserung des End-to-End-Trainingsdurchsatzes und der Plattformeffizienz durch Optimierung von Datenzugriffsmustern, Caching und Beseitigung von Engpässen in Speicher, Netzwerk und Ressourcenkonflikten
- Direkte Zusammenarbeit mit ML-Teams zur Fehlerbehebung bei komplexen Workload-Problemen, Durchführung von Ursachenanalysen und Umwandlung wiederkehrender Probleme in plattformweite Lösungen
- Evaluierung, Integration und Erweiterung von Open-Source-Tools (Argo Workflows, Ray, Kubernetes-Ökosystem), um den sich entwickelnden Plattformanforderungen gerecht zu werden
WAS SIE MITBRINGEN
- Starke Kenntnisse in Python oder Go; C++ ist ein Plus
- Nachgewiesene Erfolgsbilanz im Entwurf und Aufbau skalierbarer, wartbarer Systeme und Dienste
- Erfahrung im Betrieb von Produktionsdiensten End-to-End: APIs, Zuverlässigkeitspraktiken, Beobachtbarkeit
- Tiefes Verständnis von Kubernetes: wie Planung, Ressourcenmanagement, Controller und der Pod-Lebenszyklus unter Druck tatsächlich funktionieren
- Solide Linux und Debugging-Fähigkeiten für Systeme: Leistungsuntersuchung, Netzwerk, Speicher/IO
- Fähigkeit zur Fehlerbehebung bei komplexen Produktionsproblemen über Logs, Metriken und Traces hinweg und deren Lösung
VORTEILHAFT
- Erfahrung mit Argo Workflows, Ray, MLflow oder vergleichbaren verteilten ML-Tools
- Praktische Erfahrung im Aufbau oder Betrieb von groß angelegten ML-Trainingssystemen: GPU-Planung, verteiltes Training, Trainingsdaten-Pipelines
- Nachgewiesene Erfolgsbilanz bei der Optimierung der Ressourcennutzung und Leistung in verteilten Umgebungen
#LI-MS1
Bewerber müssen über eine Arbeitserlaubnis in den USA verfügen. Der Arbeitgeber bietet keine Umzugshilfe, keine Sponsoring-Möglichkeiten und keine Remote-Arbeitsoptionen an.
Avride ist ein Arbeitgeber, der Chancengleichheit fördert und sich verpflichtet, qualifizierten Bewerbern und Mitarbeitern mit Behinderungen angemessene Vorkehrungen zu treffen, um sicherzustellen, dass sie gleiche Beschäftigungsmöglichkeiten haben. Avride hält den Americans with Disabilities Act (ADA) ein. Wenn Sie eine angemessene Vorkehrung benötigen, um Sie bei der Bewerbung oder im Einstellungsprozess zu unterstützen oder um die wesentlichen Funktionen einer Stelle auszuführen, wenden Sie sich bitte per E-Mail an [email protected] [[email protected]].
