StrideCare
Waymo
Senior Machine Learning Engineer, Computer Vision/VLM
Über die Stelle
Waymo ist ein Unternehmen für autonome Fahrtechnologie mit der Mission, der weltweit vertrauenswürdigste Fahrer zu sein. Seit dem Start als Google Self-Driving Car Project im Jahr 2009 konzentriert sich Waymo auf die Entwicklung des Waymo Driver – The World's Most Experienced Driver™ –, um den Zugang zu Mobilität zu verbessern und Tausende von Menschenleben zu retten, die derzeit durch Verkehrsunfälle verloren gehen. Der Waymo Driver treibt den vollständig autonomen Ride-Hailing-Dienst von Waymo an und kann zudem auf eine Reihe von Fahrzeugplattformen und Produktanwendungsfällen angewendet werden. Der Waymo Driver hat bereits über zehn Millionen Fahrten ohne menschlichen Fahrer absolviert, ermöglicht durch die Erfahrung von über 100 Millionen autonom gefahrenen Meilen auf öffentlichen Straßen sowie zig Milliarden Meilen in Simulationen in über 15 US-Bundesstaaten.
Im Bereich Semantics ist es die Mission unseres Teams, die präzisesten und umfassendsten Offboard-Perception-Autolabels in großem Maßstab zu erstellen, die als Grundlage für das Training und die Validierung des AV-Stacks dienen. Wir sind ein fortschrittliches ML- und Engineering-Team, das modernste Computer Vision, deep learning und generative KI nutzt, um Fahrprotokolle automatisch zu analysieren, ein tiefgreifendes Szenenverständnis zu generieren und die Daten-Engine anzutreiben, die es Waymo ermöglicht, sicher und effizient zu skalieren.
In dieser hybriden Rolle berichten Sie an einen Senior Staff Technical Lead Manager.
Sie werden:
- State-of-the-Art Computer Vision / multimodale Modelle (z. B. Gemini) entwickeln und trainieren, um die reichhaltigen semantischen Informationen (z. B. Objektattribute, Szeneneigenschaften, Interaktionsdynamiken) zu extrahieren, die vom KI-Agenten benötigt werden.
- Ein skalierbares KI-Agenten-Framework entwerfen und implementieren, das große Foundation-Modelle (z. B. Gemini) mit den Ausgaben unserer Wahrnehmungsmodelle und internen Wissensdatenbanken integriert.
- Fine-Tuning- und Reinforcement Learning (RL)-Techniken entwickeln und anwenden, um einen „Data Flywheel“ zu erstellen, der die Captioning- und Reasoning-Fähigkeiten des Systems durch automatisiertes Feedback kontinuierlich verbessert.
- Neuartige Prompting-Strategien für Vision-Language Models (VLMs) entwickeln und prototypisieren, um komplexe, kausale Schlussfolgerungen über Fahrszenarien zu erzielen.
- Eng mit den Teams ML Infra, Perception, Behavior und AI Foundation zusammenarbeiten, um Datenanforderungen zu definieren und das Captioning-System in den breiteren ML-Entwicklungslebenszyklus zu integrieren.
- Den gesamten Systemlebenszyklus verantworten, von der fortgeschrittenen Modellentwicklung und Prototypenerstellung bis hin zur Produktionsbereitstellung und Skalierung für massive Datengenerierung.
Mindestanforderungen
Sie haben:
- Master-Abschluss in Informatik oder einem verwandten technischen Bereich.
- 4+ Jahre praktische Erfahrung im Training und der Bereitstellung von deep learning-Modellen für Computer-Vision-Aufgaben (z. B. Erkennung, Segmentierung, Videoanalyse) unter Verwendung von Python und Frameworks wie PyTorch, JAX oder TensorFlow.
- 1+ Jahre nachgewiesene Erfahrung in der Arbeit mit großen Sprachmodellen (LLMs) oder Vision-Language-Modellen (VLMs) in Bereichen wie Fine-Tuning, Prompting oder Retrieval-Augmented Generation (RAG).
- Starke Grundlagen in Software-Engineering, einschließlich des Entwurfs skalierbarer und zuverlässiger Systeme.
- Erfahrung im Aufbau und Management von groß angelegten Datenverarbeitungspipelines für ML-Training.
- Nachgewiesene Fähigkeit, autonom zu arbeiten und komplexe technische Projekte in einem schnelllebigen F&E-Umfeld zu leiten.
Wir bevorzugen:
- Promotion in Informatik oder einem verwandten technischen Bereich.
- Veröffentlichungsliste auf Top-KI-Konferenzen (z. B. NeurIPS, ICML, ICLR, CVPR).
- Praktische Erfahrung mit Reinforcement Learning, insbesondere RLHF, RLAIF oder der Anwendung von RL auf Sprach-/Agentenaufgaben.
- Erfahrung mit modernen Techniken im Bereich Self-Supervised, Weakly-Supervised oder Multi-Task Learning für Wahrnehmung.
- Erfahrung im Aufbau mit KI-Agenten-Frameworks (z. B. LangChain, LlamaIndex) oder der Entwicklung autonomer agentischer Systeme.
- Vertrautheit mit den Herausforderungen der multimodalen Wahrnehmung in der Robotik oder im autonomen Fahren.
- Eine Erfolgsbilanz bei wirkungsvoller funktionsübergreifender Zusammenarbeit.
Die erwartete Gehaltsspanne für diese Vollzeitstelle an US-Standorten ist unten aufgeführt. Das tatsächliche Einstiegsgehalt basiert auf arbeitsbezogenen Faktoren, einschließlich des genauen Arbeitsortes, der Erfahrung, der relevanten Ausbildung und Qualifikation sowie des Qualifikationsniveaus. Ihr Recruiter kann Ihnen während des Einstellungsprozesses weitere Informationen über die spezifische Gehaltsspanne für den Standort der Stelle oder, falls die Stelle remote ausgeführt werden kann, über die spezifische Gehaltsspanne für Ihren bevorzugten Standort geben.
Waymo-Mitarbeiter sind außerdem berechtigt, am diskretionären jährlichen Bonusprogramm von Waymo, am Aktienoptionsplan und am großzügigen Leistungsprogramm des Unternehmens teilzunehmen, vorbehaltlich der Teilnahmevoraussetzungen.
Gehaltsspanne
$213,000—$263,000 USD
