Launch Legends
Roblox
Principal Software Engineer, GPU Compute
Über die Stelle
Täglich kommen Millionen von Menschen zu Roblox, um in immersiven 3D-Erlebnissen zu erkunden, zu kreieren, zu spielen, zu lernen und sich mit Freunden zu verbinden – all das wurde von unserer globalen Community aus Entwicklern und Kreativen geschaffen.
Bei Roblox entwickeln wir die Werkzeuge und die Plattform, die es unserer Community ermöglichen, jede erdenkliche Erfahrung zum Leben zu erwecken. Unsere Vision ist es, die Art und Weise, wie Menschen zusammenkommen, von überall auf der Welt und auf jedem Gerät, neu zu gestalten. Wir haben uns zum Ziel gesetzt, eine Milliarde Menschen mit Optimismus und Zivilcourage zu verbinden, und suchen nach großartigen Talenten, die uns dabei helfen.
Eine Karriere bei Roblox bedeutet, dass Sie an der Gestaltung der Zukunft menschlicher Interaktion arbeiten, einzigartige technische Herausforderungen in großem Maßstab lösen und dazu beitragen, sicherere und zivilere gemeinsame Erlebnisse für alle zu schaffen.
Als Principal Software Engineer im Compute-Team sind Sie der technische Anker für die GPU- und KI-Beschleuniger-Fähigkeiten von Roblox. Dies ist eine bewährte GPU-Expertenrolle, die sich auf die Maschinenebene und darüber hinaus konzentriert: Wie GPU-Hosts produktionsreif gemacht, gesund gehalten und in zuverlässige Rechenressourcen für die von ihnen abhängigen Workloads umgewandelt werden. Sie werden die schwierigen Probleme lösen, die nur in großem Maßstab auftreten, von der Treiber- und Firmwareverwaltung bis hin zur GPU-Gesundheit, Zuverlässigkeit und Leistung über eine schnell wachsende Flotte von Beschleunigern in den Rechenzentren und Cloud-Umgebungen von Roblox. Sie werden die technische Richtung für GPU-Compute vorgeben und das gesamte GPU-Know-how der Organisation verbessern.
Ihre Aufgaben
- Als technischer Leiter für GPUs im Compute-Team arbeiten Sie mit Kubernetes, Machine Bootstrap, Networking und Cloud zusammen, um die GPU-Strategie End-to-End voranzutreiben.
- Verantwortlich für den GPU-Host-Lebenszyklus oberhalb der reinen Flottenverwaltung: Treiber-, Firmware- und CUDA-Stack-Management, GPU-Gesundheit und Telemetrie sowie Behebung von GPU-spezifischen Fehlern (XID-Fehler, ECC, thermische Probleme, NVLink- und Fabric-Fehler).
- Architektur der Bereitstellung von GPU-Kapazitäten für Compute-Plattformen, einschließlich Scheduling, Isolierung und Integration mit Kubernetes für GPU- und KI-Workloads.
- Steigerung der GPU-Zuverlässigkeit und -Leistung im Flottenmaßstab, Definition der Erkennung, Diagnose und automatisierten Reparatur von nicht funktionierenden Beschleunigern, bevor sie die Produktion beeinträchtigen.
- Bewertung und Einführung neuer GPU- und KI-Beschleunigerplattformen, Netzwerktopologien (NVLink, InfiniBand, RoCE) und Multi-Node-Trainings- und Inferenzmuster.
- Festlegung der Standards, Werkzeuge und APIs, die es anderen Engineering-Teams ermöglichen, GPU-Compute sicher und effizient zu nutzen, wodurch manuelle Arbeit reduziert und die Messlatte für die Organisation höher gelegt wird.
Ihr Profil
- 10+ Jahre Erfahrung im Aufbau und Betrieb von verteilten Systemen und Infrastrukturen im großen Maßstab.
- Tiefgreifende praktische GPU-Expertise auf der Ebene der Maschinenverwaltung und darüber hinaus: Bereitstellung von GPU-Hosts, Treiber- und Firmware-Lebenszyklus, GPU-Gesundheit und Zuverlässigkeit sowie die Realitäten des Betriebs von Beschleunigern in der Produktion.
- Nachweisliche Expertise im Bereich Compute, nicht nur im Flottenmanagement, mit den Narben, die beweisen, dass Sie GPU- oder Beschleunigerinfrastrukturen im großen Maßstab betrieben haben, auf die sich andere Teams verlassen.
- Starke Kenntnisse in Go oder anderen gut strukturierten Programmiersprachen.
- Erfahrung im Betrieb von GPU- und KI-Workloads in der Produktion, einschließlich Kenntnisse von CUDA, GPU-Scheduling und Hochleistungsnetzwerken (NVLink, InfiniBand, RoCE).
- Kenntnisse von Kubernetes für GPU-Workloads und Bare-Metal-Konzepten (Firmware, BMC/IPMI/Redfish, OS-Imaging) sind ein großes Plus.
- Eine Historie als Anker-Experte, auf den sich eine Organisation für ihre schwierigsten GPU- und Compute-Probleme verlässt, und die Führungsqualitäten, um die Ingenieure um Sie herum zu fördern.
Jährliche Gehaltsspanne
Für Rollen, die sich in unserem Hauptsitz in San Mateo, CA, befinden: Das Anfangsgehalt für diese Position beträgt wie unten angegeben. Das tatsächliche Grundgehalt hängt von einer Vielzahl von berufsbezogenen Faktoren ab, wie z. B. beruflicher Hintergrund, Ausbildung, Arbeitserfahrung, Standort, Geschäftsanforderungen und Marktnachfrage. Daher kann das tatsächliche Gehalt in einigen Fällen außerhalb dieses erwarteten Bereichs liegen. Diese Gehaltsspanne kann sich ändern und in Zukunft angepasst werden. Alle Vollzeitmitarbeiter haben auch Anspruch auf Aktienvergütung und auf die auf dieser Seite beschriebenen Leistungen.
$345,040—$399,420 USD
Rollen, die sich in einem Büro befinden, sind dienstags, mittwochs und donnerstags vor Ort, mit optionaler Anwesenheit am Montag und Freitag (sofern nicht anders angegeben).
Roblox bietet allen Mitarbeitern und Bewerbern gleiche Beschäftigungsmöglichkeiten und verbietet Diskriminierung und Belästigung jeglicher Art, unabhängig von Rasse, Hautfarbe, Religion, Alter, Geschlecht, nationaler Herkunft, genetischem Merkmal, geschütztem Veteranenstatus, sexueller Orientierung, Geschlechtsidentität oder -ausdruck oder einem anderen Merkmal, das durch Bundes-, Landes- oder lokale Gesetze geschützt ist. Roblox bietet auch angemessene Vorkehrungen für Kandidaten mit qualifizierenden Behinderungen oder religiösen Überzeugungen während des Einstellungsprozesses.
Nur für US-basierte Rollen: Bitte beachten Sie, dass das Unternehmen möglicherweise keine Kandidaten für diese Rolle beschäftigen kann, die eine Arbeitserlaubnis für die Vereinigten Staaten im Zusammenhang mit bestimmten US-Visakategorien haben, oder derzeit zukünftige H-1B-Sponsoring unterstützen kann.
