Roku
Databricks
Staff Software Engineer, AI Runtime
Über die Stelle
P-1930
Bei Databricks sind wir leidenschaftlich daran interessiert, Datenteams zu befähigen, die schwierigsten Probleme der Welt zu lösen – von der Realisierung des nächsten Transportmittels bis zur Beschleunigung der Entwicklung medizinischer Durchbrüche. Wir tun dies, indem wir die weltweit beste Daten- und KI-Infrastrukturplattform aufbauen und betreiben, damit unsere Kunden tiefe Dateneinblicke nutzen können, um ihr Geschäft zu verbessern.
Das Training und die Anpassung modernster KI-Modelle gehören zu den anspruchsvollsten Workloads im Computing und stehen im Mittelpunkt der Mosaic AI-Mission von Databricks. AI Runtime (AIR) ist unsere verwaltete Plattform für groß angelegte GPU-Trainings und Fine-Tuning. Sie bietet Kunden On-Demand-Zugriff auf Flotten der neuesten Beschleuniger und eine serverlose Erfahrung, die die Komplexität der Bereitstellung, Planung und Orchestrierung von Multi-Node-Jobs verbirgt, mit der Ausfallsicherheit, um das Training über Tage oder Wochen auf Tausenden von GPUs am Laufen zu halten. AIR unterstützt das gesamte Spektrum des kundenspezifischen Trainings, vom Fine-Tuning offener Modelle bis zum Pre-Training von Foundation-Modellen im Frontier-Maßstab, für einige der anspruchsvollsten KI-Teams der Welt.
Als Staff Software Engineer für AI Runtime,
spielen Sie eine entscheidende Rolle beim Aufbau und der Skalierung der Systeme, die groß angelegte Trainings schnell, zuverlässig und mühelos machen. Sie treiben die Architektur und Weiterentwicklung des verwalteten GPU-Trainings-Stacks voran, der Planung und Kapazität, verteilte Trainingsleistung, Fehlertoleranz und die Entwicklererfahrung beim Starten und Betreiben von Jobs in großem Maßstab umfasst. Über praktische Beiträge zu Kernsystemen hinaus helfen Sie bei der Definition der langfristigen technischen Vision für AIR, betreuen leitende Ingenieure, arbeiten mit Produkt-, Forschungs- und Plattformteams zusammen und leiten Initiativen, die die technische und geschäftliche Wirkung des kundenspezifischen Trainings bei Databricks erweitern.
Ihr Einfluss
- Treiben Sie die Architektur und Weiterentwicklung der verwalteten GPU-Trainingsplattform von AIR voran und liefern Sie skalierbare, hochdurchsatzfähige und ausfallsichere Trainings über Flotten, die Tausende von Beschleunigern umfassen.
- Lösen Sie die schwierigsten Probleme im groß angelegten Training, einschließlich Multi-Node-Orchestrierung, verteilten Parallelitätsstrategien, GPU-Planung und dynamischem Routing, datenintensiven Ladevorgängen und Checkpointing und Wiederherstellung für sehr lang laufende Jobs.
- Steigern Sie die GPU-Effizienz und Trainingsleistung, erhöhen Sie die Auslastung (wie Modell-FLOPs-Auslastung und End-to-End-Durchsatz) und senken Sie die Kosten pro Trainingslauf über verschiedene Modellarchitekturen und Hardwaregenerationen hinweg.
- Bauen Sie die Ausfallsicherheits- und Beobachtbarkeitsgrundlagen auf, die Multi-Node-Jobs gesund halten, und erkennen und beheben Sie Hardware- und Softwarefehler mit minimalen Unterbrechungen für Kunden.
- Arbeiten Sie mit Produkt-, Forschungs- und Plattformteams zusammen, um die APIs, CLI und die Entwicklererfahrung zu gestalten, die das Starten, Überwachen und Debuggen von Produktions-Trainingsjobs erleichtern.
- Leiten Sie End-to-End-Engineering-Aufgaben, vom Design bis zur Produktionsfreigabe, und setzen Sie einen hohen Standard für Leistung, Korrektheit und Zuverlässigkeit.
- Leisten Sie direkte, wirkungsvolle Beiträge zu den Kernsystemen hinter AIR und helfen Sie bei der Einführung von Unterstützung für die neuesten Beschleuniger und neuen Regionen, während die Flotte wächst.
- Vertreten Sie technische Exzellenz, betreuen Sie andere Ingenieure durch Design-Reviews und technische Diskussionen und helfen Sie bei der Gestaltung der langfristigen technischen Ausrichtung von Databricks im Bereich KI-Trainingsinfrastruktur.
Mindestanforderungen
Was wir suchen
- 10+ Jahre Erfahrung im Aufbau und Betrieb von groß angelegten verteilten Systemen, mit erheblicher Tiefe in der GPU-Trainingsinfrastruktur, High-Performance Computing oder ML-Systemen.
- Praktische Erfahrung mit verteilten Trainingsframeworks (wie PyTorch, FSDP, DeepSpeed oder Megatron) und den Parallelitätsstrategien (Daten-, Tensor-, Pipeline- und Sequenzparallelität), die zum Trainieren großer Modelle verwendet werden.
- Starkes Verständnis von Mustern zur Trainingsresilienz, einschließlich Checkpointing, Fehlererkennung und automatischer Wiederherstellung für lang laufende Multi-Node-Jobs.
- Solides Verständnis der Grundlagen der GPU-Leistung, einschließlich Beschleunigerarchitektur, Hochgeschwindigkeits-Interconnects (wie NVLink und InfiniBand oder RoCE), kollektiver Kommunikation und der Engpässe, die den Trainingsdurchsatz und die Auslastung bestimmen.
- Erfahrung im Aufbau und Betrieb von verwalteten, Multi-Tenant-Plattformprodukten in der Cloud mit klaren SLAs und SLOs für Verfügbarkeit, Leistung und Zuverlässigkeit.
- Starke Grundlage in Algorithmen, Datenstrukturen und Systemdesign, angewendet auf leistungssensitive, groß angelegte verteilte Systeme.
- Nachgewiesene Fähigkeit, technisch komplexe, wirkungsvolle Initiativen zu liefern, die einen klaren Kunden- oder Geschäftswert schaffen.
- Starke Kommunikationsfähigkeiten und die Fähigkeit zur Zusammenarbeit mit Produkt-, Forschungs- und Infrastrukturteams in einem sich schnell entwickelnden Umfeld.
- Strategisches, produktorientiertes Denken mit der Fähigkeit, technische Ausführung an einer langfristigen Vision auszurichten, und eine Leidenschaft für die Betreuung von Ingenieuren und die Förderung technischer Exzellenz.
- BS in Informatik oder einem verwandten Fachgebiet (MS oder PhD bevorzugt).
Transparenz der Gehaltsspanne
Databricks verpflichtet sich zu fairen und gerechten Vergütungspraktiken. Die unten aufgeführten Gehaltsspannen für diese Rolle stellen die erwartete Gehaltsspanne für nicht-provisionspflichtige Rollen oder die Zielverdienste für provisionspflichtige Rollen dar. Die tatsächlichen Vergütungspakete basieren auf mehreren Faktoren, die für jeden Kandidaten einzigartig sind, einschließlich, aber nicht beschränkt auf berufsbezogene Fähigkeiten, Erfahrungstiefe, relevante Zertifizierungen und Schulungen sowie den spezifischen Arbeitsort. Basierend auf den oben genannten Faktoren geht Databricks davon aus, die volle Breite der Spanne zu nutzen. Das Gesamtvergütungspaket für diese Position kann auch die Berechtigung für einen jährlichen Leistungsbonus, Aktienoptionen und die oben aufgeführten Leistungen umfassen. Weitere Informationen darüber, in welcher Spanne sich Ihr Standort befindet, finden Sie hier auf unserer Seite databricks.com/sites/default/files/2024-08/us-pay-zone-mapping.pdf.
Lokale Gehaltsspanne $190,000—$265,000 USD
Unser Engagement für Vielfalt und Inklusion
Bei Databricks setzen wir uns für die Förderung einer vielfältigen und integrativen Kultur ein, in der jeder erfolgreich sein kann. Wir legen großen Wert darauf, dass unsere Einstellungspraktiken integrativ sind und die Standards der Chancengleichheit erfüllen. Personen, die eine Anstellung bei Databricks suchen, werden unabhängig von Alter, Hautfarbe, Behinderung, ethnischer Zugehörigkeit, Familien- oder Familienstand, Geschlechtsidentität oder -ausdruck, Sprache, Herkunft, physischer und geistiger Fähigkeit, politischer Zugehörigkeit, Rasse, Religion, sexueller Orientierung, sozioökonomischem Status, Veteranenstatus und anderen geschützten Merkmalen berücksichtigt.
Compliance
Wenn der Zugang zu exportkontrollierter Technologie oder Quellcode für die Erfüllung der Arbeitsaufgaben erforderlich ist, liegt es im Ermessen des Arbeitgebers, eine US-Regierungslizenz für solche Positionen zu beantragen, und der Arbeitgeber kann allein aus diesem Grund davon absehen, mit einem Bewerber fortzufahren.
Über Databricks
Databricks ist das Data and AI Unternehmen. Mehr als 20,000 Organisationen weltweit – darunter adidas, AT&T, Bayer, Block, Mastercard, Rivian, Unilever und 70% der Fortune 500 – verlassen sich auf die Databricks Data + AI Platform, um Daten- und KI-Anwendungen, Analysen und Agenten zu erstellen und zu skalieren. Mit Hauptsitz in San Francisco und über 30 Niederlassungen weltweit bietet Databricks eine einheitliche Plattform, die Genie, Lakebase, Agent Bricks, Lakeflow, Lakehouse und Unity Catalog umfasst. Um mehr zu erfahren, folgen Sie Databricks auf LinkedIn linkedin.com/company/databricks, X x.com/databricks, YouTube youtube.com/@Databricks und Instagram instagram.com/databricksinc/?hl=en.
Leistungen
Bei Databricks bemühen wir uns, umfassende Leistungen und Vergünstigungen anzubieten, die den Bedürfnissen aller unserer Mitarbeiter entsprechen. Spezifische Details zu den in Ihrer Region angebotenen Leistungen finden Sie hier docs.google.com/document/d/154un3e8Xav4BceOSlcYFZRGEuQI54xMxVydRwQn54eQ/edit?usp=sharing.
