Roku
Databricks
Senior Software Engineer, AI Runtime
Über die Stelle
P-1428 Bei Databricks setzen wir uns leidenschaftlich dafür ein, Datenteams bei der Lösung der weltweit schwierigsten Probleme zu unterstützen – von der Realisierung neuer Mobilitätskonzepte bis hin zur Beschleunigung medizinischer Durchbrüche. Dies erreichen wir durch die Entwicklung und den Betrieb der weltweit besten Daten- und KI-Infrastrukturplattform, damit unsere Kunden fundierte Dateneinblicke zur Optimierung ihres Geschäfts nutzen können.
Das Training und die Anpassung modernster KI-Modelle gehören zu den anspruchsvollsten Workloads im Computing und stehen im Mittelpunkt der Mosaic AI-Mission von Databricks. AI Runtime (AIR) ist unsere verwaltete Plattform für groß angelegtes GPU-Training und Fine-Tuning. Sie bietet Kunden On-Demand-Zugriff auf Flotten der neuesten Beschleuniger und eine serverlose Erfahrung, die die Komplexität der Bereitstellung, Planung und Orchestrierung von Multi-Node-Jobs verbirgt, mit der Ausfallsicherheit, um das Training über Tage oder Wochen auf Tausenden von GPUs am Laufen zu halten. AIR unterstützt das gesamte Spektrum des kundenspezifischen Trainings, vom Fine-Tuning offener Modelle bis zum Pre-Training von Foundation-Modellen im Frontier-Maßstab, für einige der anspruchsvollsten KI-Teams der Welt.
Als Senior Software Engineer für AI Runtime
spielen Sie eine entscheidende Rolle beim Aufbau und der Skalierung der Systeme, die groß angelegtes Training schnell, zuverlässig und mühelos machen. Sie treiben die Architektur und Weiterentwicklung des verwalteten GPU-Trainings-Stacks voran, der Planung und Kapazität, verteilte Trainingsleistung, Fehlertoleranz und die Entwicklererfahrung beim Starten und Betreiben von Jobs in großem Maßstab umfasst. Über praktische Beiträge zu Kernsystemen hinaus helfen Sie bei der Gestaltung der technischen Ausrichtung für AIR, betreuen andere Ingenieure, arbeiten mit Produkt-, Forschungs- und Plattformteams zusammen und tragen zu Initiativen bei, die die technische und geschäftliche Wirkung des kundenspezifischen Trainings bei Databricks erweitern.
Ihr Einfluss
- Treiben Sie die Architektur und Weiterentwicklung der verwalteten GPU-Trainingsplattform von AIR voran und liefern Sie skalierbares, hochdurchsatzfähiges und ausfallsicheres Training über Flotten, die Tausende von Beschleunigern umfassen.
- Lösen Sie die schwierigsten Probleme im groß angelegten Training, einschließlich Multi-Node-Orchestrierung, verteilten Parallelitätsstrategien, GPU-Planung und dynamischem Routing, hochdurchsatzfähiger Datenladung sowie Checkpointing und Wiederherstellung für sehr lang laufende Jobs.
- Steigern Sie die GPU-Effizienz und Trainingsleistung, erhöhen Sie die Auslastung (wie Modell-FLOPs-Auslastung und End-to-End-Durchsatz) und senken Sie die Kosten pro Trainingslauf über verschiedene Modellarchitekturen und Hardwaregenerationen hinweg.
- Bauen Sie die Grundlagen für Ausfallsicherheit und Beobachtbarkeit, die Multi-Node-Jobs gesund halten, und erkennen und beheben Sie Hardware- und Softwarefehler mit minimalen Unterbrechungen für Kunden.
- Arbeiten Sie mit Produkt-, Forschungs- und Plattformteams zusammen, um die APIs, CLI und die Entwicklererfahrung zu gestalten, die das Starten, Überwachen und Debuggen von Produktions-Trainingsjobs erleichtern.
- Leiten Sie End-to-End-Engineering-Aufgaben, vom Design bis zur Produktionsfreigabe, und setzen Sie einen hohen Standard für Leistung, Korrektheit und Zuverlässigkeit.
- Leisten Sie direkte, wirkungsvolle Beiträge zu den Kernsystemen hinter AIR und helfen Sie bei der Einführung von Unterstützung für die neuesten Beschleuniger und neuen Regionen, während die Flotte wächst.
- Vertreten Sie technische Exzellenz, betreuen Sie andere Ingenieure durch Design-Reviews und technische Diskussionen und tragen Sie zur technischen Ausrichtung von Databricks im Bereich KI-Trainingsinfrastruktur bei.
Was wir suchen
- 5+ Jahre Erfahrung im Aufbau und Betrieb von verteilten Systemen im großen Maßstab, mit Erfahrung in GPU-Trainingsinfrastruktur, High-Performance Computing oder ML-Systemen.
- Erfahrung mit verteilten Trainingsframeworks (wie PyTorch, FSDP, DeepSpeed oder Megatron) und den Parallelitätsstrategien (Daten-, Tensor-, Pipeline- und Sequenzparallelität), die zum Trainieren großer Modelle verwendet werden.
- Starkes Verständnis von Mustern zur Trainingsausfallsicherheit, einschließlich Checkpointing, Fehlererkennung und automatischer Wiederherstellung für lang laufende Multi-Node-Jobs.
- Solides Verständnis der Grundlagen der GPU-Leistung, einschließlich Beschleunigerarchitektur, Hochgeschwindigkeitsverbindungen (wie NVLink und InfiniBand oder RoCE), kollektiver Kommunikation und der Engpässe, die den Trainingsdurchsatz und die Auslastung bestimmen.
- Erfahrung im Aufbau und Betrieb von verwalteten, mandantenfähigen Plattformprodukten in der Cloud mit klaren SLAs und SLOs für Verfügbarkeit, Leistung und Zuverlässigkeit.
- Starke Grundlage in Algorithmen, Datenstrukturen und Systemdesign, angewendet auf leistungssensible, verteilte Systeme im großen Maßstab.
- Nachgewiesene Fähigkeit, technisch komplexe, wirkungsvolle Initiativen zu liefern, die einen klaren Kunden- oder Geschäftswert schaffen.
- Starke Kommunikationsfähigkeiten und die Fähigkeit, in einem schnelllebigen Umfeld mit Produkt-, Forschungs- und Infrastrukturteams zusammenzuarbeiten.
- Kundenorientierte Denkweise mit der Fähigkeit, Implementierungsdetails mit Produktzielen abzustimmen, und eine Leidenschaft für die Betreuung von Ingenieuren und die Förderung technischer Exzellenz.
- BS in Informatik oder einem verwandten Fachgebiet (MS oder PhD bevorzugt).
Transparenz der Gehaltsspanne
Databricks verpflichtet sich zu fairen und gerechten Vergütungspraktiken. Die unten aufgeführten Gehaltsspanne(n) für diese Rolle stellen die erwartete Gehaltsspanne für nicht provisionspflichtige Rollen oder die Zielverdienste für provisionspflichtige Rollen dar. Die tatsächlichen Vergütungspakete basieren auf mehreren Faktoren, die für jeden Kandidaten einzigartig sind, einschließlich, aber nicht beschränkt auf berufsbezogene Fähigkeiten, Erfahrungstiefe, relevante Zertifizierungen und Schulungen sowie den spezifischen Arbeitsort. Basierend auf den oben genannten Faktoren geht Databricks davon aus, die volle Breite der Spanne zu nutzen. Das Gesamtvergütungspaket für diese Position kann auch die Berechtigung für einen jährlichen Leistungsbonus, Aktienoptionen und die oben aufgeführten Leistungen umfassen. Weitere Informationen darüber, in welcher Spanne Ihr Standort liegt, finden Sie hier auf unserer Seite databricks.com/sites/default/files/2024-08/us-pay-zone-mapping.pdf.
Lokale Gehaltsspanne
$160,000—$225,000 USD
Unser Engagement für Vielfalt und Inklusion
Bei Databricks setzen wir uns für die Förderung einer vielfältigen und integrativen Kultur ein, in der jeder erfolgreich sein kann. Wir legen großen Wert darauf, dass unsere Einstellungspraktiken integrativ sind und die Standards der Chancengleichheit erfüllen. Personen, die eine Anstellung bei Databricks suchen, werden unabhängig von Alter, Hautfarbe, Behinderung, ethnischer Zugehörigkeit, Familien- oder Familienstand, Geschlechtsidentität oder -ausdruck, Sprache, Herkunft, physischer und geistiger Fähigkeit, politischer Zugehörigkeit, Rasse, Religion, sexueller Orientierung, sozioökonomischem Status, Veteranenstatus und anderen geschützten Merkmalen berücksichtigt.
Compliance
Wenn der Zugang zu exportkontrollierter Technologie oder Quellcode für die Erfüllung der Arbeitsaufgaben erforderlich ist, liegt es im Ermessen des Arbeitgebers, ob er eine US-Regierungslizenz für solche Positionen beantragt, und der Arbeitgeber kann sich allein aus diesem Grund weigern, mit einem Bewerber fortzufahren.
Über Databricks
Databricks ist das Data and AI Unternehmen. Mehr als 20,000 Organisationen weltweit – darunter adidas, AT&T, Bayer, Block, Mastercard, Rivian, Unilever und 70% der Fortune 500 – verlassen sich auf die Databricks Data + AI Platform, um Daten- und KI-Apps, Analysen und Agenten zu erstellen und zu skalieren. Mit Hauptsitz in San Francisco und über 30 Büros weltweit bietet Databricks eine einheitliche Plattform, die Genie, Lakebase, Agent Bricks, Lakeflow, Lakehouse und Unity Catalog umfasst. Um mehr zu erfahren, folgen Sie Databricks auf LinkedIn linkedin.com/company/databricks, X x.com/databricks, YouTube youtube.com/@Databricks und Instagram instagram.com/databricksinc/?hl=en.
Leistungen
Bei Databricks bemühen wir uns, umfassende Leistungen und Vergünstigungen anzubieten, die den Bedürfnissen aller unserer Mitarbeiter entsprechen. Spezifische Details zu den in Ihrer Region angebotenen Leistungen finden Sie hier docs.google.com/document/d/154un3e8Xav4BceOSlcYFZRGEuQI54xMxVydRwQn54eQ/edit?usp=sharing.
