Roku
Databricks
Staff Software Engineer - GenAI Performance und Kernel
ÜBER DIESE ROLLE
P-1285
Als Staff Software Engineer für GenAI Performance und Kernel sind Sie für das Design, die Implementierung, die Optimierung und die Korrektheit der Hochleistungs-GPU-Kernel verantwortlich, die unseren GenAI-Inferenz-Stack antreiben. Sie leiten die Entwicklung hochoptimierter, Low-Level-Compute-Pfade, verwalten Kompromisse zwischen Hardware-Effizienz und Allgemeingültigkeit und betreuen andere in der Kernel-Level-Performance-Entwicklung. Sie arbeiten eng mit ML-Forschern, Systemingenieuren und Produktteams zusammen, um den Stand der Technik in der Inferenzleistung im großen Maßstab voranzutreiben.
WAS SIE TUN WERDEN
- Leitung des Designs, der Implementierung, des Benchmarking und der Wartung von Kern-Compute-Kerneln (z. B. Attention, MLP, Softmax, Layernorm, Speicherverwaltung), optimiert für verschiedene Hardware-Backends (GPU, Beschleuniger)
- Vorantreiben der Performance-Roadmap für Kernel-Level-Verbesserungen: Vektorisierung, Tensorisierung, Tiling, Fusion, Mixed Precision, Sparsity, Quantisierung, Speicherwiederverwendung, Scheduling, Auto-Tuning usw.
- Integration von Kernel-Optimierungen in ML-Systeme auf höherer Ebene
- Erstellung und Wartung von Profiling-, Instrumentierungs- und Verifizierungstools zur Erkennung von Korrektheits-, Performance-Regressionen, numerischen Problemen und Lücken bei der Hardware-Auslastung
- Leitung von Performance-Untersuchungen und Ursachenanalysen bei Inferenz-Engpässen, z. B. Speicherbandbreite, Cache-Konflikte, Kernel-Launch-Overhead, Tensor-Fragmentierung
- Etablierung von Codierungsmustern, Abstraktionen und Frameworks zur Modularisierung von Kerneln für Wiederverwendung, Cross-backend-Portabilität und Wartbarkeit
- Beeinflussung von Systemarchitekturentscheidungen, um Kernel-Verbesserungen effektiver zu gestalten (z. B. Speicherlayout, Dataflow-Scheduling, Kernel-Fusionsgrenzen)
- Mentoring und Anleitung anderer Ingenieure, die an Low-Level-Performance arbeiten, Code-Reviews durchführen, bei der Festlegung von Best Practices helfen
- Zusammenarbeit mit Infrastruktur-, Tooling- und ML-Teams, um Kernel-Level-Optimierungen in die Produktion zu überführen und deren Auswirkungen zu überwachen
WAS WIR SUCHEN
- BS/MS/PhD in Informatik oder einem verwandten Fachgebiet
- Tiefgreifende praktische Erfahrung im Schreiben und Optimieren von Compute-Kerneln (CUDA, Triton, OpenCL, LLVM IR, Assembly oder ähnliches) für ML-Workloads
- Starke Kenntnisse der GPU/Beschleuniger-Architektur: Warp-Struktur, Speicherhierarchie (global, shared, register, L1/L2-Caches), Tensor-Kerne, Scheduling, SM-Auslastung usw.
- Erfahrung mit fortgeschrittenen Optimierungstechniken: Tiling, Blocking, Software Pipelining, Vektorisierung, Fusion, Loop-Transformationen, Auto-Tuning
- Vertrautheit mit ML-spezifischen Kernel-Bibliotheken (cuBLAS, cuDNN, CUTLASS, oneDNN usw.) oder Open-Source-Kerneln
- Starke Debugging- und Profiling-Fähigkeiten (Nsight, NVProf, perf, vtune, benutzerdefinierte Instrumentierung)
- Erfahrung im Umgang mit numerischer Stabilität, Mixed Precision, Quantisierung und Fehlerfortpflanzung
- Erfahrung in der Integration optimierter Kernel in reale ML-Inferenzsysteme; Erfahrung mit verteilten Inferenz-Pipelines, Speicherverwaltung und Laufzeitsystemen
- Erfahrung in der Entwicklung von Hochleistungsprodukten, die GPU-Beschleunigung nutzen
- Ausgezeichnete Kommunikations- und Führungsqualitäten – Fähigkeit, Design-Diskussionen voranzutreiben, Kollegen zu betreuen und Kompromisse sichtbar zu machen
- Eine Erfolgsbilanz bei der Auslieferung von performance-kritischer, qualitativ hochwertiger Produktionssoftware
- Bonus: Veröffentlichungen in System-/ML-Performance-Veranstaltungen (z. B. MLSys, ASPLOS, ISCA, PPoPP), Erfahrung mit benutzerdefinierten Beschleunigern oder FPGAs, Erfahrung mit Sparsity- oder Modellkompressionstechniken
Transparenz der Gehaltsspanne
Databricks verpflichtet sich zu fairen und gerechten Vergütungspraktiken. Die unten aufgeführten Gehaltsspannen für diese Rolle stellen die erwartete Gehaltsspanne für nicht-provisionspflichtige Rollen oder die Zielverdienste für provisionspflichtige Rollen dar. Die tatsächlichen Vergütungspakete basieren auf mehreren Faktoren, die für jeden Kandidaten einzigartig sind, einschließlich, aber nicht beschränkt auf berufsbezogene Fähigkeiten, Tiefe der Erfahrung, relevante Zertifizierungen und Schulungen sowie den spezifischen Arbeitsort. Basierend auf den oben genannten Faktoren geht Databricks davon aus, die volle Breite der Spanne zu nutzen. Das Gesamtvergütungspaket für diese Position kann auch die Berechtigung für eine jährliche Leistungsprämie, Aktienoptionen und die oben aufgeführten Leistungen umfassen. Weitere Informationen darüber, in welcher Spanne Ihr Standort liegt, finden Sie hier: databricks.com/sites/default/files/2024-08/us-pay-zone-mapping.pdf.
Lokale Gehaltsspanne
$190,900—$232,800 USD
Unser Engagement für Vielfalt und Inklusion
Bei Databricks setzen wir uns für die Förderung einer vielfältigen und integrativen Kultur ein, in der jeder erfolgreich sein kann. Wir legen großen Wert darauf, dass unsere Einstellungspraktiken integrativ sind und die Standards der Chancengleichheit erfüllen. Personen, die eine Anstellung bei Databricks suchen, werden unabhängig von Alter, Hautfarbe, Behinderung, ethnischer Zugehörigkeit, Familien- oder Familienstand, Geschlechtsidentität oder -ausdruck, Sprache, Herkunft, physischer und geistiger Fähigkeit, politischer Zugehörigkeit, Rasse, Religion, sexueller Orientierung, sozioökonomischem Status, Veteranenstatus und anderen geschützten Merkmalen berücksichtigt.
Compliance
Wenn für die Erfüllung der Arbeitsaufgaben der Zugriff auf exportkontrollierte Technologie oder Quellcode erforderlich ist, liegt es im Ermessen des Arbeitgebers, eine US-Regierungslizenz für solche Positionen zu beantragen, und der Arbeitgeber kann allein aus diesem Grund davon absehen, mit einem Bewerber fortzufahren.
Über Databricks
Databricks ist das Data and AI Unternehmen. Mehr als 20,000 Organisationen weltweit – darunter adidas, AT&T, Bayer, Block, Mastercard, Rivian, Unilever und 70% der Fortune 500 – verlassen sich auf die Databricks Data + AI Platform, um Daten- und KI-Anwendungen, Analysen sowie Agenten zu entwickeln und zu skalieren. Mit Hauptsitz in San Francisco und über 30+ Standorten weltweit bietet Databricks eine einheitliche Plattform, die Genie, Lakebase, Agent Bricks, Lakeflow, Lakehouse und Unity Catalog umfasst. Um mehr zu erfahren, folgen Sie Databricks auf LinkedIn linkedin.com/company/databricks, X x.com/databricks, YouTube youtube.com/@Databricks und Instagram instagram.com/databricksinc/?hl=en.
Leistungen
Bei Databricks bemühen wir uns, umfassende Leistungen und Vergünstigungen anzubieten, die den Bedürfnissen aller unserer Mitarbeiter entsprechen. Spezifische Details zu den in Ihrer Region angebotenen Leistungen finden Sie hier: docs.google.com/document/d/154un3e8Xav4BceOSlcYFZRGEuQI54xMxVydRwQn54eQ/edit?usp=sharing.
