Roku
NVIDIA
Senior System Software Engineer - GPU Performance
Über die Stelle
NVIDIA ist führend bei bahnbrechenden Entwicklungen in den Bereichen Künstliche Intelligenz, High Performance Computing und Visualisierung. Die GPU, unsere Erfindung, dient als visuelles Zentrum moderner Computer und steht im Mittelpunkt unserer Produkte und Dienstleistungen. Unsere Arbeit eröffnet neue Universen zur Erkundung, ermöglicht erstaunliche Kreativität und Entdeckungen und treibt das voran, was einst Science-Fiction-Erfindungen waren, von künstlicher Intelligenz bis hin zu autonomen Fahrzeugen.
Wir sind das GPU Communications Libraries and Networking Team bei NVIDIA. Wir liefern Bibliotheken wie NCCL, NVSHMEM, UCX für Deep Learning und HPC. Wir suchen einen motivierten Performance-Ingenieur, der die Roadmap unserer Kommunikationsbibliotheken beeinflusst. Die DL- und HPC-Anwendungen von heute haben einen enormen Rechenbedarf und laufen auf Skalen von bis zu Zehntausenden von GPUs. Die GPUs sind über Hochgeschwindigkeitsverbindungen (z. B. NVLink, PCIe) innerhalb eines Knotens und über Hochgeschwindigkeitsnetzwerke (z. B. Infiniband, Ethernet) über die Knoten hinweg verbunden. Die Kommunikationsleistung zwischen den GPUs hat einen direkten Einfluss auf die End-to-End-Anwendungsleistung; und die Einsätze sind bei riesigen Skalen noch höher! Dies ist eine herausragende Gelegenheit für jemanden mit HPC- und Performance-Hintergrund, den Stand der Technik in diesem Bereich voranzutreiben. Sind Sie bereit, zur Entwicklung innovativer Technologien beizutragen und die Vision von NVIDIA zu verwirklichen?
WAS SIE TUN WERDEN
- Durchführung detaillierter Leistungscharakterisierung und -analyse auf großen Multi-GPU- und Multi-Node-Clustern.
- Untersuchung der Interaktion unserer Bibliotheken mit allen HW- (GPU, CPU, Netzwerk) und SW-Komponenten im Stack
- Bewertung von Proof-of-Concepts, Durchführung von Trade-off-Analysen, wenn mehrere Lösungen verfügbar sind
- Triage und Ursachenanalyse von Leistungsproblemen, die von unseren Kunden gemeldet werden
- Sammeln vieler Leistungsdaten; Aufbau von Werkzeugen und Infrastruktur zur Visualisierung und Analyse der Informationen
- Zusammenarbeit mit einem sehr dynamischen Team über mehrere Zeitzonen hinweg
WAS WIR SEHEN MÜSSEN
- M.S. (oder gleichwertige Erfahrung) oder PhD in Informatik oder einem verwandten Fachgebiet mit relevanter Erfahrung in Performance Engineering und HPC
- 3+ Jahre Erfahrung mit paralleler Programmierung und mindestens einer Kommunikationslaufzeit (MPI, NCCL, UCX, NVSHMEM)
- Erfahrung in der Durchführung von Performance-Benchmarking und Triage auf großen HPC-Clustern
- Gutes Verständnis der Computerarchitektur, HW-SW-Interaktionen und Betriebssystemprinzipien (auch bekannt als Systemsoftware-Grundlagen)
- Implementierung von Mikro-Benchmarks in C/C++, Lesen und Modifizieren der Codebasis bei Bedarf
- Fähigkeit zur Fehlersuche bei Leistungsproblemen über den gesamten HW/SW-Stack hinweg. Sicher im Umgang mit einer Skriptsprache, vorzugsweise Python
- Vertrautheit mit Containern, Cloud-Provisioning und Scheduling-Tools (Kubernetes, SLURM, Ansible, Docker)
- Anpassungsfähigkeit und Leidenschaft, neue Bereiche und Werkzeuge zu erlernen. Flexibilität, effektiv mit verschiedenen Teams und Zeitzonen zusammenzuarbeiten und zu kommunizieren
UM AUS DER MASSE HERVORZUSTECHEN
- Praktische Erfahrung mit Infiniband/Ethernet-Netzwerken in Bereichen wie RDMA, Topologien, Congestion Control
- Erfahrung in der Fehlersuche bei Netzwerkproblemen in großen Bereitstellungen
- Vertrautheit mit CUDA-Programmierung und/oder GPUs
- Erfahrung mit Deep Learning-Frameworks wie PyTorch, TensorFlow
Ihr Grundgehalt wird basierend auf Ihrem Standort, Ihrer Erfahrung und der Bezahlung von Mitarbeitern in ähnlichen Positionen ermittelt. Die Gehaltsspanne für das Grundgehalt beträgt 152,000 USD - 241,500 USD für Level 3 und 184,000 USD - 287,500 USD für Level 4.
Sie haben außerdem Anspruch auf Aktienoptionen und Leistungen nvidia.com/en-us/benefits/.
Bewerbungen für diese Stelle werden mindestens bis zum 7. Oktober 2026 angenommen.
Diese Ausschreibung betrifft eine bestehende Stelle.
NVIDIA nutzt KI-Tools in seinen Rekrutierungsprozessen.
NVIDIA setzt sich für die Förderung eines integrativen Arbeitsumfelds ein und ist stolz darauf, ein Arbeitgeber zu sein, der Chancengleichheit bietet. Da wir die Vielfalt unserer aktuellen und zukünftigen Mitarbeiter sehr schätzen, diskriminieren wir nicht (auch nicht in unseren Einstellungs- und Beförderungspraktiken) aufgrund von Rasse, Religion, Hautfarbe, nationaler Herkunft, Geschlecht, Geschlechtsausdruck, sexueller Orientierung, Alter, Familienstand, Veteranenstatus, Behinderungsstatus oder anderen gesetzlich geschützten Merkmalen.
