NVIDIA

Senior Deep Learning Framework Communications Engineer

PythonC++
Automatische Übersetzung. Prüfe das Original.

Über die Stelle

NVIDIA leistet Pionierarbeit bei bahnbrechenden Entwicklungen in den Bereichen Künstliche Intelligenz, High Performance Computing und Visualisierung. Die GPU, unsere Erfindung, dient als visuelles Zentrum moderner Computer und ist das Herzstück unserer Produkte und Dienstleistungen. Unsere Arbeit eröffnet neue Universen zur Erkundung, ermöglicht erstaunliche Kreativität und Entdeckungen und treibt das voran, was einst Science-Fiction-Erfindungen von künstlicher Intelligenz bis hin zu autonomen Fahrzeugen waren.

Wir suchen einen motivierten Deep Learning-Ingenieur, der fortschrittliche Kommunikationstechnologien in KI-Stacks integriert, darunter PyTorch, TRT-LLM, vLLM, SGLang, JAX usw. Sie werden mit dem Team zusammenarbeiten, das Kommunikationsbibliotheken wie NCCL, NVSHMEM und Technologien wie GPUDirect entwickelt hat – für die Skalierung von Deep Learning- und HPC-Anwendungen. Ihre Kunden werden vielfältige Multi-GPU-Anforderungen haben, die von Training auf Skalen bis zu 100K GPUs bis hin zu Inferenz mit Latenzen im Mikrosekundenbereich reichen. Die Kommunikationsleistung zwischen den GPUs hat direkte Auswirkungen auf KI-Anwendungen. Ihre Arbeit an KI-Toolkits wird all diese für die Community einfacher machen. Dies ist eine herausragende Gelegenheit für jemanden mit einem KI-Hintergrund, den Stand der Technik in diesem Bereich voranzutreiben. Sind Sie bereit, zur Entwicklung innovativer Technologien beizutragen und die Vision von NVIDIA zu verwirklichen?

Was Sie tun werden

  1. Integration neuer Kommunikationsbibliotheksfunktionen in KI-Frameworks: von PoC über Leistungsanalyse bis zur Produktion
  1. Durchführung tiefgreifender Analysen von KI-Workloads und Frameworks zur Identifizierung von Multi-GPU-Kommunikationsanforderungen und -möglichkeiten. Enge Zusammenarbeit mit Teams, die an den neuesten KI-Modellen arbeiten.
  1. Verbesserung von KI-Compilern, um die Kommunikation zu verbergen oder automatische Fusionen durchzuführen.
  1. Durchführung detaillierter Leistungscharakterisierung von KI-Workloads auf Multi-GPU-Clustern.
  1. Entwurf fehlertoleranter und elastischer Lösungen für große oder dynamische KI-Workloads.
  1. Erstellung benutzerdefinierter Kommunikations- oder fusionierter Rechen-Kommunikations-Kernels, um die ultimative Leistung auf NV-Plattformen zu demonstrieren.
  1. Beeinflussung der Roadmap von Kommunikationsbibliotheken – NCCL & NVSHMEM.
  1. Zusammenarbeit mit einem sehr dynamischen Team über mehrere Zeitzonen hinweg.

Was wir sehen müssen

  1. B.S., M.S. oder Ph.D. in Informatik oder einem verwandten Fachgebiet (oder gleichwertige Erfahrung) mit 8+ Jahren Erfahrung in Software-Engineering und HPC/KI
  1. Entwicklungs- oder Integrationserfahrung mit Deep Learning-Frameworks wie PyTorch, JAX und Inferenz-Engines wie TRT-LLM, vLLM, SGLang
  1. Schnelles Prototyping und Entwicklung mit Python, C++, CUDA oder verwandten DSLs (Triton, cuTe)
  1. Solides Verständnis von KI-Modellen, Parallelismen und/oder Compiler-Technologien (z. B. torch.compile)
  1. Erfahrung mit Performance-Benchmarking auf KI-Clustern. Vertrautheit mit mindestens einem Performance-Profiler-Toolchain (PyTorch-Profiler, NVIDIA Nsight Systems)
  1. Verständnis von HPC/KI-Kommunikationskonzepten (1-seitige vs. 2-seitige Kommunikation, Elastizität, Ausfallsicherheit, Topologieerkennung usw.)
  1. Anpassungsfähigkeit und Leidenschaft, neue Bereiche und Werkzeuge zu erlernen
  1. Flexibilität, um effektiv mit verschiedenen Teams und Zeitzonen zu arbeiten und zu kommunizieren

Wege, sich von der Masse abzuheben

  1. Erfahrung mit paralleler Programmierung auf mindestens einer Kommunikationslaufzeit (NCCL, NVSHMEM, MPI). Gutes Verständnis der Computerarchitektur, HW-SW-Interaktionen und Betriebssystemprinzipien (auch bekannt als Systemsoftware-Grundlagen)
  1. Expertise in einem oder mehreren der folgenden Bereiche: Training, verteilte Inferenz, MoE, Reinforcement Learning, Kernel-Erstellung (auf CUDA, Triton, cuTe usw.). Erfahrung mit Programmierung für Rechen- und Kommunikationsüberlappung in verteilten Laufzeiten
  1. Erfahrung mit KI-Compiler-Pattern-Matching und Lowering. Solides Verständnis der Speicherhierarchie, des Konsistenzmodells und des Tensor-Layouts

Ihr Grundgehalt wird basierend auf Ihrem Standort, Ihrer Erfahrung und dem Gehalt von Mitarbeitern in ähnlichen Positionen ermittelt. Die Grundgehaltsspanne beträgt 184.000 USD - 287.500 USD für Level 4 und 224.000 USD - 356.500 USD für Level 5.

Bewerbungen für diese Stelle werden mindestens bis zum Oktober 2, 2026 entgegengenommen.

Diese Ausschreibung gilt für eine bestehende Stelle.

NVIDIA nutzt KI-Tools in seinen Rekrutierungsprozessen.

NVIDIA setzt sich für die Förderung eines integrativen Arbeitsumfelds ein und ist stolz darauf, ein Arbeitgeber der Chancengleichheit zu sein. Da wir Vielfalt bei unseren aktuellen und zukünftigen Mitarbeitern sehr schätzen, diskriminieren wir nicht (einschließlich unserer Einstellungs- und Beförderungspraktiken) aufgrund von Rasse, Religion, Hautfarbe, nationaler Herkunft, Geschlecht, Geschlechtsausdruck, sexueller Orientierung, Alter, Familienstand, Veteranenstatus, Behinderungsstatus oder anderen gesetzlich geschützten Merkmalen.

Sie haben außerdem Anspruch auf Aktienoptionen und Leistungen nvidia.com/en-us/benefits/.

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026