Roku
NVIDIA
Distinguished Engineer, Storage – AI Cloud
AI Cloud Data Storage
NVIDIA prägt seit mehr als 25 Jahren die Computergrafik, das PC-Gaming und das beschleunigte Computing. Es ist ein einzigartiges Innovationserbe, das von großartiger Technologie – und erstaunlichen Menschen – angetrieben wird. Heute nutzen wir das unbegrenzte Potenzial von KI, um die nächste Ära des Computings zu definieren. Eine Ära, in der unsere GPU als Gehirn von Computern, Robotern und selbstfahrenden Autos fungiert, die die Welt verstehen können. Etwas zu tun, das noch nie zuvor getan wurde, erfordert Vision, Innovation und die besten Talente der Welt. Als NVIDIAN tauchen Sie in eine vielfältige, unterstützende Umgebung ein, in der jeder inspiriert ist, seine beste Arbeit zu leisten. Kommen Sie ins Team und sehen Sie, wie Sie einen bleibenden Einfluss auf die Welt haben können.
NVIDIA DGXC Storage Org wickelt einige der schnellsten Trainings- und Inferenzaufgaben ab. Jeder GPU-Zyklus hängt von einer Speicherplattform ab, die darauf ausgelegt ist, Zehntausende von Beschleunigern kontinuierlich zu beschäftigen. Sie verwaltet Exabytes an Daten sicher und treibt die größten KI-Workloads weltweit in Cloud-, Neocloud- und On-Prem-Setups an. Mit dem Wachstum des beschleunigten Computings ist Speicher unerlässlich. Er kann den Unterschied zwischen effektiver GPU-Nutzung und verschwendetem Potenzial ausmachen und zwischen der rechtzeitigen Einführung eines Frontier-Modells oder dem Verpassen der Frist um Monate.
Wir suchen einen Distinguished Engineer, der die Speicherstrategie von NVIDIA für AI Cloud im gesamten Ökosystem von Neocloud Provider (NCP) und Cloud Service Provider (CSP) leitet. Sie werden die Architektur von Hochleistungs-Parallel-Dateisystemen, Objektspeichern und Block-Speichern im Exabyte-Maßstab steuern. Sie werden hands-on bleiben und mit Ingenieuren, SREs, Partnern und Speicheranbietern zusammenarbeiten. Sie werden die KI-Tools von NVIDIA anwenden, um Ihre Produktivität und die derjenigen, die Sie beeinflussen, zu steigern. Dies ist eine einzigartige Gelegenheit, das Speicher-Framework der KI-Ära in dem Unternehmen zu etablieren, das das beschleunigte Computing eingeführt hat.
Was Sie tun werden
- Leiten Sie den mehrjährigen technischen Plan für die Erweiterung des AI Cloud Storage über NCPs hinweg – bestimmen Sie die Referenzarchitektur, die Fähigkeiten, die Leistungs- und Haltbarkeits-SLOs, die Qualifizierungsmethodik und die Roadmap für den Hochleistungs-Datei-, Objekt- und Block-Speicher, den jeder NCP anbieten muss, um für die GPU-Zuteilung von NVIDIA qualifiziert zu werden.
- Fungieren Sie als leitender Speicherarchitekt mit tiefgreifender praktischer Beteiligung. Leiten Sie wichtige Überprüfungen von Speicher-Builds und untersuchen Sie die Grundursachen komplexer Produktionsprobleme. Entwickeln Sie Prototypen von Referenzimplementierungen, um Risiken bei neuen Initiativen zu minimieren. Treffen Sie endgültige technische Entscheidungen über NCP-Speicherlieferungen anhand messbarer SLOs. Wenden Sie KI-Tools intensiv an, um Ihren technischen Einfluss im gesamten Programm zu verstärken.
- Definieren Sie den Standard für „produktionsreif“ im NCP-Speicher, einschließlich Haltbarkeits- und Verfügbarkeits-SLOs, gemessen in 9s. Stellen Sie nachhaltige Effizienz pro TiB, Beobachtbarkeit, Ausbreitungsradius-Eindämmung und reduzierte operative Mühsal sicher. Beeinflussen Sie die GPU-Lieferungssteuerung, indem Sie verlangen, dass AI Cloud nur dann GPU-Kapazität akzeptiert, nachdem speicherbezogene Hilfsdienste verifiziert wurden.
- Entwickeln und leiten Sie die architektonische Ausrichtung, indem Sie eng mit Mitarbeitern aus den Produktlinien Training, Inferenz und beschleunigtes Computing zusammenarbeiten. Koordinieren Sie sich mit Kollegen aus den Bereichen Site Reliability, Betrieb, Netzwerk und Sicherheit. Arbeiten Sie mit externen Cloud-Anbietern, Neocloud-Betreibern und Speicheranbietern zusammen, um eine gemeinsame Architektur abzustimmen.
- Entwickeln Sie den Open-Source-Weg für KI-Speicher. Etablieren und leiten Sie eine Open-Source-Strategie, die das KI-Speicher-Ökosystem erweitert. Setzen Sie sich für eine GitHub-first, Security-first-Haltung ein. Engagieren Sie sich tief in Upstream-Open-Source-Communities. Formalisieren Sie die APIs, SDKs und Protokolle, die es Partnern und der Industrie ermöglichen, auf der Ebene des KI-Speichers mit NVIDIA zu bauen, zu integrieren und zu kreieren.
- Leiten Sie eine Engineering-Kultur, die sich auf KI-Tools konzentriert. Nutzen Sie regelmäßig moderne KI-Codierungs- und Agenten-Tools in Ihren täglichen Aufgaben. Zeigen Sie, was 10× Engineering bei NVIDIA bedeutet. Verteilen Sie Muster, Prompts und Evaluierungs-Harnesses in der gesamten Speicherorganisation.
- Arbeiten Sie mit gleichrangigen Distinguished und Principal Storage Architects in der gesamten Organisation zusammen, um die schwierigsten, langfristigen technischen Herausforderungen anzugehen. Machen Sie Automatisierung zur einzig akzeptablen Lösung für Infrastrukturmanagementaufgaben wie Live-Software-Upgrades, Knoten- und Laufwerksersetzungen, Kapazitätsneuausgleich, Datenverschiebung zwischen Rechenzentren und Dataset-Lebenszyklus. Etablieren Sie Rigor bei der Ursachenanalyse und Korrekturmaßnahmen bei jedem größeren Vorfall. Entwerfen Sie die Speicherschicht für Workloads, die die nächsten GPU-Generationen umfassen, einschließlich disaggregierter Inferenz mit speichergestütztem KV-Caching, groß angelegten Write-Once-Read-Many-Inferenzmustern, regionalen Exabyte-Objektspeichern und der Versionsverwaltung und Kopierverwaltung von Datensätzen über Rechenzentren hinweg.
- Mentoring und Entwicklung von Senior-, Principal- und Distinguished Engineers in der Speicherorganisation und angrenzenden Geschäftsbereichen. Heben Sie die technische Messlatte breit an. Vertreten Sie NVIDIA extern in Standardisierungsgremien, Open-Source-Communities, Kunden-Briefings und Branchenforen (FAST, SC, OCP, SNIA, Linux Storage Summit).
Was wir sehen müssen
- BS, MS oder PhD in Informatik, Elektrotechnik oder einem verwandten Fachgebiet – oder gleichwertige Erfahrung.
- Mindestens 18+ Jahre praktische Ingenieurerfahrung in der Speichertechnologie sind erforderlich. Dies beinhaltet umfangreiche Beteiligung an Hochleistungs-Parallel-Dateisystemen wie Lustre, GPFS / Spectrum Scale, WEKA, VAST, BeeGFS, DAOS oder deren Äquivalenten, die Daten im Multi-Petabyte-Maßstab verwalten. Kandidaten müssen auch über umfassende Expertise in Objektspeichern (S3 / Swift-Klasse) und Block-Speichern (NVMe-oF, NVMesh-Klasse, iSCSI) verfügen.
- Eine Erfolgsbilanz bei der Erstellung und Verwaltung von Speicherplattformen im Exabyte-Maßstab für leistungskritische Workloads – KI-Training, HPC, Video oder Hyperscale-Data-Lakes – einschließlich direkter Verantwortung für Haltbarkeits-, Verfügbarkeits- und Leistungs-SLOs, gemessen in 9s.
- Nachgewiesene Fähigkeit, technische Strategien über Geschäftsbereiche und Partnerorganisationen hinweg festzulegen. Sie haben mehrjährige Speicherarchitekturen vorangetrieben, die von mehreren Teams, Anbietern oder Kunden übernommen wurden. Sie können messbare Ergebnisse wie GPU-Nutzungssteigerung, $/PB-Reduzierung, eliminierte Vorfälle und verkürzte Inbetriebnahmezeiten vorweisen.
- Sie sind 100% hands-on im Engineering. Sie schreiben und überprüfen selbst Produktionscode. Wenn ein Fehler dies erfordert, lesen Sie Lustre, NFS, Kernel, NVMe-oF oder SPDK-Quellcode. Sie führen auch selbst Skalierungstests oder Wiederherstellungsübungen durch, anstatt sie zu delegieren.
- Starke Kenntnisse in mindestens einer Systemprogrammiersprache (C, C++, Rust oder Go) und Kenntnisse in Python; vertraut mit den Linux Kernel-Speicher- und Netzwerkstacks (Blockebene, RDMA / RoCE / InfiniBand, NVMe, Page Cache, VFS, Multipath).
- Häufige tägliche Nutzung fortschrittlicher KI-Codierungs- und autonomer Tools, einschließlich spezifischer Beispiele, die zeigen, wie Sie das Erstellen, Codieren, Debuggen, Validieren und Betreiben beschleunigt haben. Teilen Sie auch Ihre Perspektive auf zukünftige Trends.
- Ausgezeichnete schriftliche und mündliche Kommunikationsfähigkeiten. Sie können ein Einseiter schreiben, der einen VP ausrichtet. Sie können auch einen Sechsseiter schreiben, der eine ganze Organisation ausrichtet. Sie können einem SRE, einem Vendor CTO und einem internen Kunden in derselben Woche einen tiefen technischen Kompromiss erklären.
- Komfort bei der Arbeit in einer 24/7 Produktionsumgebung, in der Speicherereignisse direkte Auswirkungen auf den GPU-Umsatz haben, mit einem Security-First-Ansatz, der in jeden Build integriert ist.
Wege, sich von der Masse abzuheben
- Nachgewiesene Erfahrung in der Entwicklung oder Verwaltung von Speicherlösungen für KI-Training oder Inferenz im Maßstab von 10k+ GPUs, die klare Verbesserungen der GPU-Auslastung oder Reduzierung von I/O-Engpässen zeigen.
- Open-Source-Beiträge oder Maintainership in Lustre, NFS, SPDK, NVMe / NVMe-oF, CSI, Ceph, MinIO, RocksDB oder verwandten Projekten.
- Aufbau oder Leitung einer Architektur für disaggregierte Inferenz oder Inferenzzeit-Computing-Speicher – KV-Caching für schnellen In-Cluster- oder GPU-nahen Speicher, WORM im großen Maßstab, speicherbewusste Planung oder datenbankintegrierte Inferenz.
- Öffentliche technische Beiträge – Patente, begutachtete Veröffentlichungen (FAST, SOSP, NSDI, OSDI, ATC), Keynote-Vorträge oder RFCs –, die Expertise und Führung im Bereich Speicher für KI-Infrastruktur demonstrieren.
NVIDIA war führend im Bereich des beschleunigten Computings. Heute treibt unsere KI-Infrastruktur die globale Intelligenz voran und verändert Branchen weltweit. Die AI Cloud Storage-Gruppe bildet die Basis, die die Produktivität der weltweit größten GPU-Flotte aufrechterhält. Jedes trainierte Modell, jede bereitgestellte Inferenz und jeder gespeicherte Checkpoint durchläuft Systeme, die wir entwickeln, konstruieren und verwalten.
Als einer der begehrtesten Arbeitgeber der Technologiewelt bietet NVIDIA äußerst wettbewerbsfähige Gehälter und ein umfassendes Leistungspaket. Wenn Sie Ihre Zukunft planen, sehen Sie, was wir Ihnen und Ihrer Familie bieten können unter nvidiabenefits.com/ nvidiabenefits.com/
Sie haben auch Anspruch auf Aktienoptionen und Leistungen nvidia.com/en-us/benefits/.
Ihr Grundgehalt wird basierend auf Ihrem Standort, Ihrer Erfahrung und dem Gehalt von Mitarbeitern in ähnlichen Positionen ermittelt. Die Gehaltsspanne für das Grundgehalt beträgt 320,000 USD - 488,750 USD.
Bewerbungen für diese Stelle werden mindestens bis zum 28. September 2026 angenommen.
Diese Ausschreibung gilt für eine bestehende Stelle.
NVIDIA nutzt KI-Tools in seinen Rekrutierungsprozessen.
NVIDIA setzt sich für die Förderung eines integrativen Arbeitsumfelds ein und ist stolz darauf, ein Arbeitgeber zu sein, der Chancengleichheit bietet. Da wir Vielfalt in unseren aktuellen und zukünftigen Mitarbeitern sehr schätzen, diskriminieren wir nicht (einschließlich unserer Einstellungs- und Beförderungspraktiken) aufgrund von Rasse, Religion, Hautfarbe, nationaler Herkunft, Geschlecht, Geschlechtsausdruck, sexueller Orientierung, Alter, Familienstand, Veteranenstatus, Behinderungsstatus oder anderen gesetzlich geschützten Merkmalen.
