Esri
NVIDIA
Ingénieur Logiciel Senior Stockage - DGX Cloud
À propos du poste
L'équipe de stockage DGXC de NVIDIA gère certaines des tâches d'entraînement et d'inférence les plus rapides. Chaque cycle GPU dépend d'une plateforme de stockage conçue pour maintenir des dizaines de milliers d'accélérateurs continuellement occupés. Elle maintient des exaoctets de données en toute sécurité et alimente les plus grandes charges de travail d'IA au monde dans les environnements cloud, neocloud et on-prem. Avec la croissance de l'informatique accélérée, le stockage est essentiel. Il peut faire la différence entre une utilisation efficace des GPU et un potentiel gâché, et entre le lancement d'un modèle de pointe à temps ou le dépassement de la date limite de plusieurs mois. Nous recherchons un ingénieur logiciel de stockage pratique pour rejoindre l'équipe de stockage en tant que contributeur individuel et leader technique. Vous contribuerez aux systèmes de fichiers parallèles et distribués open-source et maintiendrez nos plus grands clusters GPU rapides, fiables et durables. Vous resterez très impliqué : en écrivant et en révisant du code de production, en recherchant les causes profondes sur le terrain et en définissant les normes de configuration et de réglage sur lesquelles nos flottes de GPU s'exécutent. C'est une chance de faire de l'ingénierie de stockage fondamentale pour l'ère de l'IA dans l'entreprise qui a introduit l'informatique accélérée.
Ce que vous ferez
- Contribuer aux systèmes de fichiers open-source. Contribuer du code aux systèmes de fichiers parallèles et distribués open-source, et au stockage objet distribué. Intégrer des corrections et des fonctionnalités en amont, et interagir directement avec les communautés et les mainteneurs en amont.
- Agir en tant que leader technique logiciel de stockage pratique. Écrivez et révisez vous-même le code de production, et lisez le code du noyau, NFS, NVMe-oF ou SPDK lorsqu'un bug l'exige. Prenez les décisions techniques finales sur les livraisons de stockage par rapport à des objectifs mesurables.
- Analyser et dépanner à grande échelle. Analysez, dépannez et identifiez les causes profondes de problèmes de stockage importants et complexes sur de très grands clusters GPU (des dizaines de milliers de GPU) — performances I/O et métadonnées, corruption de données et récupération.
- Valider l'architecture et les capacités. Validez l'architecture de stockage, les capacités, les performances et la durabilité. Exécutez des tests à l'échelle, des benchmarks et des exercices de récupération, et qualifiez de nouvelles versions par rapport à des objectifs mesurables de performance et de durabilité.
- Recommander la configuration, le réglage et les directives. Définissez et recommandez les meilleures pratiques de configuration, de réglage et d'exploitation pour les systèmes de fichiers haute performance sur l'infrastructure GPU, et aidez les opérateurs et les clients internes à les appliquer.
- Collaborer largement. Travaillez avec les équipes d'entraînement, d'inférence et de calcul accéléré, la fiabilité des sites et les opérations, le réseau et la sécurité, et collaborez avec les fournisseurs de cloud, les opérateurs de neocloud et les fournisseurs de stockage sur une architecture commune.
- Travaillez en mode IA d'abord. Utilisez des outils modernes de codage IA et des outils d'agents au quotidien pour accélérer la construction, le débogage, la validation et les opérations.
Ce que nous devons voir
- BS, MS ou PhD en informatique, génie électrique ou un domaine connexe — ou expérience équivalente. Plus de 12 années d'expérience directe en ingénierie logicielle de stockage, y compris une implication étendue avec un système de fichiers parallèle ou distribué haute performance gérant une échelle multi-pétaoctets.
- Contributions à des projets open-source impliquant un système de fichiers distribué ou parallèle. Vous êtes pleinement engagé dans les tâches d'ingénierie. Vous écrivez et révisez du code de production, examinez le code du système de fichiers, du noyau, NVMe-oF ou SPDK pour identifier les bugs, et menez personnellement des tests à l'échelle ou des exercices de récupération au lieu de les assigner à d'autres.
- Expérience dans le diagnostic et la résolution de problèmes de stockage dans de vastes clusters GPU ou HPC, y compris l'analyse des performances I/O et des métadonnées.
- Forte maîtrise d'au moins un langage système (C, C++, Rust, ou Go) et maîtrise de Python ; à l'aise dans les piles de stockage et de réseau du noyau Linux (couche bloc, RDMA / RoCE / InfiniBand, NVMe, cache de page, VFS, multipath).
- Solide compréhension du stockage objet (S3 / classe Swift) et du stockage bloc (NVMe-oF, iSCSI).
- Excellentes compétences en communication écrite et verbale ; capable de clarifier des compromis techniques complexes pour les ingénieurs, les SREs, les fournisseurs et les clients internes.
- Confort dans un environnement de production 24/7 où les incidents de stockage ont un impact direct sur la disponibilité des GPU, avec une approche axée sur la sécurité intégrée à chaque build.
- Ingénierie pratique à 100%. Vous écrivez et révisez du code de production, lisez le code du système de fichiers, du noyau, NVMe-oF ou SPDK pour rechercher des bugs, et exécutez vous-même des tests à l'échelle ou des exercices de récupération plutôt que de déléguer.
Moyens de vous démarquer
- Mainteneurs ou contributions soutenues à des projets publics largement utilisés.
- Expérience dans la création ou l'exploitation de stockage pour l'entraînement ou l'inférence IA à très grande échelle de GPU, avec des gains mesurables dans l'utilisation des GPU ou des réductions des goulots d'étranglement I/O.
- Expérience en développement de noyau et de système de fichiers, évolutivité des métadonnées, placement des données, récupération après défaillance, ou expérience HSM ou équivalente.
- Développement de Kubernetes et de pilotes CSI pour le stockage.
- Expérience pratique avec l'optimisation des performances SPDK, libfabric ou FUSE.
NVIDIA ouvre la voie à des développements révolutionnaires dans l'intelligence artificielle, le calcul haute performance et la visualisation. Notre invention sert de cortex visuel aux ordinateurs modernes et est au cœur de nos produits et services. Notre travail ouvre de nouveaux univers à explorer, permet une créativité et une découverte incroyables, et alimente ce qui était autrefois des inventions de science-fiction, de l'intelligence artificielle aux voitures autonomes. NVIDIA recherche des individus exceptionnels comme vous pour nous aider à piloter la prochaine vague d'intelligence artificielle.
NVIDIA est largement considéré comme l'un des employeurs les plus désirables au monde dans le domaine de la technologie. Nous avons parmi les personnes les plus avant-gardistes et passionnées qui travaillent pour nous. Si vous êtes créatif et autonome, nous voulons vous entendre !
Votre salaire de base sera déterminé en fonction de votre emplacement, de votre expérience et de la rémunération des employés occupant des postes similaires. La fourchette de salaire de base est de 224,000 USD - 356,500 USD pour le niveau 5, et de 272,000 USD - 431,250 USD pour le niveau 6.
Les candidatures pour ce poste seront acceptées au moins jusqu'au 5 octobre 2026.
Cette offre concerne un poste vacant existant.
NVIDIA utilise des outils d'IA dans ses processus de recrutement.
NVIDIA s'engage à favoriser un environnement de travail inclusif et est fier d'être un employeur garantissant l'égalité des chances. Comme nous accordons une grande importance à la diversité de nos employés actuels et futurs, nous ne faisons aucune discrimination (y compris dans nos pratiques d'embauche et de promotion) fondée sur la race, la religion, la couleur, l'origine nationale, le sexe, l'expression de genre, l'orientation sexuelle, l'âge, l'état civil, le statut d'ancien combattant, le statut de handicap ou toute autre caractéristique protégée par la loi.
Vous serez également éligible aux actions et aux avantages sociaux nvidia.com/en-us/benefits/.
