NVIDIA

Distinguished Engineer, Stockage – AI Cloud

PythonC++RustGo
Traduction automatique. Consultez l’original.

Stockage de données pour l'AI Cloud

NVIDIA transforme les graphismes informatiques, le jeu sur PC et le calcul accéléré depuis plus de 25 ans. C'est un héritage d'innovation unique alimenté par une technologie exceptionnelle et des personnes incroyables. Aujourd'hui, nous exploitons le potentiel illimité de l'IA pour définir la prochaine ère de l'informatique. Une ère où notre GPU agit comme le cerveau des ordinateurs, des robots et des voitures autonomes capables de comprendre le monde. Faire ce qui n'a jamais été fait auparavant demande de la vision, de l'innovation et les meilleurs talents du monde. En tant que NVIDIAN, vous serez immergé dans un environnement diversifié et solidaire où chacun est inspiré à donner le meilleur de lui-même. Rejoignez l'équipe et découvrez comment vous pouvez avoir un impact durable sur le monde.

L'organisation de stockage DGXC de NVIDIA gère certaines des tâches d'entraînement et d'inférence les plus rapides. Chaque cycle GPU dépend d'une plateforme de stockage conçue pour maintenir des dizaines de milliers d'accélérateurs occupés en permanence. Elle maintient des exaoctets de données en toute sécurité et alimente les plus grandes charges de travail d'IA au monde dans les configurations cloud, neocloud et on-prem. Avec la croissance du calcul accéléré, le stockage est essentiel. Il peut faire la différence entre une utilisation efficace du GPU et un potentiel gâché, et entre le lancement d'un modèle de pointe à temps ou le dépassement du délai de plusieurs mois. Nous recherchons un Ingénieur spécialisé pour diriger la stratégie de stockage de NVIDIA pour l'AI Cloud au sein de l'écosystème Neocloud Provider (NCP) et Cloud Service Provider (CSP). Vous dirigerez l'architecture des systèmes de fichiers parallèles haute performance, des stockages objets et des stockages blocs à l'échelle des exaoctets. Vous resterez impliqué, en collaborant avec les ingénieurs, les SREs, les partenaires et les fournisseurs de stockage. Vous appliquerez les outils d'IA de NVIDIA pour augmenter votre productivité et celle de ceux que vous impactez. C'est une opportunité distinctive d'établir le cadre de stockage de l'ère de l'IA dans l'entreprise qui a introduit le calcul accéléré.

NVIDIA a ouvert la voie au calcul accéléré. Aujourd'hui, notre infrastructure IA pilote l'intelligence mondiale, transformant les industries du monde entier. Le groupe AI Cloud Storage constitue la base qui maintient la productivité de la plus grande flotte de GPU au monde. Chaque modèle entraîné, chaque inférence servie et chaque point de contrôle sauvegardé passe par les systèmes que nous développons, construisons et gérons.

Ce que vous ferez : *

  1. Diriger le plan technique pluriannuel d'expansion du stockage AI Cloud sur les NCP — déterminer l'architecture de référence, les capacités, les SLO de performance et de durabilité, la méthodologie de qualification et la feuille de route pour le stockage de fichiers, objets et blocs haute performance que chaque NCP doit offrir pour être qualifié pour l'allocation de GPU NVIDIA. *
  1. Agir en tant qu'architecte de stockage principal avec une implication pratique approfondie. Diriger les revues clés des constructions de stockage et enquêter sur les causes profondes des problèmes de production complexes. Développer des implémentations de référence prototypes pour minimiser les risques dans les nouvelles initiatives. Prendre les décisions techniques finales sur les livraisons de stockage NCP en utilisant des SLO mesurables. Appliquer massivement les outils d'IA pour amplifier votre influence technique tout au long du programme. *
  1. Définir la norme pour "prêt pour la production" dans le stockage NCP, y compris les SLO de durabilité et de disponibilité mesurés en 9. Assurer une efficacité soutenue par TiB, une observabilité, un confinement du rayon d'explosion et une réduction du travail opérationnel. Influencer le contrôle de la livraison des GPU en exigeant que l'AI Cloud n'accepte la capacité GPU qu'après vérification des services auxiliaires axés sur le stockage. *
  1. Développer et guider la direction architecturale en travaillant en étroite collaboration avec les collaborateurs des lignes de produits d'entraînement, d'inférence et de calcul accéléré. Coordonner avec les collègues responsables de la fiabilité des sites, des opérations, du réseau et de la sécurité. Travailler avec les fournisseurs de cloud externes, les opérateurs de neocloud et les fournisseurs de stockage pour s'aligner sur une architecture commune. *
  1. Développer la voie à suivre en open source pour le stockage IA. Établir et guider une stratégie open source qui élargit l'écosystème du stockage IA. Promouvoir une approche axée sur GitHub et la sécurité. S'engager profondément avec les communautés open source en amont. Formaliser les APIs, SDKs et protocoles permettant aux partenaires et à l'industrie de construire, intégrer et créer avec NVIDIA au niveau du stockage IA. *
  1. Diriger une culture d'ingénierie centrée sur les outils d'IA. Utiliser régulièrement des outils modernes de codage et d'agents IA dans vos tâches quotidiennes. Montrer ce que signifie l'ingénierie à 10× chez NVIDIA. Distribuer des modèles, des invites et des harnais d'évaluation dans toute l'organisation de stockage. *
  1. Collaborer avec des ingénieurs spécialisés et principaux en stockage de l'organisation pour relever les défis techniques les plus difficiles et à long terme. Faire de l'automatisation la seule solution acceptable pour les tâches de gestion d'infrastructure telles que les mises à niveau logicielles en direct, le remplacement de nœuds et de disques, le rééquilibrage de capacité, le déplacement de données entre centres de données et le cycle de vie des ensembles de données. Établir une rigueur d'analyse des causes profondes et d'actions correctives sur chaque incident majeur. Concevoir la couche de stockage pour les charges de travail couvrant les prochaines générations de GPU, y compris l'inférence désagrégée avec mise en cache KV basée sur le stockage, les modèles d'inférence à lecture unique et écriture multiple à grande échelle, les stockages objets régionaux exaoctets, et la gestion des versions et des copies d'ensembles de données entre centres de données. *
  1. Mentorer et développer des ingénieurs seniors, principaux et spécialisés au sein de l'organisation de stockage et des unités commerciales adjacentes. Élever le niveau technique de manière générale. Représenter NVIDIA en externe dans les organismes de normalisation, les communautés open source, les briefings clients et les forums industriels (FAST, SC, OCP, SNIA, Linux Storage Summit).

Ce que nous devons voir : *

  1. Diplôme de licence, master ou doctorat en informatique, génie électrique ou domaine connexe — ou expérience équivalente. *
  1. Un minimum de 18+ années d'expérience pratique en ingénierie dans la technologie de stockage est nécessaire. Cela implique une implication étendue avec un système de fichiers parallèle haute performance tel que Lustre, GPFS / Spectrum Scale, WEKA, VAST, BeeGFS, DAOS, ou son équivalent, gérant des données à l'échelle multi-pétaoctets. Les candidats doivent également avoir une expertise étendue en stockage objet (classe S3 / Swift) et en stockage bloc (NVMe-oF, classe NVMesh, iSCSI). *
  1. Un historique de conception et de gestion de plateformes de stockage à l'échelle des exaoctets pour des charges de travail critiques en termes de performance — entraînement IA, HPC, vidéo ou lacs de données hyperscale — y compris une responsabilité directe des SLO de durabilité, de disponibilité et de performance mesurés en 9. *
  1. Capacité démontrée à définir la stratégie technique à travers les unités commerciales et les organisations partenaires. Vous avez piloté des architectures de stockage pluriannuelles adoptées par plusieurs équipes, fournisseurs ou clients. Vous pouvez citer des résultats mesurables tels que l'amélioration de l'utilité des GPU, la réduction des coûts par Po, l'élimination des incidents et la compression du temps de mise en service. *
  1. Vous êtes impliqué à 100% % dans l'ingénierie. Vous écrivez et révisez vous-même le code de production. Lorsqu'un bug l'exige, vous lisez le code source de Lustre, NFS, du noyau, NVMe-oF ou SPDK. Vous exécutez également personnellement des tests d'échelle ou des exercices de récupération au lieu de déléguer. *
  1. Solide maîtrise d'au moins un langage système (C, C++, Rust, ou Go) et maîtrise de Python ; à l'aise dans les piles de stockage et réseau du noyau Linux (couche bloc, RDMA / RoCE / InfiniBand, NVMe, cache de page, VFS, multipath). *
  1. Utilisation quotidienne fréquente d'outils avancés de codage et autonomes d'IA, y compris des exemples spécifiques montrant comment vous avez accéléré la construction, le codage, le débogage, la validation et les opérations. Partagez également votre perspective sur les tendances futures. *
  1. Excellente communication écrite et orale. Vous pouvez rédiger une page qui aligne un VP. Vous pouvez également rédiger un document de six pages qui aligne une organisation entière. Vous pouvez expliquer un compromis technique profond à un SRE, un CTO de fournisseur et un client interne la même semaine. *
  1. Confort d'opérer dans un environnement de production 24/7 où les incidents de stockage ont un impact direct sur les revenus des GPU, avec une approche axée sur la sécurité intégrée à chaque construction.

Moyens de vous démarquer : *

  1. Expérience avérée dans la conception ou la gestion de solutions de stockage pour l'entraînement ou l'inférence IA à l'échelle de 10k+ GPU, démontrant des améliorations claires de l'utilisation des GPU ou une réduction des goulots d'étranglement d'E/S. *
  1. Contributions open source ou rôle de mainteneur dans Lustre, NFS, SPDK, NVMe / NVMe-oF, CSI, Ceph, MinIO, RocksDB, ou projets connexes. *
  1. Conception ou direction d'une architecture de stockage pour l'inférence désagrégée ou l'inférence en temps de calcul — mise en cache KV vers un stockage rapide intra-cluster ou adjacent au GPU, WORM à l'échelle, ordonnancement conscient du stockage, ou inférence intégrée à la base de données. *
  1. Contributions techniques publiques — brevets, articles évalués par des pairs (FAST, SOSP, NSDI, OSDI, ATC), conférences d'ouverture, ou RFC — qui démontrent l'expertise et le leadership dans le stockage pour l'infrastructure IA.

Largement considéré comme l'un des employeurs les plus désirables du monde de la technologie, NVIDIA offre des salaires très compétitifs et un ensemble complet d'avantages sociaux. Alors que vous planifiez votre avenir, découvrez ce que nous pouvons vous offrir, à vous et à votre famille, sur nvidiabenefits.com/ nvidiabenefits.com/

Vous serez également éligible à des actions et des avantages sociaux sur nvidia.com/en-us/benefits/.

Votre salaire de base sera déterminé en fonction de votre localisation, de votre expérience et de la rémunération des employés occupant des postes similaires. La fourchette de salaire de base est 320,000 USD - 488,750 USD.

Les candidatures pour ce poste seront acceptées au moins jusqu'au 8 octobre 2026.

Cette offre concerne un poste vacant existant.

NVIDIA utilise des outils d'IA dans ses processus de recrutement.

NVIDIA s'engage à favoriser un environnement de travail inclusif et est fier d'être un employeur garantissant l'égalité des chances. Comme nous accordons une grande importance à la diversité de nos employés actuels et futurs, nous ne faisons aucune discrimination (y compris dans nos pratiques d'embauche et de promotion) fondée sur la race, la religion, la couleur, l'origine nationale, le sexe, l'expression de genre, l'orientation sexuelle, l'âge, l'état civil, le statut d'ancien combattant, le statut de handicap ou toute autre caractéristique protégée par la loi.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter