NVIDIA

Ingénieur Logiciel Systèmes Senior, Performance Accélérée Kubernetes et Échelle - DGX Cloud

PythonAWSGCPKubernetes
Traduction automatique. Consultez l’original.

À propos du poste

NVIDIA transforme l'infographie, le jeu sur PC et le calcul accéléré depuis plus de 25 ans, grâce à une technologie de pointe et des personnes exceptionnelles. Nous exploitons désormais le potentiel illimité de l'IA pour définir la prochaine ère de l'informatique, où nos GPU alimentent des ordinateurs, des robots et des voitures autonomes capables de comprendre le monde. Faire ce qui n'a jamais été fait auparavant demande de la vision, de l'innovation et les meilleurs talents du monde. En tant que NVIDIAN, vous travaillerez dans un environnement diversifié et solidaire où les employés sont encouragés à donner le meilleur d'eux-mêmes et à développer leur carrière. Nous privilégions le travail hybride tout en restant ouverts aux arrangements à distance, vous offrant ainsi la flexibilité nécessaire pour donner le meilleur de vous-même.

Rejoignez notre équipe et découvrez comment vous pouvez avoir un impact durable sur le monde.

L'organisation DGX Cloud de NVIDIA réunit des innovations matérielles et logicielles de pointe pour fournir une informatique accélérée de premier plan pour les charges de travail d'IA les plus ambitieuses au monde. Nous sommes un groupe d'ingénieurs avant-gardistes qui relèvent certains des défis les plus difficiles du globe, qui font progresser la technologie et qui ont un impact positif sur des millions de vies.

Nous recherchons un Ingénieur Logiciel Systèmes Senior possédant une expertise approfondie des systèmes distribués, de Kubernetes, des conteneurs, ainsi que de la performance et de la scalabilité des systèmes.

Le candidat idéal possède une expérience large et pratique sur l'ensemble de la pile technologique, y compris les opérateurs GPU, les plugins de périphériques, le service d'inférence distribuée et les principales plateformes cloud. Vous résoudrez des problèmes techniques complexes à grande échelle et contribuerez à façonner la manière dont l'infrastructure d'IA fonctionne en production. Dans ce rôle clé, vous vous concentrerez sur la mise à l'échelle de l'infrastructure d'IA tout en minimisant le coût total de possession, en réduisant le coût par token et en permettant l'innovation future en matière d'IA et les usines d'IA. Êtes-vous prêt à avoir un impact ?

Vos missions

  1. Mener l'analyse de performance et de scalabilité de bout en bout de la pile d'exécution accélérée basée sur Kubernetes (plans de contrôle et de données), y compris les composants NVIDIA tels que GPU Operator, Network Operator, node-feature-discovery, topograph, dra-driver-nvidia-gpu et nvsentinel, en suivant les problèmes de l'orchestration jusqu'au matériel.
  1. Concevoir et contribuer aux changements architecturaux en amont du plan de contrôle Kubernetes et des projets associés pour permettre un fonctionnement fiable à des tailles de cluster hyperscale, en faisant en open source ce que les hyperscalers font aujourd'hui en privé.
  1. Améliorer le démarrage des conteneurs et la latence de démarrage à froid pour permettre une mise à l'échelle de l'inférence fluide et à faible latence sur Kubernetes à travers des milliers de nœuds GPU, en garantissant que la pile d'exécution d'IA évolue sans créer de pression sur les serveurs API ou de fragilité opérationnelle.
  1. Évaluer, améliorer et contribuer aux projets open-source qui font de Kubernetes une plateforme exceptionnelle pour les charges de travail d'IA (par exemple, Grove et gateway-api-inference-extension), en composant leurs architectures avec une attention particulière à la scalabilité, la résilience et l'entraînement/inférence multi-nœuds.
  1. Faire progresser la scalabilité et la performance des conteneurs confidentiels (CoCo) sur Kubernetes afin que les charges de travail d'inférence cryptées répondent aux exigences strictes d'efficacité et de latence en production.
  1. Utiliser DSX et l'infrastructure de simulation à grande échelle associée pour modéliser des déploiements complets d'usines d'IA et valider la scalabilité sur des milliers de GPU simulés, en détectant les défaillances qui n'apparaissent qu'à grande échelle avant l'arrivée du matériel.
  1. Collaborer avec les chercheurs en IA, les développeurs, les clients et les communautés en amont pour concevoir des tests de charges de travail automatisés à grande échelle (y compris la relecture de traces d'agents de production), construire des outils de surveillance/analyse et intégrer des tests continus de performance et d'échelle dans les flux de travail CI/CD modernes.
  1. Documenter clairement les méthodes et les résultats, présenter les conclusions en interne et lors d'événements industriels (par exemple, KubeCon, GTC), tout en s'engageant activement auprès des groupes en amont (SIG Scalability de Kubernetes, CNCF et communautés OSS de NVIDIA) pour influencer et valider les directions de performance et de scalabilité des charges de travail d'IA.

Ce que nous attendons

  1. Licence ou Master en Ingénierie ou expérience équivalente, idéalement en Génie Électrique, Informatique ou Informatique.
  1. 8+ années d'expérience en architecture informatique, réseau, systèmes de stockage et plateformes basées sur accélérateurs.
  1. Expertise en Kubernetes et familiarité avec l'écosystème CNCF plus large.
  1. Expérience approfondie des systèmes d'accélérateurs distribués, parallèles à grande échelle et optimisation des performances des charges de travail d'IA.
  1. Expérience en modélisation de performance et en benchmarking pour les systèmes à grande échelle.
  1. Maîtrise de Golang et/ou Python.
  1. Forte familiarité avec la pile logicielle NVIDIA pour l'entraînement et l'inférence.
  1. Expertise avec au moins un fournisseur majeur de cloud public (par exemple, AWS, Azure, GCP, ou OCI).

Les atouts qui feront la différence

  1. Solide expérience opérationnelle avec l'une des distributions de Kubernetes.
  1. Expérience préalable dans la mise à l'échelle de clusters Kubernetes à des nombres de nœuds et d'objets ultra-élevés.
  1. Historique démontré de travail dans la communauté open-source.
  1. Excellentes compétences en communication et relations interpersonnelles.
  1. Doctorat ou expérience équivalente dans des domaines pertinents.

#LI-Hybrid

Les candidatures pour ce poste seront acceptées au moins jusqu'au 29 juin 2026.

Cette offre concerne un poste vacant existant.

NVIDIA utilise des outils d'IA dans ses processus de recrutement.

NVIDIA s'engage à favoriser un environnement de travail inclusif et est fier d'être un employeur qui respecte l'égalité des chances. Comme nous accordons une grande importance à la diversité de nos employés actuels et futurs, nous ne faisons aucune discrimination (y compris dans nos pratiques d'embauche et de promotion) fondée sur la race, la religion, la couleur, l'origine nationale, le sexe, l'expression de genre, l'orientation sexuelle, l'âge, l'état civil, le statut d'ancien combattant, le statut de handicap ou toute autre caractéristique protégée par la loi.

Votre salaire de base sera déterminé en fonction de votre localisation, de votre expérience et de la rémunération des employés occupant des postes similaires. La fourchette de salaire de base est de 184,000 USD - 287,500 USD pour le niveau 4, et de 224,000 USD - 356,500 USD pour le niveau 5. Vous serez également éligible aux actions et aux avantages sociaux nvidia.com/en-us/benefits/.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter