NVIDIA

Ingénieur logiciel principal, logiciel système à l'échelle du rack — Engagements CSP

Traduction automatique. Consultez l’original.

À propos du poste

Nous recherchons un Ingénieur logiciel principal pour rejoindre notre équipe Engagements CSP en tant que point focal technique pour le SW/FW système à l'échelle du rack, en travaillant avec les équipes d'ingénierie CSP pour garantir qu'elles peuvent déployer, surveiller et exploiter ces systèmes de manière fiable à l'échelle de la flotte. Dans ce rôle, vous collaborerez avec les équipes d'ingénierie SW/FW système à l'échelle du rack interfonctionnelles de NVIDIA avec un leadership technique dédié face aux CSP. Votre objectif est le logiciel au niveau du système qui gère, surveille et récupère le rack dans son ensemble — gestion du fabric, gestion et récupération des erreurs GPU/NVSwitch, télémétrie de santé APIs, orchestration des mises à jour du firmware, et maintenabilité pilotée par logiciel. Vous dirigerez des flux de travail avec les équipes d'ingénierie CSP pour établir une compréhension partagée de l'architecture, intégrer leurs retours opérationnels et assurer la préparation à l'intégration.

L'invention du GPU par NVIDIA en 1999 a alimenté la croissance du marché des jeux sur PC, redéfini les graphismes informatiques modernes et révolutionné le calcul parallèle. Plus récemment, le deep learning GPU a déclenché l'ère moderne du deep learning — la prochaine ère de l'informatique — le GPU agissant comme le cerveau des ordinateurs, des robots et des voitures autonomes capables de percevoir et de comprendre le monde. Aujourd'hui, nous sommes de plus en plus connus comme « l'entreprise de calcul IA ». Nous cherchons à développer notre entreprise et à établir des équipes avec les personnes les plus réfléchies au monde. Êtes-vous prêt à changer la prochaine génération d'informatique ? Rejoignez-nous à l'avant-garde du progrès technologique.

Les systèmes de centres de données de NVIDIA, tels que DGX et HGX, sont devenus essentiels aux activités d'entreprise et de fournisseurs de cloud de NVIDIA, en croissance rapide. Ces plateformes réunissent toute la puissance des GPU NVIDIA, du réseau NVIDIA NVLink, du réseau NVIDIA InfiniBand, des CPU NVIDIA Grace, et d'une pile logicielle NVIDIA IA et HPC entièrement optimisée.

Ce que vous ferez : *

  1. Piloter l'alignement de l'architecture SW/FW à l'échelle du rack à travers les engagements CSP — y compris le logiciel de gestion du fabric, la surveillance de la santé des liens, la gestion des erreurs GPU/NVSwitch, les fonctionnalités de maintenabilité SW/FW (par exemple, prise en charge du branchement à chaud, isolation des composants, récupération pilotée par firmware), et l'orchestration du firmware multi-composants *
  1. Piloter des flux de travail techniques avec les équipes d'ingénierie CSP sur le logiciel système à l'échelle du rack — en s'assurant qu'elles comprennent en profondeur la gestion du fabric, le comportement du NVSwitch, les politiques de gestion des erreurs et de récupération, la télémétrie de santé APIs, et le fonctionnement de la récupération contrôlée par SW/FW *
  1. Capturer et synthétiser les retours des équipes d'ingénierie CSP sur le logiciel système à l'échelle du rack — surveillance de la santé APIs, flux de travail de maintenabilité pilotés par logiciel, orchestration des mises à jour du firmware, et comportement de récupération des erreurs — et défendre ces retours dans les décisions d'architecture de NVIDIA *
  1. Collaborer avec des équipes multifonctionnelles pour garantir que les exigences opérationnelles des clients sont reflétées dans le développement du logiciel système et du firmware *
  1. Identifier les modèles inter-CSP dans les problèmes SW/FW à l'échelle du rack, le comportement de gestion des erreurs et les pratiques de configuration système — piloter des améliorations de la documentation, des outils et de la stratégie de test en conséquence *
  1. Collaborer avec les équipes d'exécution sur la stratégie de décalage vers la gauche — en s'assurant que le travail d'intégration SW/FW côté client est identifié tôt et terminé avant la disponibilité du matériel *
  1. Prendre des décisions techniques critiques sur les compromis SW/FW des systèmes à l'échelle du rack et atténuer les risques d'exécution par un engagement précoce avec les équipes d'ingénierie CSP

Ce que nous devons voir : *

  1. 15+ années d'expérience en logiciel système, firmware de plateforme ou ingénierie de systèmes distribués à grande échelle. BS ou MS en informatique, génie électrique ou domaine connexe (ou expérience équivalente) *
  1. Compréhension approfondie des défis du logiciel système à l'échelle du rack : coordination multi-composants, propagation des erreurs, surveillance de la santé et maintenabilité / fiabilité *
  1. Expérience avec les logiciels de gestion de fabric, la gestion de cluster ou les frameworks d'orchestration au niveau du système. Familiarité avec les architectures de firmware et la gestion du cycle de vie des mises à jour (séquençage des mises à jour multi-composants, retour arrière, récupération) *
  1. Compréhension des modèles de conception de gestion des erreurs et de récupération dans les systèmes distribués — isolation des pannes, politiques de nouvelle tentative, dégradation gracieuse *
  1. Expérience avec les systèmes de surveillance de la santé et de télémétrie : notation de la santé, corrélation des événements, conception API pour l'observabilité au niveau de la flotte *
  1. La compréhension du logiciel système GPU ou accélérateur (pilotes, gestion des périphériques, gestion de l'alimentation) est un plus important *
  1. Obsession client — passion sincère pour comprendre comment les CSP exploitent des systèmes sophistiqués à l'échelle de la flotte et simplifier leur expérience *
  1. Succès avéré dans la fourniture de leadership technique au-delà des frontières organisationnelles et l'influence sur la conception du logiciel système sans autorité directe. Excellente communication — capacité à traduire une architecture logicielle système complexe en mentorat actionnable pour les équipes d'ingénierie client

Moyens de vous démarquer : *

  1. Expérience avec le logiciel de gestion de fabric, NVOS ou GPU NVSwitch de NVIDIA *
  1. Expérience en logiciel système pour des clusters à grande échelle chez un hyperscaler (gestion de cluster, orchestration de flotte, plateformes de santé) *
  1. Expérience dans la création de frameworks de gestion des erreurs et de récupération pour des systèmes multi-composants (des centaines ou des milliers de périphériques coordonnés) *
  1. Familiarité avec les opérations de flotte GPU ou accélérateur — cycle de vie des pilotes, stratégies de déploiement du firmware, planification basée sur la santé *
  1. Compréhension de l'impact des décisions logicielles système sur la maintenabilité, la disponibilité et le coût opérationnel à l'échelle de la flotte

Votre salaire de base sera déterminé en fonction de votre localisation, de votre expérience et de la rémunération des employés occupant des postes similaires. La fourchette de salaire de base est 272,000 USD - 431,250 USD.

Les candidatures pour ce poste seront acceptées au moins jusqu'au Octobre 8, 2026.

Cette offre concerne un poste vacant existant.

NVIDIA utilise des outils d'IA dans ses processus de recrutement.

NVIDIA s'engage à favoriser un environnement de travail inclusif et est fier d'être un employeur garantissant l'égalité des chances. Comme nous accordons une grande importance à la diversité de nos employés actuels et futurs, nous ne faisons aucune discrimination (y compris dans nos pratiques d'embauche et de promotion) fondée sur la race, la religion, la couleur, l'origine nationale, le sexe, l'expression de genre, l'orientation sexuelle, l'âge, l'état civil, le statut d'ancien combattant, le statut de handicap ou toute autre caractéristique protégée par la loi.

Vous serez également éligible aux actions et aux avantages sociaux nvidia.com/en-us/benefits/.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter