NVIDIA

Ingénieur Logiciel Principal - Infrastructure Systèmes à l'Échelle d'un Rack

KubernetesC++RustGo
Traduction automatique. Consultez l’original.

À propos du poste

NVIDIA transforme les graphismes informatiques, le jeu sur PC et le calcul accéléré depuis plus de 25 ans. C'est un héritage d'innovation unique alimenté par une technologie de pointe et des personnes exceptionnelles. Aujourd'hui, nous exploitons le potentiel illimité de l'IA pour définir la prochaine ère de l'informatique. Une ère où notre GPU agit comme le cerveau des ordinateurs, des robots et des voitures autonomes capables de comprendre le monde. Faire ce qui n'a jamais été fait auparavant demande de la vision, de l'innovation et les meilleurs talents mondiaux. En tant que NVIDIAN, vous serez immergé dans un environnement diversifié et solidaire où chacun est inspiré à donner le meilleur de lui-même. Rejoignez l'équipe et découvrez comment vous pouvez avoir un impact durable sur le monde.

Chez NVIDIA, en tant qu'Ingénieur Principal en Infrastructure Systèmes à l'Échelle d'un Rack, vous construirez et dirigerez le développement de systèmes logiciels. Ces systèmes prennent en charge nos futurs produits et services d'infrastructure à l'échelle d'un rack. Ce rôle exceptionnel se situe à l'intersection du logiciel et du matériel. Vous travaillerez sur les plans de contrôle, les machines à états, les systèmes d'orchestration, le firmware, le cycle de vie de l'OS et les réseaux. Votre tâche consiste à composer un logiciel de plan de contrôle d'infrastructure en tant que service qui convertit le matériel complexe à l'échelle d'un rack en une infrastructure fiable, gérable et programmable pour NVIDIA, ses partenaires et les principaux clients cloud et d'entreprise à l'échelle mondiale.

NVIDIA est largement considéré comme l'un des employeurs les plus désirables du monde de la technologie. Nous avons parmi nous certaines des personnes les plus avant-gardistes et travailleuses du monde. Si vous êtes créatif et autonome, nous voulons avoir de vos nouvelles !

Ce que vous ferez

  1. Définir l'architecture logicielle complète pour les produits et services d'infrastructure à l'échelle d'un rack, couvrant les services de plan de contrôle, la gestion de l'infrastructure, le firmware, les systèmes d'exploitation, les pilotes du noyau, les réseaux, les logiciels d'accélérateur et les logiciels de gestion en mode utilisateur.
  1. Utiliser Kubernetes et les primitives cloud-natives comme tissu d'infrastructure lorsque cela est approprié. Cela inclut les contrôleurs, les opérateurs, les boucles de réconciliation et les composants open source. Ces composants peuvent fonctionner en toute sécurité à l'échelle d'un rack et d'une flotte. Construire des logiciels d'infrastructure open source qui peuvent être adoptés sous différentes formes, y compris des bibliothèques, des services, des contrôleurs, des opérateurs et des APIs d'intégration pour les déploiements internes et les environnements CSP.
  1. Faire le lien entre les équipes matérielles et logicielles concernant le firmware, le BMC, le BIOS, les flux de démarrage, les images OS, les pilotes, le réseau, les domaines NVLink, InfiniBand, les GPU, les DPU, les CPU et les interfaces de gestion système. Traduire les feuilles de route d'infrastructure prospectives en exigences logicielles formelles, spécifications d'architecture et plans d'exécution qui alignent les équipes au sein de l'organisation.
  1. Collaborer directement avec les hyperscalers, les CSP, les clients d'entreprise, les responsables de composants internes, les fournisseurs et les partenaires commerciaux pour aligner les capacités d'infrastructure sur les besoins réels de déploiement et d'intégration. Établir des stratégies de fiabilité, de sécurité, de validation et de décalage vers la gauche qui réduisent les risques avant que le matériel n'atteigne les environnements de production.
  1. Encadrer les ingénieurs seniors et les responsables techniques, en élevant le niveau d'ingénierie pour les systèmes réseau à grande échelle, les logiciels fondamentaux et le développement de plans de contrôle à l'échelle d'un rack.
  1. Prendre des décisions techniques de haute qualité dans des environnements ambigus, en équilibrant les besoins des clients, le calendrier, les réalités matérielles, la maintenabilité logicielle, l'adoption de l'open source et l'évolution à long terme de l'infrastructure.

Ce que nous devons voir

  1. Licence ou Master en Ingénierie Informatique, Informatique, Génie Électrique, ou domaine connexe, ou expérience équivalente. Expérience avérée (15+ années) en architecture système, logiciel système, systèmes distribués, plans de contrôle d'infrastructure ou ingénierie d'infrastructure.
  1. Solide connaissance architecturale des frameworks de coordination, des machines à états, des APIs déclaratives, des boucles de réconciliation, de l'orchestration du cycle de vie, de la gestion des défaillances, des flux de mise à niveau et de retour arrière, et des compromis des systèmes distribués.
  1. Compétences pratiques en codage en Go, C++ ou Rust, incluant la capacité d'écrire, de réviser et de diriger des logiciels d'infrastructure de qualité production. L'expérience avec Rust est très appréciée.
  1. Expérience avec Kubernetes ou des systèmes d'orchestration similaires, en particulier comme tissu pour gérer l'infrastructure, les ressources matérielles ou les services d'infrastructure à grande échelle. Expérience avec les logiciels d'infrastructure basés sur Linux, le déploiement d'OS et la gestion d'images, les interactions noyau ou pilotes, le cycle de vie du firmware et les flux de mise en service du matériel.
  1. Compréhension approfondie des technologies et protocoles de réseau de centre de données, tels que Ethernet, InfiniBand, RDMA et la gestion au niveau du tissu. Expérience avec des systèmes complexes basés sur des accélérateurs, y compris les GPU, les DPU, les FPGA, les circuits intégrés personnalisés ou d'autres systèmes de calcul haute performance.
  1. Expertise dans les architectures de gestion en bande et hors bande, y compris les BMC, Redfish, IPMI et les protocoles de gestion système associés. Capacité à travailler avec des experts en sécurité pour définir des compromis pratiques entre le démarrage sécurisé, l'attestation, le contrôle d'accès, la sécurité des mises à jour, la facilité de maintenance et la simplicité d'exploitation.
  1. Expérience dans la création de logiciels destinés à être publiés en open source, y compris la stabilité des API, la modularité, la documentation, l'utilisabilité communautaire et une séparation claire entre les logiciels partagés et les intégrations spécifiques au déploiement.
  1. Expérience dans l'utilisation responsable des outils de développement assistés par IA comme multiplicateur d'ingénierie pour le codage, la génération de tests, le débogage, l'itération de construction et la documentation.
  1. Compétence établie dans la spécification des exigences, la direction de l'architecture et la gestion de la livraison à travers diverses équipes et organisations d'ingénierie. Solides compétences en communication écrite et verbale, permettant une explication claire des compromis complexes matériel/logiciel aux responsables de l'ingénierie, aux clients, aux partenaires et aux dirigeants.

Pour vous démarquer

  1. Avoir développé des logiciels prenant en charge plusieurs modèles d'adoption : services internes, offres intégrées aux CSP, bibliothèques réutilisables et APIs extensibles par le client. Solides compétences en Rust dans les systèmes, l'infrastructure ou les logiciels adjacents au matériel.
  1. Avoir multiplié l'impact de l'équipe grâce à des implémentations de référence, des revues de conception, des bibliothèques partagées, des documents d'architecture, des flux de développement et l'ingénierie assistée par IA. Expérience pratique du provisionnement à l'échelle de la flotte, des mises à jour, des retours arrière, de l'observabilité, de la santé et de la remédiation.
  1. Avoir dirigé sur l'ensemble du cycle de vie des produits de centre de données : conception, pré et post-silicium, fabrication, déploiement et opérations. Connaissance des écosystèmes open source, des modèles de contribution et de l'équilibre entre la collaboration communautaire et les besoins du produit.
  1. Expérience approfondie des systèmes à l'échelle d'un rack ou d'un cluster couvrant le calcul, le réseau, le stockage, les accélérateurs, le firmware et la gestion de l'infrastructure comme un seul domaine opérationnel. Compétence pour trouver des abstractions simples et durables dans des systèmes complexes afin d'aligner les équipes, les clients et la direction à long terme.

Votre salaire de base sera déterminé en fonction de votre localisation, de votre expérience et de la rémunération des employés occupant des postes similaires. La fourchette de salaire de base est 272,000 USD - 431,250 USD.

Les candidatures pour ce poste seront acceptées au moins jusqu'au Octobre 8, 2026.

Cette offre concerne un poste vacant existant.

NVIDIA utilise des outils d'IA dans ses processus de recrutement.

NVIDIA s'engage à favoriser un environnement de travail inclusif et est fier d'être un employeur garantissant l'égalité des chances. Comme nous accordons une grande importance à la diversité de nos employés actuels et futurs, nous ne faisons aucune discrimination (y compris dans nos pratiques d'embauche et de promotion) fondée sur la race, la religion, la couleur, l'origine nationale, le sexe, l'expression de genre, l'orientation sexuelle, l'âge, l'état civil, le statut d'ancien combattant, le statut de handicap ou toute autre caractéristique protégée par la loi.

Vous serez également éligible à des actions et des avantages sociaux nvidia.com/en-us/benefits/.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter