Roku
NVIDIA
Architecte Principal, Logiciel Système - Orbital Data Center
À propos du poste
Space-1 est le premier module Orbital Data Center (ODC) de NVIDIA — une plateforme de calcul de classe Vera Rubin conçue pour les missions en orbite terrestre basse. C'est la première étape d'une feuille de route orbitale multigénérationnelle visant à accélérer l'adoption de l'IA. Nous recherchons un architecte technique solide pour superviser l'architecture logicielle système de bout en bout pour Space-1 et les plateformes orbitales ultérieures. Vous architecturerez la pile full stack — de l'application aux bibliothèques, de la pile du centre de données au firmware BMC et BIOS, la gestion et la télémétrie via le système d'exploitation hôte, les pilotes GPU et CPU, et CUDA — pour fournir une plateforme d'inférence prête pour la production qui fonctionne de manière fiable dans l'environnement de radiations, de cycles thermiques et d'opérations à distance de LEO. Vous collaborerez étroitement avec l'équipe d'architecture système matérielle orbitale, piloterez les cas d'utilisation clients avec les opérateurs de constellations, alignerez l'architecture sur les exigences de la mission et commercialiserez les meilleurs produits d'IA orbitale. Rejoignez-nous à l'avant-garde du progrès technologique.
L'invention du GPU par NVIDIA en 1999 a stimulé la croissance du marché du jeu sur PC, a redéfini l'infographie moderne et a révolutionné le calcul parallèle. Plus récemment, le deep learning sur GPU a déclenché le deep learning moderne — la prochaine ère de l'informatique — le GPU agissant comme le cerveau des ordinateurs, des robots et des voitures autonomes capables de percevoir et de comprendre le monde. Aujourd'hui, nous sommes de plus en plus reconnus comme « l'entreprise de l'informatique IA ». Nous cherchons à développer notre entreprise et à constituer des équipes composées des personnes les plus réfléchies au monde. NVIDIA est à la pointe des développements révolutionnaires en intelligence artificielle, en calcul haute performance et en visualisation. Notre invention sert de cortex visuel aux ordinateurs modernes et est au cœur de nos produits et services. Notre travail ouvre de nouveaux univers à explorer, permet une créativité et des découvertes incroyables, et alimente ce qui relevait autrefois de la science-fiction, de l'intelligence artificielle aux voitures autonomes. NVIDIA recherche des personnes exceptionnelles comme vous pour nous aider à mener la prochaine vague d'intelligence artificielle.
Ce que vous ferez : *
- Superviser l'architecture système pour la pile d'inférence et les autres applications exécutées sur cette classe de produits et la rendre résiliente à toute défaillance survenant dans l'espace. *
- Co-architecturer avec l'équipe d'architecture système matérielle orbitale pour définir les interfaces, le partitionnement et les compromis entre les couches silicium, carte, firmware, OS et charge de travail IA pour des missions LEO de 5 ans. *
- Superviser l'architecture logicielle système de bout en bout pour Space-1 et les modules Orbital Data Center successeurs — couvrant la pile du centre de données, le firmware BMC, le BIOS, l'OS hôte, les pilotes GPU/CPU, CUDA, DCGM, et la télémétrie de gestion en tant que pile intégrée unique. *
- Définir l'architecture de gestion pour un centre de données inaccessible et autonome : mise en service à distance, mise à jour du firmware en orbite, redondance à double module, confinement des fautes, récupération des événements SEU/SEFI, et télémétrie pour des flottes allant de dizaines à des millions de nœuds. *
- Architecturer les comportements du logiciel système tolérants aux radiations — gestion ECC, nettoyage de mémoire, atténuation des verrouillages, récupération déterministe et dégradation progressive sur 5 ans et jusqu'à environ 8,000 cycles thermiques en orbite héliosynchrone aube-crépuscule. *
- Piloter les protocoles de gestion Redfish, MCTP, PLDM et de niveau constellation à travers le BMC, le BIOS et le logiciel hôte afin que les clients puissent exploiter les flottes orbitales avec les mêmes outils qu'au sol. *
- Définir l'ensemble minimum de fonctionnalités BMC, le budget de broches, l'architecture de démarrage (options de classe M.2 / VPX robustes) et la stratégie de redondance à double module en partenariat avec l'ingénierie plateforme et mécanique. *
- Collaborer avec les clients cloud et constellations (SpaceX, Blue Origin, Starcloud, Planet, Cowboy Space, et autres) pour traduire les exigences de mission — orbite, cycle de service, sécurité NSA PHIPs, réseau post-quantique (CX9), SLA d'inférence — en une architecture logicielle plateforme actionnable. *
- Piloter la fiabilité et l'optimisation de l'architecture logicielle système du point de vue d'un centre de données orbital, y compris le fonctionnement correct pendant les périodes d'éclipse et les stratégies de rétention de puissance au ralenti. *
- Travailler en étroite collaboration avec l'équipe de mise en service et résoudre les problèmes à la vitesse de la lumière, du premier silicium au premier lancement. Assurer la qualité, la fiabilité et les performances de télémétrie du logiciel système livré avec chaque module ODC expédié aux clients.
Ce que nous devons voir : *
- 15+ années d'expérience pertinente en logiciel système serveur/plateforme — couvrant les bibliothèques de calcul, le firmware BMC, le BIOS, l'OS hôte, les pilotes et la gestion. *
- Licence, Master ou Doctorat en EE/CS ou domaine d'études connexe (ou expérience équivalente). *
- Expérience pratique dans la construction d'infrastructures et de systèmes d'IA dans l'espace. Dossier prouvé d'architecture et de livraison de logiciels plateforme pour des centres de données à grande échelle ou des systèmes embarqués critiques. *
- Solide connaissance de l'architecture serveur, de la gestion des centres de données et de l'intégration full-stack du firmware avec l'OS et le logiciel accélérateur. Expérience pratique des flux de travail de gestion de la santé des centres de données, de la télémétrie et de la gestion des fautes à grande échelle. *
- Compréhension solide des interfaces de gestion matérielle (USB, SMBus/I2C, PCIe) et maîtrise des protocoles de gestion modernes, y compris Redfish, MCTP et PLDM. *
- Compétence solide et démontrable en C/C++ et Python. *
- Expérience en programmation et débogage de plateformes serveur, y compris les environnements de pré-silicium et de mise en service de plateforme. *
- Expérience en SCM (par ex. Git, Perforce) et en outils de gestion de projet comme Jira. *
- Excellentes compétences en communication écrite et orale, bonne éthique de travail, grand sens du travail d'équipe, plaisir à produire un travail de qualité et engagement à terminer vos tâches chaque jour. *
- Vous êtes un leader autonome qui aime trouver des solutions créatives à des problèmes compliqués et qui est pratique en codage.
Pour vous démarquer : *
- Expérience en architecture de logiciels plateforme pour l'espace, l'aérospatiale, la défense ou d'autres environnements contraints par les radiations, la température et les vibrations — y compris l'atténuation SEU/SEFI, la stratégie ECC, la qualification TID/SEE et le partitionnement de conception rad-hard. Participation à une startup ou à une initiative directement liée aux centres de données spatiaux. *
- Expérience pratique des opérations de centres de données autonomes, à distance ou inaccessibles — mise à jour du firmware en orbite ou sur le terrain, redondance à double module et récupération sans accès physique. Expérience pratique avec l'architecture système x86 ou ARM (Grace/Vera) et la pile logicielle IA de NVIDIA (CUDA, DCGM, DOCA/OFED, pilotes GPU, OS DGX). *
- Connaissance de la sécurité NSA PHIPs, des réseaux post-quantiques et des normes aérospatiales (VPX, MIL-STD choc/vibration, NASA EEE-INST-002). *
- Leadership technique avéré dans la conduite de programmes complexes à grande échelle avec plus de 50 ingénieurs couvrant les équipes firmware, OS, pilotes et pile IA. *
- Compétences en revue de schémas matériels et de conceptions de circuits imprimés pour le débogage, la vérification de conception et la collaboration avec les ingénieurs matériels.
Votre salaire de base sera déterminé en fonction de votre localisation, de votre expérience et de la rémunération des employés occupant des postes similaires. La fourchette de salaire de base est 272,000 USD - 431,250 USD.
Les candidatures pour ce poste seront acceptées au moins jusqu'au 8 octobre 2026.
Cette offre concerne un poste vacant existant.
NVIDIA utilise des outils d'IA dans ses processus de recrutement.
NVIDIA s'engage à favoriser un environnement de travail inclusif et est fier d'être un employeur garantissant l'égalité des chances. Comme nous accordons une grande importance à la diversité de nos employés actuels et futurs, nous ne faisons aucune discrimination (y compris dans nos pratiques d'embauche et de promotion) fondée sur la race, la religion, la couleur, l'origine nationale, le sexe, l'expression de genre, l'orientation sexuelle, l'âge, l'état civil, le statut d'ancien combattant, le statut de handicap ou toute autre caractéristique protégée par la loi.
Vous serez également éligible à des actions et à des avantages sociaux nvidia.com/en-us/benefits/.
