StrideCare
NVIDIA
Arquitecto Principal, Software de Sistema - Centro de Datos Orbital
Sobre la oportunidad
Space-1 es el primer módulo de Centro de Datos Orbital (ODC) de NVIDIA, una plataforma de computación de clase Vera Rubin diseñada para misiones en órbita terrestre baja. Es el primer paso en una hoja de ruta orbital multigeneracional para acelerar la adopción de IA. Buscamos un arquitecto técnico sólido para que sea responsable de la arquitectura de software de sistema de extremo a extremo para Space-1 y plataformas orbitales sucesoras. Arquitecturará el full stack —desde la aplicación hasta las bibliotecas, desde la pila del centro de datos hasta el firmware BMC y BIOS, la gestionabilidad y la telemetría a través del sistema operativo anfitrión, los controladores de GPU y CPU, y CUDA— para ofrecer una plataforma de inferencia lista para producción que opere de manera confiable en el entorno de radiación, ciclos térmicos y operaciones remotas de LEO. Colaborará estrechamente con el equipo de arquitectura de sistemas de hardware orbital, impulsará casos de uso de clientes con operadores de constelaciones, alineará la arquitectura con los requisitos de la misión y llevará al mercado los mejores productos de IA orbital. Únase a nosotros en la vanguardia del avance tecnológico.
La invención de la GPU por parte de NVIDIA en 1999 impulsó el crecimiento del mercado de juegos de PC, redefinió los gráficos de computadoras modernas y revolucionó la computación paralela. Más recientemente, el deep learning de GPU encendió el deep learning moderno —la próxima era de la computación—, actuando la GPU como el cerebro de las computadoras, robots y automóviles autónomos que pueden percibir y comprender el mundo. Hoy en día, somos cada vez más conocidos como "la empresa de computación de IA". Buscamos hacer crecer nuestra empresa y establecer equipos con las personas más reflexivas del mundo. NVIDIA está liderando el camino en desarrollos innovadores en Inteligencia Artificial, Computación de Alto Rendimiento y Visualización. Nuestra invención sirve como el córtex visual de las computadoras modernas y está en el corazón de nuestros productos y servicios. Nuestro trabajo abre nuevos universos para explorar, permite una creatividad y descubrimiento asombrosos, y potencia lo que alguna vez fueron invenciones de ciencia ficción, desde la inteligencia artificial hasta los automóviles autónomos. NVIDIA está buscando personas excepcionales como usted para ayudarnos a impulsar la próxima ola de inteligencia artificial.
¿Qué harás: *
- Ser responsable de la arquitectura del sistema para la pila de inferencia y otras aplicaciones que se ejecutan en esta clase de productos y hacerla resiliente a cualquier fallo que ocurra en el espacio. *
- Co-arquitectar con el equipo de arquitectura de sistemas de hardware orbital para definir interfaces, partición y compensaciones entre las capas de silicio, placa, firmware, SO y carga de trabajo de IA para misiones LEO de 5 años. *
- Ser responsable de la arquitectura de software de sistema de extremo a extremo para Space-1 y módulos sucesores de Centro de Datos Orbital — cubriendo la pila del centro de datos, firmware BMC, BIOS, SO anfitrión, controladores GPU/CPU, CUDA, DCGM y telemetría de gestionabilidad como una única pila integrada. *
- Definir la arquitectura de gestionabilidad para un centro de datos inalcanzable y autónomo: puesta en marcha remota, actualización de firmware en órbita, redundancia de doble módulo, contención de fallos, recuperación de eventos SEU/SEFI y telemetría para flotas que van desde decenas hasta millones de nodos. *
- Arquitectar comportamientos de software de sistema tolerantes a la radiación — manejo de ECC, limpieza de memoria, mitigación de latch-up, recuperación determinista y degradación gradual durante 5 años y hasta ~8,000 ciclos térmicos en órbita sol-síncrona crepúsculo-amanecer. *
- Impulsar Redfish, MCTP, PLDM y protocolos de gestión a nivel de constelación en el software BMC, BIOS y anfitrión para que los clientes puedan operar flotas orbitales con las mismas herramientas que usan en tierra. *
- Definir el conjunto mínimo de características BMC, presupuesto de pines, arquitectura de arranque (opciones de clase M.2 / VPX robustas) y estrategia de redundancia de doble módulo en colaboración con ingeniería de plataforma y mecánica. *
- Colaborar con clientes de nube y constelaciones (SpaceX, Blue Origin, Starcloud, Planet, Cowboy Space y otros) para traducir los requisitos de la misión — órbita, ciclo de trabajo, seguridad NSA PHIPs, redes post-cuánticas (CX9), SLAs de inferencia — en una arquitectura de software de plataforma accionable. *
- Impulsar la fiabilidad y la optimización en la arquitectura del software del sistema desde el punto de vista de un centro de datos orbital, incluido el funcionamiento correcto durante los períodos de eclipse y las estrategias de retención de energía en reposo. *
- Trabajar estrechamente con el equipo de puesta en marcha y resolver problemas a la velocidad de la luz desde el primer silicio hasta el primer lanzamiento. Ser responsable de la calidad, fiabilidad y rendimiento de la telemetría del software del sistema entregado con cada módulo ODC enviado a los clientes.
Lo que necesitamos ver: *
- + de 15 años de experiencia relevante en software de sistema de servidor/plataforma — que abarque bibliotecas de computación, firmware BMC, BIOS, SO anfitrión, controladores y gestionabilidad *
- Grado, Máster o Doctorado en EE/CS o campo de estudio relacionado (o experiencia equivalente). *
- Experiencia práctica en la construcción de infraestructura y sistemas de IA en el espacio. Historial comprobado de arquitectar y entregar software de plataforma para centros de datos a gran escala o sistemas integrados de misión crítica. *
- Sólido conocimiento de la arquitectura de servidores, la gestionabilidad de centros de datos y la integración full-stack de firmware con el SO y el software del acelerador. Experiencia práctica con flujos de trabajo de gestión de salud de centros de datos, telemetría y gestión de fallos a escala. *
- Sólida comprensión de las interfaces de gestión de hardware (USB, SMBus/I2C, PCIe) y competencia con protocolos de gestión modernos, incluidos Redfish, MCTP y PLDM. *
- Habilidad sólida y demostrable en C/C++ y Python. *
- Experiencia en programación y depuración de plataformas de servidor, incluidos entornos de pre-silicio y puesta en marcha de plataformas. *
- Experiencia en SCM (por ejemplo, Git, Perforce) y herramientas de gestión de proyectos como Jira. *
- Excelentes habilidades de comunicación escrita y oral, buena ética de trabajo, alto sentido de trabajo en equipo, amor por producir trabajo de calidad y compromiso para terminar sus tareas cada día. *
- Es una persona proactiva a la que le encanta encontrar soluciones creativas a problemas complicados y tiene experiencia práctica en codificación.
Formas de destacar entre la multitud: *
- Experiencia en arquitectar software de plataforma para entornos espaciales, aeroespaciales, de defensa u otros restringidos por radiación, temperatura y vibración — incluida la mitigación de SEU/SEFI, estrategia de ECC, calificación TID/SEE y partición de diseño rad-hard. Haber participado en una startup o iniciativa directamente relacionada con centros de datos espaciales. *
- Experiencia práctica con operaciones de centros de datos autónomos, remotos o inalcanzables — actualización de firmware en órbita o en campo, redundancia de doble módulo y recuperación sin acceso físico. Experiencia práctica con arquitectura de sistemas x86 o ARM (Grace/Vera) y la pila de software de IA de NVIDIA (CUDA, DCGM, DOCA/OFED, controladores de GPU, DGX OS). *
- Familiaridad con la seguridad NSA PHIPs, redes post-cuánticas y estándares aeroespaciales (VPX, MIL-STD shock/vibe, NASA EEE-INST-002). *
- Liderazgo técnico demostrado en la dirección de programas complejos a gran escala con más de 50 ingenieros en equipos de firmware, SO, controladores y pila de IA. *
- Experto en la revisión de esquemas de hardware y diseños de PCB para depuración, verificación de diseño y colaboración con ingenieros de hardware.
Su salario base se determinará en función de su ubicación, experiencia y el pago de empleados en puestos similares. El rango salarial base es 272,000 USD - 431,250 USD.
Las solicitudes para este puesto se aceptarán al menos hasta el 8 de octubre de 2026.
Esta oferta es para una vacante existente.
NVIDIA utiliza herramientas de IA en sus procesos de contratación.
NVIDIA se compromete a fomentar un entorno de trabajo inclusivo y se enorgullece de ser un empleador que ofrece igualdad de oportunidades. Dado que valoramos enormemente la diversidad en nuestros empleados actuales y futuros, no discriminamos (incluso en nuestras prácticas de contratación y promoción) por motivos de raza, religión, color, origen nacional, género, expresión de género, orientación sexual, edad, estado civil, condición de veterano, condición de discapacidad o cualquier otra característica protegida por la ley.
También será elegible para acciones y beneficios nvidia.com/en-us/benefits/.
