NVIDIA

Arquitecto Principal, Software de Sistema - Orbital Data Center

PythonC++
Traducción automática. Consulta el original.

Sobre la oportunidad

Space-1 es el primer módulo Orbital Data Center (ODC) de NVIDIA, una plataforma de computación de clase Vera Rubin diseñada para misiones en órbita terrestre baja. Es el primer paso en una hoja de ruta orbital multigeneracional para acelerar la adopción de IA. Buscamos un arquitecto técnico sólido para que se encargue de la arquitectura de software de sistema de extremo a extremo para Space-1 y plataformas orbitales sucesoras. Arquitectará el full stack —desde la aplicación hasta las bibliotecas, desde la pila del centro de datos hasta el firmware BMC y BIOS, la gestionabilidad y la telemetría a través del sistema operativo host, los controladores de GPU y CPU, y CUDA— para ofrecer una plataforma de inferencia lista para producción que opere de manera confiable en el entorno de radiación, ciclos térmicos y operaciones remotas de LEO. Colaborará estrechamente con el equipo de arquitectura de sistemas de hardware orbital, impulsará casos de uso de clientes con operadores de constelaciones, alineará la arquitectura con los requisitos de la misión y llevará los mejores productos de IA orbital al mercado. Únase a nosotros en la vanguardia del avance tecnológico.

¿Qué harás: *

  1. Ser responsable de la arquitectura del sistema para la pila de inferencia y otras aplicaciones que se ejecutan en esta clase de productos y hacerla resiliente a cualquier fallo que ocurra en el espacio. *
  1. Co-arquitectar con el equipo de arquitectura de sistemas de hardware orbital para definir interfaces, particionamiento y compensaciones entre las capas de silicio, placa, firmware, SO y carga de trabajo de IA para misiones LEO de 5 años. *
  1. Ser responsable de la arquitectura de software de sistema de extremo a extremo para Space-1 y módulos sucesores de Orbital Data Center — cubriendo la pila del centro de datos, firmware BMC, BIOS, SO host, controladores GPU/CPU, CUDA, DCGM y telemetría de gestionabilidad como una única pila integrada. *
  1. Definir la arquitectura de gestionabilidad para un centro de datos autónomo e inalcanzable: puesta en marcha remota, actualización de firmware en órbita, redundancia de módulo dual, contención de fallos, recuperación de eventos SEU/SEFI y telemetría para flotas que van desde decenas hasta millones de nodos. *
  1. Arquitectar comportamientos de software de sistema tolerantes a la radiación — manejo de ECC, limpieza de memoria, mitigación de latch-up, recuperación determinista y degradación gradual durante 5 años y hasta ~8,000 ciclos térmicos en órbita sol-síncrona crepúsculo-amanecer. *
  1. Impulsar Redfish, MCTP, PLDM y protocolos de gestión a nivel de constelación en BMC, BIOS y software host para que los clientes puedan operar flotas orbitales con las mismas herramientas que usan en tierra. *
  1. Definir el conjunto mínimo de características de BMC, presupuesto de pines, arquitectura de arranque (opciones de clase M.2 / VPX robusta) y estrategia de redundancia de módulo dual en colaboración con ingeniería de plataforma y mecánica. *
  1. Colaborar con clientes de nube y constelaciones (SpaceX, Blue Origin, Starcloud, Planet, Cowboy Space y otros) para traducir los requisitos de la misión — órbita, ciclo de trabajo, seguridad NSA PHIPs, redes post-cuánticas (CX9), SLAs de inferencia — en una arquitectura de software de plataforma accionable. *
  1. Impulsar la fiabilidad y la optimización en la arquitectura del software de sistema desde el punto de vista de un centro de datos orbital, incluido el funcionamiento correcto durante los períodos de eclipse y las estrategias de retención de energía en reposo. *
  1. Trabajar estrechamente con el equipo de puesta en marcha y resolver problemas a la velocidad de la luz desde el primer silicio hasta el primer lanzamiento. Ser responsable de la calidad, la fiabilidad y el rendimiento de la telemetría del software de sistema entregado con cada módulo ODC enviado a los clientes.

Lo que necesitamos ver: *

  1. Más de 15 años de experiencia relevante en software de sistema de servidor/plataforma — abarcando bibliotecas de computación, firmware BMC, BIOS, SO host, controladores y gestionabilidad. *
  1. BS, MS o PhD en EE/CS o campo de educación relacionado (o experiencia equivalente). *
  1. Experiencia práctica en la construcción de infraestructura y sistemas de IA en el espacio. Historial comprobado de arquitectar y entregar software de plataforma para centros de datos a gran escala o sistemas embebidos de misión crítica. *
  1. Sólido conocimiento de la arquitectura de servidores, la gestionabilidad de centros de datos y la integración full-stack de firmware con SO y software acelerador. Experiencia práctica con flujos de trabajo de gestión de salud de centros de datos, telemetría y gestión de fallos a escala. *
  1. Sólida comprensión de las interfaces de gestión de hardware (USB, SMBus/I2C, PCIe) y competencia con protocolos de gestión modernos, incluidos Redfish, MCTP y PLDM. *
  1. Habilidad sólida y demostrable en C/C++ y Python. *
  1. Experiencia en programación y depuración de plataformas de servidor, incluidos entornos de pre-silicio y puesta en marcha de plataforma. *
  1. Experiencia en SCM (por ejemplo, Git, Perforce) y herramientas de gestión de proyectos como Jira. *
  1. Excelentes habilidades de comunicación escrita y oral, buena ética de trabajo, alto sentido de trabajo en equipo, amor por producir trabajo de calidad y compromiso para finalizar sus tareas cada día. *
  1. Es una persona proactiva que ama encontrar soluciones creativas a problemas complicados y tiene experiencia práctica en codificación.

Formas de destacar entre la multitud: *

  1. Experiencia en arquitectar software de plataforma para entornos espaciales, aeroespaciales, de defensa u otros entornos con restricciones de radiación, térmicas y de vibración — incluida la mitigación de SEU/SEFI, estrategia ECC, calificación TID/SEE y particionamiento de diseño rad-hard. Ser parte de una startup o iniciativa directamente relacionada con centros de datos espaciales. *
  1. Experiencia práctica con operaciones de centros de datos autónomos, remotos o inalcanzables — actualización de firmware en órbita o en campo, redundancia de módulo dual y recuperación sin acceso físico. Experiencia práctica con arquitectura de sistemas x86 o ARM (Grace/Vera) y la pila de software de IA de NVIDIA (CUDA, DCGM, DOCA/OFED, controladores de GPU, DGX OS). *
  1. Familiaridad con la seguridad NSA PHIPs, redes post-cuánticas y estándares aeroespaciales (VPX, MIL-STD shock/vibe, NASA EEE-INST-002). *
  1. Liderazgo técnico demostrado en la dirección de programas complejos a gran escala con más de 50 ingenieros en equipos de firmware, SO, controladores y pila de IA. *
  1. Experto en la revisión de esquemas de hardware y diseños de PCB para depuración, verificación de diseño y colaboración con ingenieros de hardware.

La invención de la GPU por parte de NVIDIA en 1999 impulsó el crecimiento del mercado de juegos de PC, redefinió los gráficos de computadoras modernas y revolucionó la computación paralela. Más recientemente, el deep learning de GPU encendió el deep learning moderno —la próxima era de la computación— con la GPU actuando como el cerebro de computadoras, robots y automóviles autónomos que pueden percibir y comprender el mundo. Hoy en día, somos cada vez más conocidos como "la empresa de computación de IA". Estamos buscando hacer crecer nuestra empresa y establecer equipos con las personas más reflexivas del mundo. NVIDIA está liderando el camino en desarrollos innovadores en Inteligencia Artificial, Computación de Alto Rendimiento y Visualización. Nuestra invención sirve como el córtex visual de las computadoras modernas y está en el corazón de nuestros productos y servicios. Nuestro trabajo abre nuevos universos para explorar, permite una creatividad y descubrimiento asombrosos, y potencia lo que antes eran invenciones de ciencia ficción, desde la inteligencia artificial hasta los coches autónomos. NVIDIA está buscando personas excepcionales como usted para ayudarnos a impulsar la próxima ola de inteligencia artificial.

Su salario base se determinará en función de su ubicación, experiencia y la remuneración de los empleados en puestos similares. El rango salarial base es Entre 272,000 USD y 431,250 USD.

Las solicitudes para este puesto se aceptarán al menos hasta Octubre 2, 2026.

Esta oferta es para una vacante existente.

NVIDIA utiliza herramientas de IA en sus procesos de contratación.

NVIDIA se compromete a fomentar un entorno de trabajo inclusivo y se enorgullece de ser un empleador que ofrece igualdad de oportunidades. Dado que valoramos enormemente la diversidad en nuestros empleados actuales y futuros, no discriminamos (incluso en nuestras prácticas de contratación y promoción) por motivos de raza, religión, color, origen nacional, género, expresión de género, orientación sexual, edad, estado civil, condición de veterano, condición de discapacidad o cualquier otra característica protegida por la ley.

También será elegible para acciones y beneficios nvidia.com/en-us/benefits/.

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores