Nominal
NVIDIA
Ingeniero Principal de Software, Software de Sistema a Escala de Rack — Colaboraciones con CSP
Sobre la oportunidad
Buscamos un Ingeniero Principal de Software para unirse a nuestro equipo de Colaboraciones con CSP como punto focal técnico para el SW/FW de sistemas a escala de rack, trabajando con los equipos de ingeniería de CSP para garantizar que puedan implementar, monitorizar y operar estos sistemas de forma fiable a escala de flota. En este puesto, colaborarás con los equipos de ingeniería de SW/FW de sistemas a escala de rack multifuncionales de NVIDIA con liderazgo técnico dedicado de cara a los CSP. Tu enfoque estará en el software a nivel de sistema que gestiona, monitoriza y recupera el rack en su conjunto: gestión de la interconexión (fabric), manejo y recuperación de errores de GPU/NVSwitch, telemetría de estado APIs, orquestación de actualizaciones de firmware y servicio impulsado por software. Impulsarás flujos de trabajo con los equipos de ingeniería de CSP para construir una comprensión compartida de la arquitectura, incorporar sus comentarios operativos y garantizar la preparación de la integración.
La invención de la GPU por parte de NVIDIA en 1999 impulsó el crecimiento del mercado de juegos de PC, redefinió los gráficos de computadoras modernas y revolucionó la computación paralela. Más recientemente, el deep learning de GPU encendió la era moderna del deep learning — la próxima era de la computación — con la GPU actuando como el cerebro de computadoras, robots y coches autónomos que pueden percibir y comprender el mundo. Hoy en día, somos cada vez más conocidos como "la empresa de computación de IA". Buscamos hacer crecer nuestra empresa y establecer equipos con las personas más reflexivas del mundo. ¿Estás listo para cambiar la próxima generación de computación? Únete a nosotros en la vanguardia del avance tecnológico.
Los sistemas de centros de datos de NVIDIA, como DGX y HGX, se han convertido en el núcleo de los negocios empresariales y de proveedores de nube en rápido crecimiento de NVIDIA. Estas plataformas reúnen todo el poder de las GPU de NVIDIA, NVIDIA NVLink, la red NVIDIA InfiniBand, las CPU NVIDIA Grace y una pila de software de IA y HPC de NVIDIA completamente optimizada.
¿Qué harás? *
- Impulsar la alineación de la arquitectura de SW/FW a escala de rack en las colaboraciones con CSP, incluyendo el software de gestión de la interconexión, la monitorización del estado de los enlaces, el manejo de errores de GPU/NVSwitch, las funciones de servicio de SW/FW (por ejemplo, soporte de conexión en caliente, aislamiento de componentes, recuperación impulsada por firmware) y la orquestación de firmware de múltiples componentes. *
- Impulsar flujos de trabajo técnicos con los equipos de ingeniería de CSP en software de sistemas a escala de rack, asegurando que comprendan profundamente la gestión de la interconexión, el comportamiento de NVSwitch, las políticas de manejo y recuperación de errores, la telemetría de estado APIs y la operación de recuperación controlada por SW/FW. *
- Capturar y sintetizar los comentarios de ingeniería de CSP sobre el software de sistemas a escala de rack (monitorización de estado APIs, flujos de trabajo de servicio impulsados por software, orquestación de actualizaciones de firmware y comportamiento de recuperación de errores), y defender esos comentarios en las decisiones de arquitectura de NVIDIA. *
- Colaborar con equipos multifuncionales para garantizar que los requisitos operativos del cliente se reflejen en el desarrollo de software y firmware del sistema. *
- Identificar patrones entre CSP en problemas de SW/FW a escala de rack, comportamiento de manejo de errores y prácticas de configuración del sistema, e impulsar mejoras en la documentación, herramientas y estrategia de pruebas como resultado. *
- Colaborar con los equipos de ejecución en la estrategia de "shift-left" (adelantar tareas), asegurando que el trabajo de integración de SW/FW del lado del cliente se identifique pronto y se complete antes de la disponibilidad del hardware. *
- Tomar decisiones técnicas críticas sobre los compromisos (tradeoffs) de SW/FW de sistemas a escala de rack y mitigar los riesgos de ejecución mediante la participación temprana con los equipos de ingeniería de CSP.
¿Qué necesitamos ver? *
- + de 15 años de experiencia en software de sistemas, firmware de plataforma o ingeniería de sistemas distribuidos a gran escala. BS o MS en Ciencias de la Computación, Ingeniería Eléctrica o campo relacionado (o experiencia equivalente). *
- Profundo conocimiento de los desafíos del software de sistemas a escala de rack: coordinación de múltiples componentes, propagación de errores, monitorización de estado y servicio/fiabilidad. *
- Experiencia con software de gestión de la interconexión, gestión de clústeres o marcos de orquestación a nivel de sistema. Familiaridad con arquitecturas de firmware y gestión del ciclo de vida de las actualizaciones (secuenciación de actualizaciones de múltiples componentes, reversión, recuperación). *
- Comprensión de los patrones de diseño de manejo y recuperación de errores en sistemas distribuidos: aislamiento de fallos, políticas de reintento, degradación controlada. *
- Experiencia con sistemas de monitorización de estado y telemetría: puntuación de estado, correlación de eventos, diseño de API para observabilidad a nivel de flota. *
- La comprensión del software de sistemas de GPU o aceleradores (controladores, gestión de dispositivos, gestión de energía) es una gran ventaja. *
- Obsesión por el cliente: pasión genuina por comprender cómo los CSP operan sistemas sofisticados a escala de flota y simplificar su experiencia. *
- Éxito demostrado en proporcionar liderazgo técnico a través de límites organizacionales e influir en el diseño del software del sistema sin autoridad directa. Comunicación sólida: capacidad para traducir la arquitectura compleja del software del sistema en mentoría procesable para los equipos de ingeniería de clientes.
¿Formas de destacar entre la multitud? *
- Experiencia con NVSwitch, NVOS o software de gestión de interconexiones de GPU de NVIDIA. *
- Experiencia en software de sistemas para clústeres a gran escala en un hiperescalador (gestión de clústeres, orquestación de flotas, plataformas de estado). *
- Experiencia en la creación de marcos de manejo y recuperación de errores para sistemas de múltiples componentes (cientos o miles de dispositivos coordinados). *
- Familiaridad con operaciones de flotas de GPU o aceleradores: ciclo de vida de controladores, estrategias de implementación de firmware, programación basada en el estado. *
- Comprensión de cómo las decisiones de software del sistema impactan la capacidad de servicio, la disponibilidad y el costo operativo a escala de flota.
Tu salario base se determinará en función de tu ubicación, experiencia y la remuneración de los empleados en puestos similares. El rango salarial base es 272,000 USD - 431,250 USD.
Las solicitudes para este puesto se aceptarán al menos hasta Octubre 8, 2026.
Esta oferta corresponde a una vacante existente.
NVIDIA utiliza herramientas de IA en sus procesos de contratación.
NVIDIA se compromete a fomentar un entorno de trabajo inclusivo y se enorgullece de ser un empleador que ofrece igualdad de oportunidades. Dado que valoramos enormemente la diversidad en nuestros empleados actuales y futuros, no discriminamos (incluyendo en nuestras prácticas de contratación y promoción) por motivos de raza, religión, color, origen nacional, género, expresión de género, orientación sexual, edad, estado civil, condición de veterano, condición de discapacidad o cualquier otra característica protegida por la ley.
También serás elegible para acciones y beneficios nvidia.com/en-us/benefits/.
