NVIDIA

Ingeniero Senior de Comunicaciones para Frameworks de Deep Learning

PythonC++
Traducción automática. Consulta el original.

Sobre la oportunidad

NVIDIA está liderando el camino en avances innovadores en Inteligencia Artificial, Computación de Alto Rendimiento y Visualización. La GPU, nuestra invención, sirve como el córtex visual de las computadoras modernas y está en el corazón de nuestros productos y servicios. Nuestro trabajo abre nuevos universos para explorar, permite una creatividad y descubrimiento asombrosos, y potencia lo que antes eran invenciones de ciencia ficción, desde la inteligencia artificial hasta los coches autónomos.

Buscamos un ingeniero de Deep Learning motivado para incorporar tecnologías de comunicación avanzadas en stacks de IA, incluyendo PyTorch, TRT-LLM, vLLM, SGLang, JAX, etc. Trabajarás con el equipo que creó bibliotecas de comunicación como NCCL, NVSHMEM y tecnología como GPUDirect, para escalar aplicaciones de Deep Learning y HPC. Tus clientes tendrán diversas demandas multi-GPU, que van desde el entrenamiento a escalas de hasta 100K GPUs hasta la inferencia con latencias de microsegundos. El rendimiento de la comunicación entre las GPUs tiene un impacto directo en las aplicaciones de IA. Tu trabajo en toolkits de IA facilitará todo esto para la comunidad. Esta es una oportunidad excepcional para alguien con experiencia en IA de avanzar el estado del arte en este campo. ¿Estás listo para contribuir al desarrollo de tecnologías innovadoras y ayudar a hacer realidad la visión de NVIDIA?

¿Qué harás?

  1. Integrar nuevas funcionalidades de bibliotecas de comunicación en frameworks de IA: desde PoC hasta análisis de rendimiento y producción.
  1. Realizar un análisis profundo de cargas de trabajo y frameworks de IA para identificar requisitos y oportunidades de comunicación multi-GPU. Colaborar de forma práctica con equipos que trabajan en los últimos modelos de IA.
  1. Mejorar compiladores de IA para ocultar comunicaciones o realizar fusiones automáticas.
  1. Realizar caracterización de rendimiento en profundidad de cargas de trabajo de IA en clústeres multi-GPU.
  1. Diseñar soluciones tolerantes a fallos y elásticas para cargas de trabajo de IA a gran escala o dinámicas.
  1. Crear kernels de comunicación personalizados o de cómputo-comunicación fusionados para mostrar el máximo rendimiento en plataformas NV.
  1. Influir en la hoja de ruta de las bibliotecas de comunicación: NCCL y NVSHMEM.
  1. Colaborar con un equipo muy dinámico en múltiples zonas horarias.

Lo que necesitamos ver

  1. Grado, Máster o Doctorado en Ciencias de la Computación o campo relacionado (o experiencia equivalente) con más de 8 años de experiencia en ingeniería de software y HPC/IA.
  1. Experiencia en desarrollo o integración con Frameworks de Deep Learning como PyTorch, JAX, y Motores de Inferencia como TRT-LLM, vLLM, SGLang.
  1. Prototipado y desarrollo rápido con Python, C++, CUDA o DSLs relacionados (Triton, cuTe).
  1. Sólida comprensión de modelos de IA, paralelismos y/o tecnologías de compiladores (por ejemplo, torch.compile).
  1. Experiencia en la realización de benchmarks de rendimiento en clústeres de IA. Familiaridad con al menos una herramienta de perfilado de rendimiento (PyTorch profiler, NVIDIA Nsight Systems).
  1. Comprensión de conceptos de comunicación HPC/IA (comunicación 1-lado vs 2-lado, elasticidad, resiliencia, descubrimiento de topología, etc.).
  1. Adaptabilidad y pasión por aprender nuevas áreas y herramientas.
  1. Flexibilidad para trabajar y comunicarse eficazmente entre diferentes equipos y zonas horarias.

Formas de destacar

  1. Experiencia en programación paralela en al menos un runtime de comunicación (NCCL, NVSHMEM, MPI). Buena comprensión de la arquitectura de sistemas informáticos, interacciones HW-SW y principios de sistemas operativos (es decir, fundamentos de software de sistemas).
  1. Experiencia en una o más de estas áreas: Entrenamiento, Inferencia distribuida, MoE, Aprendizaje por Refuerzo, autoría de kernels (en CUDA, Triton, cuTe, etc.). Experiencia en programación para solapamiento de cómputo y comunicación en runtimes distribuidos.
  1. Experiencia con la coincidencia de patrones y el lowering de compiladores de IA. Sólida comprensión de la jerarquía de memoria, el modelo de consistencia y la disposición de tensores.

Tu salario base se determinará en función de tu ubicación, experiencia y el pago de empleados en puestos similares. El rango salarial base es de 184,000 USD - 287,500 USD para el Nivel 4, y de 224,000 USD - 356,500 USD para el Nivel 5.

Las solicitudes para este puesto se aceptarán al menos hasta el 2 de octubre de 2026.

Esta oferta es para una vacante existente.

NVIDIA utiliza herramientas de IA en sus procesos de reclutamiento.

NVIDIA se compromete a fomentar un entorno de trabajo inclusivo y se enorgullece de ser un empleador que ofrece igualdad de oportunidades. Dado que valoramos enormemente la diversidad en nuestros empleados actuales y futuros, no discriminamos (incluyendo en nuestras prácticas de contratación y promoción) por motivos de raza, religión, color, origen nacional, género, expresión de género, orientación sexual, edad, estado civil, condición de veterano, condición de discapacidad o cualquier otra característica protegida por la ley.

También serás elegible para acciones y beneficios nvidia.com/en-us/benefits/.

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores