NVIDIA

Engenheiro(a) Sênior de Software de Sistemas, Desempenho e Escalabilidade Acelerados por Kubernetes - DGX Cloud

PythonAWSGCPKubernetes
Tradução automática. Consulte o original.

Sobre a oportunidade

A NVIDIA tem transformado gráficos de computador, jogos de PC e computação acelerada por mais de 25 anos, impulsionada por ótima tecnologia e pessoas incríveis. Estamos agora aproveitando o potencial ilimitado da IA para definir a próxima era da computação, onde nossas GPUs impulsionam computadores, robôs e carros autônomos que podem entender o mundo. Fazer o que nunca foi feito antes exige visão, inovação e os melhores talentos do mundo. Como um(a) NVIDIAN, você trabalhará em um ambiente diversificado e de apoio, onde as pessoas são incentivadas a fazer o seu melhor trabalho e crescer em suas carreiras. Oferecemos preferência por trabalho híbrido, permanecendo abertos a arranjos remotos, dando-lhe flexibilidade em como você faz o seu melhor trabalho.

Venha se juntar à equipe e veja como você pode causar um impacto duradouro no mundo.

A organização DGX Cloud na NVIDIA reúne inovação de hardware e software de ponta para entregar computação acelerada líder na indústria para as cargas de trabalho de IA mais ambiciosas do mundo. Somos um grupo de engenheiros com visão de futuro, enfrentando alguns dos desafios mais difíceis do mundo, impulsionando o progresso e afetando positivamente milhões de vidas.

Estamos procurando um(a) Engenheiro(a) Sênior de Software de Sistemas com profundo conhecimento em sistemas distribuídos, Kubernetes, contêineres e desempenho e escalabilidade de sistemas.

O(a) candidato(a) ideal traz ampla experiência prática em toda a pilha, incluindo operadores de GPU, plugins de dispositivo, serviço de inferência distribuída e as principais plataformas de nuvem. Você resolverá problemas técnicos difíceis em grande escala e ajudará a moldar como a infraestrutura de IA é executada em produção. Neste papel fundamental, você se concentrará em escalar a infraestrutura de IA, minimizando o custo total de propriedade, reduzindo o custo por token e permitindo futuras inovações de IA e fábricas de IA. Você está pronto(a) para ser impactante?

O que você fará

  1. Liderar a análise de desempenho e escalabilidade de ponta a ponta em toda a pilha de tempo de execução acelerado baseada em Kubernetes (planos de controle e dados), incluindo componentes da NVIDIA como GPU Operator, Network Operator, node-feature-discovery, topograph, dra-driver-nvidia-gpu e nvsentinel, rastreando problemas da orquestração até o hardware.
  1. Projetar e contribuir com alterações arquiteturais upstream para o plano de controle Kubernetes e projetos relacionados para permitir a operação confiável em tamanhos de cluster hiperscala, fazendo em aberto o que os hiperscalers de hoje geralmente fazem privadamente.
  1. Melhorar o tempo de inicialização e o cold-start de contêineres para permitir escalabilidade de inferência suave e de baixa latência em Kubernetes em milhares de nós de GPU, garantindo que a pilha de tempo de execução de IA escale sem criar pressão no servidor API ou fragilidade operacional.
  1. Avaliar, melhorar e contribuir para projetos de código aberto que tornam Kubernetes uma plataforma excepcional para cargas de trabalho de IA (por exemplo, Grove e gateway-api-inference-extension), compondo suas arquiteturas com escalabilidade, resiliência e treinamento/inferência multi-nó em mente.
  1. Avançar a escalabilidade e o desempenho de contêineres confidenciais (CoCo) em Kubernetes para que cargas de trabalho de inferência criptografadas atendam a rigorosos requisitos de eficiência e latência em produção.
  1. Usar DSX e infraestrutura de simulação de larga escala relacionada para modelar implantações completas de fábricas de IA e validar a escalabilidade em milhares de GPUs simuladas, capturando falhas que surgem apenas em escala antes da chegada do hardware.
  1. Colaborar com pesquisadores de IA, desenvolvedores, clientes e comunidades upstream para projetar testes automatizados de carga de trabalho em escala (incluindo replay de traces de agentes de produção), construir ferramentas de monitoramento/análise e integrar testes contínuos de desempenho e escala em fluxos de trabalho modernos de CI/CD.
  1. Documentar métodos e resultados claramente e apresentar descobertas internamente e em eventos da indústria (por exemplo, KubeCon, GTC), enquanto se engaja ativamente com grupos upstream (Kubernetes SIG Scalability, CNCF e comunidades NVIDIA OSS) para influenciar e validar direções de desempenho e escalabilidade de cargas de trabalho de IA.

O que precisamos ver

  1. Bacharelado ou Mestrado em Engenharia ou experiência equivalente, idealmente em Engenharia Elétrica, de Computação ou Ciência da Computação.
  1. 8+ anos de experiência em arquitetura de computadores, redes, sistemas de armazenamento e plataformas baseadas em aceleradores.
  1. Conhecimento em Kubernetes e familiaridade com o ecossistema CNCF mais amplo.
  1. Profundo conhecimento em sistemas de aceleradores distribuídos, paralelos e de larga escala e otimização de desempenho de cargas de trabalho de IA.
  1. Experiência com modelagem de desempenho e benchmarking para sistemas de larga escala.
  1. Proficiência em Golang e/ou Python.
  1. Forte familiaridade com a pilha de software NVIDIA em treinamento e inferência.
  1. Conhecimento em pelo menos um grande provedor de nuvem pública (por exemplo, AWS, Azure, GCP ou OCI).

Formas de se destacar da multidão

  1. Forte experiência operacional com qualquer uma das distribuições Kubernetes.
  1. Experiência anterior em escalar clusters Kubernetes para contagens ultra-grandes de nós e objetos.
  1. Histórico comprovado de trabalho na comunidade de código aberto.
  1. Excelentes habilidades de comunicação e interpessoais.
  1. Doutorado ou experiência equivalente em áreas relevantes.

#LI-Hybrid

As candidaturas para esta vaga serão aceitas pelo menos até 29 de junho de 2026.

Esta publicação é para uma vaga existente.

A NVIDIA utiliza ferramentas de IA em seus processos de recrutamento.

A NVIDIA está comprometida em promover um ambiente de trabalho inclusivo e orgulha-se de ser um empregador que oferece igualdade de oportunidades. Como valorizamos muito a diversidade em nossos funcionários atuais e futuros, não discriminamos (incluindo em nossas práticas de contratação e promoção) com base em raça, religião, cor, origem nacional, gênero, expressão de gênero, orientação sexual, idade, estado civil, status de veterano, status de deficiência ou qualquer outra característica protegida por lei.

Seu salário base será determinado com base em sua localização, experiência e na remuneração de funcionários em posições semelhantes. A faixa salarial base é de 184,000 USD - 287,500 USD para o Nível 4, e 224,000 USD - 356,500 USD para o Nível 5. Você também será elegível para ações e benefícios nvidia.com/en-us/benefits/.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores