NVIDIA

Engenheiro de Software Principal, Software de Sistema em Escala de Rack — Engajamentos CSP

Tradução automática. Consulte o original.

Sobre a oportunidade

Estamos em busca de um Engenheiro de Software Principal para integrar nossa equipe de Engajamentos CSP como ponto focal técnico para SW/FW de sistemas em escala de rack, trabalhando com equipes de engenharia de CSP para garantir que elas possam implantar, monitorar e operar esses sistemas de forma confiável em escala de frota. Nesta função, você colaborará com as equipes multifuncionais de engenharia de SW/FW de sistemas em escala de rack da NVIDIA com liderança técnica dedicada voltada para CSP. Seu foco será o software de nível de sistema que gerencia, monitora e recupera o rack como um todo — gerenciamento de fabric, tratamento de erros e recuperação de GPU/NVSwitch, telemetria de integridade APIs, orquestração de atualização de firmware e capacidade de manutenção orientada por software. Você conduzirá fluxos de trabalho com as equipes de engenharia de CSP para construir um entendimento compartilhado da arquitetura, incorporar o feedback operacional delas e garantir a prontidão para a integração.

A invenção da GPU pela NVIDIA em 1999 impulsionou o crescimento do mercado de jogos de PC, redefiniu os gráficos de computadores modernos e revolucionou a computação paralela. Mais recentemente, o deep learning impulsionado por GPU inaugurou a era moderna do deep learning — a próxima era da computação — com a GPU atuando como o cérebro de computadores, robôs e carros autônomos que podem perceber e entender o mundo. Hoje, somos cada vez mais conhecidos como "a empresa de computação de IA". Estamos procurando expandir nossa empresa e estabelecer equipes com as pessoas mais ponderadas do mundo. Você está pronto para mudar a próxima geração de computação? Junte-se a nós na vanguarda do avanço tecnológico.

Os sistemas de data center da NVIDIA, como DGX e HGX, tornaram-se centrais para os negócios corporativos e de provedores de nuvem em rápido crescimento da NVIDIA. Essas plataformas reúnem todo o poder das GPUs NVIDIA, NVIDIA NVLink, rede NVIDIA InfiniBand, CPUs NVIDIA Grace e uma pilha de software NVIDIA AI e HPC totalmente otimizada.

O que você fará: *

  1. Conduzir o alinhamento da arquitetura de SW/FW em escala de rack entre os engajamentos CSP — incluindo software de gerenciamento de fabric, monitoramento de integridade de links, tratamento de erros de GPU/NVSwitch e recursos de capacidade de serviço de SW/FW (por exemplo, suporte a hot-plug, isolamento de componentes, recuperação impulsionada por firmware) e orquestração de firmware de múltiplos componentes *
  1. Conduzir fluxos de trabalho técnicos com equipes de engenharia CSP em software de sistema em escala de rack — garantindo que elas entendam profundamente o gerenciamento de fabric, o comportamento do NVSwitch, as políticas de tratamento de erros e recuperação, a telemetria de integridade APIs e a operação de recuperação controlada por SW/FW *
  1. Capturar e sintetizar o feedback de engenharia CSP sobre software de sistema em escala de rack — telemetria de integridade APIs, fluxos de trabalho de capacidade de serviço impulsionados por software, orquestração de atualização de firmware e comportamento de recuperação de erros — e defender esse feedback nas decisões de arquitetura da NVIDIA *
  1. Colaborar com equipes multifuncionais para garantir que os requisitos operacionais do cliente sejam refletidos no desenvolvimento de software e firmware do sistema *
  1. Identificar padrões entre CSPs em problemas de SW/FW em escala de rack, comportamento de tratamento de erros e práticas de configuração de sistema — impulsionar melhorias na documentação, ferramentas e estratégia de teste como resultado *
  1. Colaborar com equipes de execução na estratégia de "left-shift" — garantindo que o trabalho de integração de SW/FW do lado do cliente seja identificado precocemente e concluído antes da disponibilidade do hardware *
  1. Tomar decisões técnicas críticas sobre trade-offs de SW/FW de sistemas em escala de rack e mitigar riscos de execução através de engajamento precoce com equipes de engenharia CSP

O que precisamos ver: *

  1. 15+ anos de experiência em software de sistema, firmware de plataforma ou engenharia de sistemas distribuídos em larga escala. BS ou MS em Ciência da Computação, Engenharia Elétrica ou área relacionada (ou experiência equivalente) *
  1. Profundo entendimento dos desafios de software de sistemas em escala de rack: coordenação de múltiplos componentes, propagação de erros, monitoramento de integridade e capacidade de serviço / confiabilidade *
  1. Experiência com software de gerenciamento de fabric, gerenciamento de cluster ou frameworks de orquestração em nível de sistema. Familiaridade com arquiteturas de firmware e gerenciamento do ciclo de vida de atualização (sequenciamento de atualização de múltiplos componentes, rollback, recuperação) *
  1. Entendimento de padrões de design de tratamento de erros e recuperação em sistemas distribuídos — isolamento de falhas, políticas de retentativa, degradação graciosa *
  1. Experiência com sistemas de monitoramento de integridade e telemetria: pontuação de integridade, correlação de eventos, design de API para observabilidade em nível de frota *
  1. Entendimento de software de sistema de GPU ou acelerador (drivers, gerenciamento de dispositivos, gerenciamento de energia) é um forte diferencial *
  1. Obsessão pelo cliente — paixão genuína por entender como os CSPs operam sistemas sofisticados em escala de frota e simplificar a experiência deles *
  1. Sucesso comprovado em fornecer liderança técnica em fronteiras organizacionais e influenciar o design de software de sistema sem autoridade direta. Forte comunicação — capacidade de traduzir arquitetura complexa de software de sistema em mentoria acionável para equipes de engenharia de clientes

Formas de se destacar na multidão: *

  1. Experiência com software de gerenciamento de fabric NVSwitch, NVOS ou GPU da NVIDIA *
  1. Experiência em software de sistema para clusters em larga escala em um hiperescala (gerenciamento de cluster, orquestração de frota, plataformas de integridade) *
  1. Experiência na criação de frameworks de tratamento de erros e recuperação para sistemas de múltiplos componentes (centenas ou milhares de dispositivos coordenados) *
  1. Familiaridade com operações de frota de GPUs ou aceleradores — ciclo de vida de drivers, estratégias de implantação de firmware, agendamento baseado em integridade *
  1. Entendimento de como as decisões de software de sistema impactam a capacidade de serviço, a disponibilidade e o custo operacional em escala de frota

Seu salário base será determinado com base em sua localização, experiência e na remuneração de funcionários em posições semelhantes. A faixa salarial base é 272,000 USD - 431,250 USD.

As inscrições para esta vaga serão aceitas pelo menos até Outubro 8, 2026.

Esta publicação é para uma vaga existente.

A NVIDIA utiliza ferramentas de IA em seus processos de recrutamento.

A NVIDIA está comprometida em promover um ambiente de trabalho inclusivo e se orgulha de ser um empregador que oferece igualdade de oportunidades. Como valorizamos muito a diversidade em nossos funcionários atuais e futuros, não discriminamos (incluindo em nossas práticas de contratação e promoção) com base em raça, religião, cor, origem nacional, gênero, expressão de gênero, orientação sexual, idade, estado civil, status de veterano, status de deficiência ou qualquer outra característica protegida por lei.

Você também será elegível para ações e benefícios nvidia.com/en-us/benefits/.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores