NVIDIA

Distinguished Engineer, Storage – AI Cloud

PythonC++RustGo
Tradução automática. Consulte o original.

Armazenamento de Dados em Nuvem para IA

A NVIDIA tem transformado a computação gráfica, os jogos para PC e a computação acelerada há mais de 25 anos. É um legado único de inovação impulsionado por uma tecnologia excelente e pessoas incríveis. Hoje, estamos explorando o potencial ilimitado da IA para definir a próxima era da computação. Uma era em que nossa GPU atua como o cérebro de computadores, robôs e carros autônomos capazes de compreender o mundo. Fazer o que nunca foi feito antes exige visão, inovação e os melhores talentos do mundo. Como um NVIDIAN, você estará imerso em um ambiente diversificado e de apoio, onde todos são inspirados a realizar seu melhor trabalho. Venha fazer parte da equipe e veja como você pode causar um impacto duradouro no mundo.

A organização de armazenamento DGXC da NVIDIA lida com algumas das tarefas de treinamento e inferência mais rápidas do mercado. Cada ciclo de GPU depende de uma plataforma de armazenamento construída para manter dezenas de milhares de aceleradores ocupados continuamente. Ela mantém exabytes de dados com segurança e impulsiona as maiores cargas de trabalho de IA em todo o mundo em configurações de nuvem, neocloud e on-prem. Com o crescimento da computação acelerada, o armazenamento é essencial. Ele pode ser a diferença entre o uso eficaz da GPU e o potencial desperdiçado, e entre lançar um modelo de fronteira no prazo ou perder o prazo por meses.

Estamos em busca de um Distinguished Engineer para liderar a estratégia de armazenamento da NVIDIA para IA em Nuvem em todo o ecossistema de Provedores de Neocloud (NCP) e Provedores de Serviços em Nuvem (CSP). Você direcionará a arquitetura de sistemas de arquivos paralelos de alto desempenho, armazenamento de objetos e armazenamento em bloco em escala de exabytes. Você manterá uma atuação prática, colaborando com engenheiros, SREs, parceiros e fornecedores de armazenamento. Você aplicará as ferramentas de IA da NVIDIA para aumentar sua produtividade e a daqueles que você impacta. Esta é uma oportunidade distinta para estabelecer a estrutura de armazenamento da era da IA na empresa que introduziu a computação acelerada.

O que você fará

  1. Liderar o plano técnico plurianual para a expansão do Armazenamento em Nuvem para IA em NCPs — determinar a arquitetura de referência, capacidades, SLOs de desempenho e durabilidade, metodologia de qualificação e o roteiro para o armazenamento de arquivos, objetos e blocos de alto desempenho que cada NCP deve oferecer para se qualificar para a alocação de GPU da NVIDIA.
  1. Atuar como o arquiteto-chefe de armazenamento com profundo envolvimento prático. Liderar revisões importantes de construções de armazenamento e investigar as causas raízes de problemas complexos de produção. Desenvolver implementações de referência de protótipos para minimizar riscos em novas iniciativas. Tomar decisões técnicas finais sobre entregas de armazenamento de NCP usando SLOs mensuráveis. Aplicar intensamente ferramentas de IA para ampliar sua influência técnica em todo o programa.
  1. Definir o padrão para "pronto para produção" no armazenamento de NCP, incluindo SLOs de durabilidade e disponibilidade medidos em 9s. Garantir eficiência sustentada por TiB, observabilidade, contenção de raio de explosão e redução de trabalho operacional. Influenciar a liberação de GPU exigindo que a Nuvem de IA aceite a capacidade de GPU apenas após verificar serviços auxiliares focados em armazenamento.
  1. Desenvolver e orientar a direção arquitetônica trabalhando em estreita colaboração com colaboradores nas linhas de produtos de treinamento, inferência e computação acelerada. Coordenar com colegas de confiabilidade de site, operações, rede e segurança. Trabalhar em conjunto com provedores de nuvem externos, operadores de neocloud e fornecedores de armazenamento para alinhar uma arquitetura comum.
  1. Desenvolver o caminho de código aberto para o armazenamento de IA. Estabelecer e orientar uma estratégia de código aberto que amplie o ecossistema de armazenamento de IA. Defender uma postura de segurança em primeiro lugar e GitHub em primeiro lugar. Envolver-se profundamente com comunidades de código aberto upstream. Formalizar as APIs, SDKs e protocolos que permitem que parceiros e o setor construam, integrem e criem com a NVIDIA no nível de armazenamento de IA.
  1. Liderar uma cultura de engenharia centrada em ferramentas de IA. Usar regularmente ferramentas modernas de codificação e agentes de IA em suas tarefas diárias. Mostrar o que significa engenharia 10× na NVIDIA. Distribuir padrões, prompts e harnesses de avaliação em toda a organização de armazenamento.
  1. Fazer parceria com outros Distinguished e Principal storage architects em toda a organização para enfrentar os desafios técnicos mais difíceis e de longo prazo. Tornar a automação a única solução aceitável para tarefas de gerenciamento de infraestrutura, como atualizações de software ao vivo, substituições de nós e unidades, rebalanceamento de capacidade, movimentação de dados entre datacenters e ciclo de vida de conjuntos de dados. Estabelecer rigor na análise de causa raiz e ações corretivas em cada incidente importante. Projetar a camada de armazenamento para cargas de trabalho que abrangem as próximas gerações de GPU, incluindo inferência desagregada com cache KV suportado por armazenamento, padrões de inferência de gravação única e leitura múltipla em larga escala, armazenamento de objetos regional em escala de exabytes e versionamento e gerenciamento de cópias de conjuntos de dados entre datacenters.
  1. Orientar e desenvolver engenheiros seniores, principais e distintos em toda a organização de armazenamento e unidades de negócios próximas. Elevar o nível técnico de forma ampla. Representar a NVIDIA externamente em órgãos de padronização, comunidades de código aberto, briefings de clientes e fóruns do setor (FAST, SC, OCP, SNIA, Linux Storage Summit).

O que precisamos ver

  1. Bacharelado, Mestrado ou Doutorado em Ciência da Computação, Engenharia Elétrica ou área relacionada — ou experiência equivalente.
  1. É necessário um mínimo de 18+ anos de experiência prática em engenharia em tecnologia de armazenamento. Isso envolve envolvimento extensivo com um sistema de arquivos paralelo de alto desempenho como Lustre, GPFS / Spectrum Scale, WEKA, VAST, BeeGFS, DAOS ou equivalente, lidando com dados em escala de vários petabytes. Os candidatos também devem ter ampla experiência em armazenamento de objetos (classe S3 / Swift) e armazenamento em bloco (NVMe-oF, classe NVMesh, iSCSI).
  1. Histórico comprovado de criação e gerenciamento de plataformas de armazenamento em escala de exabytes para cargas de trabalho críticas de desempenho — treinamento de IA, HPC, vídeo ou data lakes de hiperescala — incluindo responsabilidade direta por SLOs de durabilidade, disponibilidade e desempenho medidos em 9s.
  1. Capacidade demonstrada de definir estratégia técnica em unidades de negócios e organizações parceiras. Você conduziu arquiteturas de armazenamento plurianuais adotadas por várias equipes, fornecedores ou clientes. Você pode apontar resultados mensuráveis, como aumento da utilidade da GPU, redução de $/PB, eliminação de incidentes e tempo de implementação reduzido.
  1. Você é 100% prático em engenharia. Você mesmo escreve e revisa código de produção. Quando um bug exige, você lê o código-fonte de Lustre, NFS, kernel, NVMe-oF ou SPDK. Você também executa testes de escala ou exercícios de recuperação pessoalmente, em vez de delegar.
  1. Proficiência sólida em pelo menos uma linguagem de sistemas (C, C++, Rust ou Go) e proficiência em Python; confortável nas pilhas de armazenamento e rede do kernel Linux (camada de bloco, RDMA / RoCE / InfiniBand, NVMe, cache de página, VFS, multipath).
  1. Uso diário frequente de ferramentas avançadas de codificação e autônomas de IA, incluindo exemplos específicos que mostram como você acelerou a construção, codificação, depuração, validação e operações. Além disso, compartilhe sua perspectiva sobre as tendências futuras.
  1. Excelente comunicação escrita e verbal. Você pode escrever um documento de uma página que alinhe um VP. Você também pode escrever um documento de seis páginas que alinhe uma organização inteira. Você pode explicar uma troca técnica profunda para um SRE, um CTO de fornecedor e um cliente interno na mesma semana.
  1. Conforto em operar em um ambiente de produção 24/7 onde incidentes de armazenamento impactam diretamente a receita de GPU, com uma abordagem de segurança em primeiro lugar incorporada em cada construção.

Formas de se destacar

  1. Histórico comprovado no projeto ou gerenciamento de soluções de armazenamento para treinamento ou inferência de IA em escala de 10k+ GPUs, demonstrando melhorias claras na utilização da GPU ou reduzindo gargalos de E/S.
  1. Contribuições de código aberto ou manutenção em Lustre, NFS, SPDK, NVMe / NVMe-oF, CSI, Ceph, MinIO, RocksDB ou projetos relacionados.
  1. Construiu ou liderou uma arquitetura de armazenamento de inferência desagregada ou computação em tempo de inferência — cache KV para armazenamento rápido em cluster ou adjacente à GPU, WORM em escala, agendamento com reconhecimento de armazenamento ou inferência integrada a banco de dados.
  1. Contribuições técnicas públicas — patentes, artigos revisados por pares (FAST, SOSP, NSDI, OSDI, ATC), palestras principais ou RFCs — que demonstram experiência e liderança em armazenamento para infraestrutura de IA.

A NVIDIA liderou o caminho na computação acelerada. Hoje, nossa infraestrutura de IA impulsiona a inteligência global, mudando setores em todo o mundo. O grupo de Armazenamento em Nuvem para IA forma a base que mantém a produtividade da maior frota de GPUs do mundo. Cada modelo treinado, cada inferência servida e cada ponto de verificação salvo passa pelos sistemas que desenvolvemos, construímos e gerenciamos.

Amplamente considerada como um dos empregadores mais desejáveis do mundo da tecnologia, a NVIDIA oferece salários altamente competitivos e um pacote de benefícios abrangente. Ao planejar seu futuro, veja o que podemos oferecer a você e sua família nvidiabenefits.com/ nvidiabenefits.com/

Você também será elegível para ações e benefícios nvidia.com/en-us/benefits/.

Seu salário base será determinado com base em sua localização, experiência e na remuneração de funcionários em cargos semelhantes. A faixa salarial base é 320,000 USD - 488,750 USD.

As candidaturas para esta vaga serão aceitas pelo menos até 28 de setembro de 2026.

Esta publicação é para uma vaga existente.

A NVIDIA usa ferramentas de IA em seus processos de recrutamento.

A NVIDIA está comprometida em promover um ambiente de trabalho inclusivo e orgulha-se de ser um empregador que oferece oportunidades iguais. Como valorizamos muito a diversidade em nossos funcionários atuais e futuros, não discriminamos (inclusive em nossas práticas de contratação e promoção) com base em raça, religião, cor, origem nacional, gênero, expressão de gênero, orientação sexual, idade, estado civil, status de veterano, status de deficiência ou qualquer outra característica protegida por lei.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores