Roku
NVIDIA
Engenheiro Distinto, Armazenamento – AI Cloud
Armazenamento de Dados em Nuvem de IA
NVIDIA tem transformado gráficos de computador, jogos de PC e computação acelerada por mais de 25 anos. É um legado único de inovação impulsionado por ótima tecnologia — e pessoas incríveis. Hoje, estamos aproveitando o potencial ilimitado da IA para definir a próxima era da computação. Uma era em que nossa GPU atua como o cérebro de computadores, robôs e carros autônomos que podem entender o mundo. Fazer o que nunca foi feito antes exige visão, inovação e os melhores talentos do mundo. Como um NVIDIAN, você estará imerso em um ambiente diversificado e de apoio, onde todos são inspirados a fazer o seu melhor trabalho. Venha se juntar à equipe e veja como você pode causar um impacto duradouro no mundo.
A organização de Armazenamento DGXC da NVIDIA lida com algumas das tarefas de treinamento e inferência mais rápidas. Cada ciclo de GPU depende de uma plataforma de armazenamento construída para manter dezenas de milhares de aceleradores continuamente ocupados. Ela mantém exabytes de dados com segurança e impulsiona as maiores cargas de trabalho de IA em todo o mundo em configurações de nuvem, neocloud e on-premise. Com o crescimento da computação acelerada, o armazenamento é essencial. Ele pode fazer a diferença entre o uso eficaz da GPU e o potencial desperdiçado, e entre o lançamento de um modelo de ponta no prazo ou o atraso de meses. Buscamos um Engenheiro Distinto para liderar a estratégia de armazenamento da NVIDIA para Nuvem de IA em todo o ecossistema de Provedores de Neocloud (NCP) e Provedores de Serviços de Nuvem (CSP). Você dirigirá a arquitetura de sistemas de arquivos paralelos de alto desempenho, armazenamento de objetos e armazenamento de blocos em escala de exabytes. Você permanecerá ativamente envolvido, colaborando com engenheiros, SREs, parceiros e fornecedores de armazenamento. Você aplicará as ferramentas de IA da NVIDIA para aumentar sua produtividade e a daqueles que você impacta. Esta é uma oportunidade distinta de estabelecer a estrutura de armazenamento da era da IA na empresa que introduziu a computação acelerada.
NVIDIA liderou o caminho em computação acelerada. Hoje, nossa infraestrutura de IA impulsiona a inteligência global, transformando indústrias em todo o mundo. O grupo AI Cloud Storage forma a base que mantém a produtividade da maior frota de GPUs do mundo. Cada modelo treinado, cada inferência servida e cada checkpoint salvo passa por sistemas que desenvolvemos, construímos e gerenciamos.
O que você fará: *
- Liderar o plano técnico multianual para expansão do Armazenamento de Nuvem de IA em NCPs — determinar a arquitetura de referência, capacidades, SLOs de desempenho e durabilidade, metodologia de qualificação e roteiro para o armazenamento de arquivos, objetos e blocos de alto desempenho que cada NCP deve oferecer para se qualificar para a alocação de GPU da NVIDIA. *
- Atuar como arquiteto-chefe de armazenamento com profundo envolvimento prático. Liderar revisões chave de construções de armazenamento e investigar as causas raiz de problemas complexos de produção. Desenvolver implementações de referência protótipo para minimizar riscos em novas iniciativas. Tomar decisões técnicas finais sobre entregas de armazenamento de NCP usando SLOs mensuráveis. Aplicar intensamente ferramentas de IA para ampliar sua influência técnica em todo o programa. *
- Definir o padrão para "pronto para produção" em armazenamento de NCP, incluindo SLOs de durabilidade e disponibilidade medidos em 9s. Garantir eficiência sustentada por TiB, observabilidade, contenção de raio de explosão e redução de trabalho operacional. Influenciar o controle de entrega de GPU exigindo que a Nuvem de IA aceite capacidade de GPU apenas após verificar serviços auxiliares focados em armazenamento. *
- Desenvolver e guiar a direção arquitetônica trabalhando em estreita colaboração com colaboradores nas linhas de produtos de treinamento, inferência e computação acelerada. Coordenar com colegas de confiabilidade de site, operações, redes e segurança. Trabalhar em conjunto com provedores de nuvem externos, operadores de neocloud e fornecedores de armazenamento para alinhar uma arquitetura comum. *
- Desenvolver o caminho de código aberto para armazenamento de IA. Estabelecer e guiar uma estratégia de código aberto que amplie o ecossistema de armazenamento de IA. Defender uma abordagem focada em GitHub, focada em segurança. Engajar profundamente com comunidades de código aberto upstream. Formalizar as APIs, SDKs e protocolos que permitem que parceiros e a indústria construam, integrem e criem com NVIDIA no nível de armazenamento de IA. *
- Liderar uma cultura de engenharia centrada em ferramentas de IA. Usar regularmente ferramentas modernas de codificação e agentes de IA em suas tarefas diárias. Mostrar o que significa engenharia 10× na NVIDIA. Distribuir padrões, prompts e harnesses de avaliação em toda a organização de armazenamento. *
- Parceiro com engenheiros arquitetos de armazenamento Distintos e Principais em toda a organização para enfrentar os desafios técnicos mais difíceis e de longo prazo. Tornar a automação a única solução aceitável para tarefas de gerenciamento de infraestrutura, como atualizações de software ao vivo, substituição de nós e drives, rebalanceamento de capacidade, movimentação de dados entre DCs e ciclo de vida de conjuntos de dados. Estabelecer rigor de análise de causa raiz e ação corretiva em cada incidente importante. Projetar a camada de armazenamento para cargas de trabalho que abrangem as próximas gerações de GPUs, incluindo inferência desagregada com cache KV baseado em armazenamento, padrões de inferência de leitura única e escrita múltipla em larga escala, armazenamento de objetos regional de exabytes e versionamento e gerenciamento de cópias de conjuntos de dados entre DCs. *
- Orientar e desenvolver engenheiros seniores, principais e distintos em toda a organização de armazenamento e unidades de negócios adjacentes. Elevar o nível técnico amplamente. Representar a NVIDIA externamente em órgãos de padronização, comunidades de código aberto, briefings de clientes e fóruns da indústria (FAST, SC, OCP, SNIA, Summit de Armazenamento Linux). *
O que precisamos ver: *
- Bacharelado, Mestrado ou Doutorado em Ciência da Computação, Engenharia Elétrica ou área relacionada — ou experiência equivalente. *
- É necessária uma experiência prática mínima de 18+ anos em engenharia de tecnologia de armazenamento. Isso envolve envolvimento extensivo com um sistema de arquivos paralelo de alto desempenho como Lustre, GPFS / Spectrum Scale, WEKA, VAST, BeeGFS, DAOS, ou seu equivalente, lidando com dados em escala multi-petabytes. Os candidatos também devem ter ampla experiência em armazenamento de objetos (classe S3 / Swift) e armazenamento de blocos (NVMe-oF, classe NVMesh, iSCSI). *
- Um histórico comprovado de criação e gerenciamento de plataformas de armazenamento em escala de exabytes para cargas de trabalho críticas de desempenho — treinamento de IA, HPC, vídeo ou data lakes hiperscaláveis — incluindo responsabilidade direta por SLOs de durabilidade, disponibilidade e desempenho medidos em 9s. *
- Capacidade demonstrada de definir estratégia técnica entre unidades de negócios e organizações parceiras. Você impulsionou arquiteturas de armazenamento multianuais adotadas por várias equipes, fornecedores ou clientes. Você pode apontar resultados mensuráveis, como aumento na utilidade da GPU, redução de $/PB, incidentes eliminados e compressão do tempo de ativação. *
- Você é 100% prático em engenharia. Você escreve e revisa código de produção pessoalmente. Quando um bug exige, você lê o código fonte de Lustre, NFS, kernel, NVMe-oF ou SPDK. Você também executa testes de escala ou exercícios de recuperação pessoalmente, em vez de delegar. *
- Forte proficiência em pelo menos uma linguagem de sistemas (C, C++, Rust, ou Go) e proficiência em Python; confortável nas pilhas de armazenamento e rede do kernel Linux (camada de blocos, RDMA / RoCE / InfiniBand, NVMe, cache de página, VFS, multipath). *
- Uso diário frequente de ferramentas avançadas de IA para codificação e autônomas, incluindo exemplos específicos que mostram como você acelerou a construção, codificação, depuração, validação e operações. Além disso, compartilhe sua perspectiva sobre tendências futuras. *
- Excelente comunicação escrita e verbal. Você pode escrever um documento de uma página que alinha um VP. Você também pode escrever um documento de seis páginas que alinha uma organização inteira. Você pode explicar um trade-off técnico profundo para um SRE, um CTO de fornecedor e um cliente interno na mesma semana. *
- Conforto em operar em um ambiente de produção 24/7 onde incidentes de armazenamento impactam diretamente a receita de GPU, com uma abordagem de segurança integrada em cada construção.
Maneiras de se destacar da multidão: *
- Experiência comprovada no projeto ou gerenciamento de soluções de armazenamento para treinamento ou inferência de IA em escala de 10k+ GPUs, demonstrando melhorias claras na utilização de GPU ou redução de gargalos de I/O. *
- Contribuições de código aberto ou manutenção em Lustre, NFS, SPDK, NVMe / NVMe-oF, CSI, Ceph, MinIO, RocksDB ou projetos relacionados. *
- Construiu ou liderou uma arquitetura de armazenamento de inferência desagregada ou de Computação em Tempo de Inferência — cache KV para armazenamento rápido no cluster ou adjacente à GPU, WORM em escala, agendamento ciente de armazenamento ou inferência integrada a banco de dados. *
- Contribuições técnicas públicas — patentes, artigos revisados por pares (FAST, SOSP, NSDI, OSDI, ATC), palestras principais ou RFCs — que demonstram expertise e liderança em armazenamento para infraestrutura de IA.
Amplamente considerada um dos empregadores mais desejados do mundo da tecnologia, a NVIDIA oferece salários altamente competitivos e um pacote abrangente de benefícios. Ao planejar seu futuro, veja o que podemos oferecer a você e sua família nvidiabenefits.com/ nvidiabenefits.com/
Você também será elegível para ações e benefícios nvidia.com/en-us/benefits/.
Seu salário base será determinado com base em sua localização, experiência e no pagamento de funcionários em posições semelhantes. A faixa salarial base é 320,000 USD - 488,750 USD.
As inscrições para esta vaga serão aceitas pelo menos até outubro de 8, 2026.
Esta publicação é para uma vaga existente.
NVIDIA usa ferramentas de IA em seus processos de recrutamento.
NVIDIA está comprometida em promover um ambiente de trabalho inclusivo e orgulha-se de ser um empregador que oferece igualdade de oportunidades. Como valorizamos muito a diversidade em nossos funcionários atuais e futuros, não discriminamos (incluindo em nossas práticas de contratação e promoção) com base em raça, religião, cor, origem nacional, gênero, expressão de gênero, orientação sexual, idade, estado civil, status de veterano, status de deficiência ou qualquer outra característica protegida por lei.
