Hydra Host

Engenheiro(a) de Armazenamento Sênior

Tradução automática. Consulte o original.

Título da Vaga: Engenheiro(a) de Armazenamento

Sobre a Hydra Host

A Hydra Host é uma parceira NVIDIA apoiada pelo Founders Fund, construindo a plataforma de infraestrutura que impulsiona a IA em escala. Conectamos Fábricas de IA - data centers de GPU de alta performance - com as equipes que dependem delas: laboratórios de pesquisa treinando modelos fundamentais, empresas executando inferência em produção e plataformas de desenvolvedores exigindo capacidade de computação escalável. A Hydra Host está construindo a rede e o marketplace de infraestrutura de GPU bare-metal de próxima geração sob sua plataforma Brokkr. A empresa permite que data centers independentes monetizem a capacidade de GPU, ao mesmo tempo que fornece às empresas acesso escalável e de alta performance à computação baseada em NVIDIA (ex: H100, H200, B200, L40S, RTX 4090). À medida que expandimos nossas capacidades de infraestrutura, a Hydra Host está agora buscando um(a) Engenheiro(a) de Armazenamento para liderar a arquitetura, desenvolvimento e implantação de nossa plataforma de armazenamento de IA/HPC de próxima geração.

A função

Como Engenheiro(a) de Armazenamento, você será responsável por projetar e construir a primeira plataforma de armazenamento de nível de produção da Hydra Host do zero, apoiando a rede em rápida expansão de clusters de GPU bare-metal da empresa.

Você será o(a) responsável pela arquitetura, seleção de tecnologia, implementação e evolução desta plataforma, definindo como a Hydra Host gerencia dados para cargas de trabalho de IA distribuídas em larga escala em data centers globais.

Esta é uma função sênior e prática para um(a) engenheiro(a) que já construiu sistemas de armazenamento para clusters de GPU antes, com profundo conhecimento em armazenamento de blocos e de objetos, e um forte entendimento de sistemas de arquivos paralelos, otimização de performance e orquestração em larga escala.

Principais Responsabilidades

  1. Definir, arquitetar e implementar a primeira plataforma de armazenamento de produção da Hydra Host adaptada para clusters de GPU bare-metal e cargas de trabalho de IA/HPC.
  1. Liderar todas as decisões técnicas sobre o design da pilha de armazenamento, desde a infraestrutura de hardware até a orquestração do sistema de arquivos paralelo e ajuste de performance.
  1. Selecionar, construir e manter soluções de armazenamento que abrangem camadas de armazenamento de blocos (NVMe, SAN, Ceph, etc.) e de objetos (compatível com S3, customizado ou Ceph Object Gateway).
  1. Projetar para acesso de alta taxa de transferência e baixa latência, suportando grandes conjuntos de dados, checkpointing rápido e acesso paralelo para cargas de trabalho de treinamento de IA distribuídas.
  1. Integrar e otimizar sistemas de arquivos paralelos como Lustre, BeeGFS, Spectrum Scale, WekaIO ou CephFS, garantindo performance máxima e tolerância a falhas. ·
  1. Garantir a compatibilidade em todo o ecossistema diverso de GPU/OEM da Hydra, considerando firmware exclusivo, APIs BMC/Redfish e configurações de hardware.
  1. Desenvolver automação, observabilidade e ferramentas de gerenciamento para armazenamento, com foco em confiabilidade, escalabilidade e eficiência.
  1. Atuar como construtor(a) e arquiteto(a): profundamente prático(a) na implantação, solução de problemas e otimização, ao mesmo tempo que orienta o roadmap de armazenamento de longo prazo.
  1. Colaborar multifuncionalmente com as equipes de engenharia de GPU, HPC e de plataforma para integrar o armazenamento com as camadas de computação e rede.
  1. Interagir com clientes e liderança de produto para definir prioridades de recursos, benchmarks de performance e melhorias futuras.

Qualificações Essenciais

  1. 8+ anos de experiência progressiva e prática em projeto e implementação de sistemas de armazenamento de alta performance para clusters de computação em ambientes HPC, IA ou nuvem bare-metal.
  1. Histórico comprovado na construção de infraestrutura de armazenamento do zero, não apenas na operação de sistemas existentes.
  1. Profundo conhecimento em armazenamento de blocos (NVMe, SAN, Ceph, sistemas de blocos distribuídos) e armazenamento de objetos (S3, MinIO, Ceph Object Gateway, etc.).
  1. Forte experiência em sistemas de arquivos paralelos (WekaIO, BeeGFS, Lustre, Spectrum Scale ou similar) suportando cargas de trabalho de clusters de GPU ou IA.
  1. Sólida base em engenharia de sistemas Linux, automação e scripting para ambientes distribuídos.
  1. Familiaridade com BMC, APIs Redfish e firmware de servidor OEM para gerenciamento bare-metal.
  1. Profundo entendimento de pipelines de dados de IA/ML: checkpointing de modelos, localidade de dados e otimização de armazenamento multi-nível.
  1. Excelentes habilidades de resolução de problemas, depuração e comunicação, capazes de traduzir decisões técnicas em direção arquitetural clara.

Qualificações Preferenciais

  1. Experiência na construção de soluções de armazenamento para infraestrutura de GPU ou HPC em larga escala.
  1. Histórico de liderança técnica ou mentoria, crescimento de equipes ou responsabilidade por um roadmap de produto.
  1. Experiência na avaliação e gerenciamento de relacionamentos com fornecedores e negociação de contratos de hardware/software de armazenamento.
  1. Contribuições para projetos de código aberto de HPC ou armazenamento (Ceph, Lustre, BeeGFS, etc.).
  1. Familiaridade com computação confidencial, manuseio seguro de dados ou arquiteturas de alta disponibilidade.

Salário: 150000 - 200000 USD Por ano

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores