StrideCare
Hydra Host
Engenheiro(a) de Armazenamento Sênior
Título da Vaga: Engenheiro(a) de Armazenamento
Sobre a Hydra Host
A Hydra Host é uma parceira NVIDIA apoiada pelo Founders Fund, construindo a plataforma de infraestrutura que impulsiona a IA em escala. Conectamos Fábricas de IA - data centers de GPU de alta performance - com as equipes que dependem delas: laboratórios de pesquisa treinando modelos fundamentais, empresas executando inferência em produção e plataformas de desenvolvedores exigindo capacidade de computação escalável. A Hydra Host está construindo a rede e o marketplace de infraestrutura de GPU bare-metal de próxima geração sob sua plataforma Brokkr. A empresa permite que data centers independentes monetizem a capacidade de GPU, ao mesmo tempo que fornece às empresas acesso escalável e de alta performance à computação baseada em NVIDIA (ex: H100, H200, B200, L40S, RTX 4090). À medida que expandimos nossas capacidades de infraestrutura, a Hydra Host está agora buscando um(a) Engenheiro(a) de Armazenamento para liderar a arquitetura, desenvolvimento e implantação de nossa plataforma de armazenamento de IA/HPC de próxima geração.
A função
Como Engenheiro(a) de Armazenamento, você será responsável por projetar e construir a primeira plataforma de armazenamento de nível de produção da Hydra Host do zero, apoiando a rede em rápida expansão de clusters de GPU bare-metal da empresa.
Você será o(a) responsável pela arquitetura, seleção de tecnologia, implementação e evolução desta plataforma, definindo como a Hydra Host gerencia dados para cargas de trabalho de IA distribuídas em larga escala em data centers globais.
Esta é uma função sênior e prática para um(a) engenheiro(a) que já construiu sistemas de armazenamento para clusters de GPU antes, com profundo conhecimento em armazenamento de blocos e de objetos, e um forte entendimento de sistemas de arquivos paralelos, otimização de performance e orquestração em larga escala.
Principais Responsabilidades
- Definir, arquitetar e implementar a primeira plataforma de armazenamento de produção da Hydra Host adaptada para clusters de GPU bare-metal e cargas de trabalho de IA/HPC.
- Liderar todas as decisões técnicas sobre o design da pilha de armazenamento, desde a infraestrutura de hardware até a orquestração do sistema de arquivos paralelo e ajuste de performance.
- Selecionar, construir e manter soluções de armazenamento que abrangem camadas de armazenamento de blocos (NVMe, SAN, Ceph, etc.) e de objetos (compatível com S3, customizado ou Ceph Object Gateway).
- Projetar para acesso de alta taxa de transferência e baixa latência, suportando grandes conjuntos de dados, checkpointing rápido e acesso paralelo para cargas de trabalho de treinamento de IA distribuídas.
- Integrar e otimizar sistemas de arquivos paralelos como Lustre, BeeGFS, Spectrum Scale, WekaIO ou CephFS, garantindo performance máxima e tolerância a falhas. ·
- Garantir a compatibilidade em todo o ecossistema diverso de GPU/OEM da Hydra, considerando firmware exclusivo, APIs BMC/Redfish e configurações de hardware.
- Desenvolver automação, observabilidade e ferramentas de gerenciamento para armazenamento, com foco em confiabilidade, escalabilidade e eficiência.
- Atuar como construtor(a) e arquiteto(a): profundamente prático(a) na implantação, solução de problemas e otimização, ao mesmo tempo que orienta o roadmap de armazenamento de longo prazo.
- Colaborar multifuncionalmente com as equipes de engenharia de GPU, HPC e de plataforma para integrar o armazenamento com as camadas de computação e rede.
- Interagir com clientes e liderança de produto para definir prioridades de recursos, benchmarks de performance e melhorias futuras.
Qualificações Essenciais
- 8+ anos de experiência progressiva e prática em projeto e implementação de sistemas de armazenamento de alta performance para clusters de computação em ambientes HPC, IA ou nuvem bare-metal.
- Histórico comprovado na construção de infraestrutura de armazenamento do zero, não apenas na operação de sistemas existentes.
- Profundo conhecimento em armazenamento de blocos (NVMe, SAN, Ceph, sistemas de blocos distribuídos) e armazenamento de objetos (S3, MinIO, Ceph Object Gateway, etc.).
- Forte experiência em sistemas de arquivos paralelos (WekaIO, BeeGFS, Lustre, Spectrum Scale ou similar) suportando cargas de trabalho de clusters de GPU ou IA.
- Sólida base em engenharia de sistemas Linux, automação e scripting para ambientes distribuídos.
- Familiaridade com BMC, APIs Redfish e firmware de servidor OEM para gerenciamento bare-metal.
- Profundo entendimento de pipelines de dados de IA/ML: checkpointing de modelos, localidade de dados e otimização de armazenamento multi-nível.
- Excelentes habilidades de resolução de problemas, depuração e comunicação, capazes de traduzir decisões técnicas em direção arquitetural clara.
Qualificações Preferenciais
- Experiência na construção de soluções de armazenamento para infraestrutura de GPU ou HPC em larga escala.
- Histórico de liderança técnica ou mentoria, crescimento de equipes ou responsabilidade por um roadmap de produto.
- Experiência na avaliação e gerenciamento de relacionamentos com fornecedores e negociação de contratos de hardware/software de armazenamento.
- Contribuições para projetos de código aberto de HPC ou armazenamento (Ceph, Lustre, BeeGFS, etc.).
- Familiaridade com computação confidencial, manuseio seguro de dados ou arquiteturas de alta disponibilidade.
Salário: 150000 - 200000 USD Por ano
