StrideCare
Designworks Talent
Engenheiro de Virtualização e Orquestração Staff Sênior
Sobre a oportunidade
Engenheiro Staff de Virtualização e Orquestração
Construa a Camada de Plataforma que Potencializa a Infraestrutura de IA de Próxima Geração
Sobre a Oportunidade
Uma empresa de infraestrutura de IA bem financiada e em rápido crescimento está construindo uma plataforma de nuvem de próxima geração projetada para potencializar o ciclo de vida completo da inteligência artificial. A organização está desenvolvendo um portfólio abrangente de infraestrutura, plataforma e serviços de IA que suporta todo o espectro de cargas de trabalho de IA — incluindo computação em larga escala, treinamento de modelos, ajuste fino, inferência e aplicações emergentes de IA agentica.
Apoiada por um investimento significativo de longo prazo, a empresa combina a velocidade, a propriedade e a inovação de uma startup com a estabilidade e os recursos de uma organização controladora estabelecida. As equipes de engenharia são intencionalmente enxutas, altamente colaborativas e nativas de IA, aproveitando automação e ferramentas modernas para construir infraestrutura capaz de suportar as cargas de trabalho de IA mais exigentes da indústria.
Estamos buscando Engenheiros de Virtualização e Orquestração para construir a camada de plataforma que permite aos clientes consumir de forma confiável computação GPU em escala. Esta equipe é responsável por projetar e operar os sistemas de virtualização, Kubernetes, provisionamento e orquestração que potencializam cargas de trabalho de IA em larga escala em infraestrutura de data center de próxima geração.
A Oportunidade
Esta é uma função de engenharia fundamental dentro da maior organização de engenharia de infraestrutura da empresa. Você ajudará a projetar e construir os sistemas que tornam a capacidade de GPU disponível, escalável, segura e confiável em uma plataforma de nuvem de IA multi-tenant.
Você trabalhará na intersecção de virtualização, Kubernetes, sistemas distribuídos, infraestrutura de GPU e computação de alto desempenho, resolvendo desafios complexos em torno de agendamento de cargas de trabalho, alocação de recursos, gerenciamento de cluster e automação de infraestrutura.
Esta oportunidade é ideal para engenheiros que gostam de construir plataformas em larga escala do zero e possuir sistemas de infraestrutura críticos de ponta a ponta.
Localização: Híbrido | Área de Bellevue, WA
Títulos: Engenheiro, Sênior e Staff (múltiplas vagas disponíveis)
Localização
- Função híbrida baseada na área de Bellevue, WA.
- Aproximadamente três dias por semana no escritório.
- Candidatos de outras partes dos EUA que estejam abertos à realocação são encorajados a se candidatar.
- Autorização de trabalho nos EUA é necessária. Patrocínio de visto não está disponível no momento.
Por Que Se Juntar?
- Construa a plataforma de orquestração que potencializa um dos ambientes de infraestrutura de IA mais avançados da indústria.
- Trabalhe diretamente em clusters de GPU, plataformas Kubernetes e sistemas distribuídos em larga escala.
- Resolva desafios complexos de infraestrutura em virtualização, agendamento, gerenciamento de recursos e automação.
- Junte-se cedo o suficiente para influenciar a arquitetura, as práticas de engenharia e a estratégia da plataforma.
- Colabore com uma equipe altamente experiente construindo a base para aplicações de IA de próxima geração.
- Desfrute da propriedade e do impacto técnico de um ambiente de startup apoiado por um investimento significativo de longo prazo.
O Que Você Fará
- Projetar e construir infraestrutura de virtualização que suporte cargas de trabalho de IA e HPC intensivas em GPU.
- Desenvolver e operar sistemas de orquestração baseados em Kubernetes para provisionamento de cluster de GPU e agendamento de cargas de trabalho.
- Construir sistemas de provisionamento automatizados que permitam que a capacidade de GPU seja alocada, dimensionada e recuperada de forma eficiente em múltiplos tenants.
- Projetar soluções para posicionamento de cargas de trabalho, gerenciamento de recursos e operações de ciclo de vida de cluster.
- Colaborar estreitamente com as equipes de hardware, rede, infraestrutura e plataforma de IA para garantir que os sistemas de orquestração estejam alinhados com as arquiteturas e restrições reais do cluster.
- Melhorar a confiabilidade, segurança, escalabilidade e maturidade operacional da plataforma de orquestração.
- Construir ferramentas e automação que simplifiquem o gerenciamento de infraestrutura e melhorem as experiências de desenvolvedores e clientes.
- Contribuir para decisões de arquitetura, padrões de engenharia e melhores práticas à medida que a plataforma evolui.
Requisitos mínimos
O Que Buscamos
- Sólida experiência prática com Kubernetes e orquestração de contêineres em ambientes de produção.
- Experiência em projetar, construir e operar plataformas de infraestrutura em larga escala.
- Experiência com tecnologias de virtualização que suportam ambientes de nuvem, HPC, GPU ou computação distribuída.
- Compreensão de provisionamento de cluster de GPU, agendamento de cargas de trabalho e gerenciamento de recursos.
- Experiência com infraestrutura baseada em Linux e conceitos de sistemas distribuídos.
- Capacidade de possuir de forma independente sistemas complexos desde o projeto até a operação em produção.
- Confortável trabalhando em um ambiente de ritmo acelerado onde a arquitetura e os processos estão sendo estabelecidos.
Qualificações Preferenciais
- Experiência com tecnologias de agendamento de GPU, como Slurm, plugins de dispositivo Kubernetes, NVIDIA GPU Operator ou frameworks semelhantes.
- Experiência em suportar infraestrutura de IA, plataformas de machine learning, ambientes HPC ou provedores de nuvem de GPU.
- Experiência em construir plataformas de infraestrutura multi-tenant para provedores de nuvem ou ambientes de computação em larga escala.
- Experiência com automação de infraestrutura, Infraestrutura como Código e práticas de engenharia de plataforma.
- Familiaridade com redes de alto desempenho e arquiteturas de cluster de GPU.
Compensação
- Salário base competitivo para o mercado de Bellevue
- Certos cargos são elegíveis para recompensas adicionais, incluindo aumentos de mérito, bônus anual e incentivos de longo prazo. Esses prêmios são alocados com base no desempenho individual.
- Funcionários baseados nos EUA têm acesso a seguro médico, odontológico e de visão, um plano 401(k) e contrapartida da empresa, os funcionários também recebem feriados remunerados por ano civil.
