Designworks Talent

Engenheiro de Virtualização e Orquestração Staff Sênior

Kubernetes
Tradução automática. Consulte o original.

Sobre a oportunidade

Engenheiro Staff de Virtualização e Orquestração

Construa a Camada de Plataforma que Potencializa a Infraestrutura de IA de Próxima Geração

Sobre a Oportunidade

Uma empresa de infraestrutura de IA bem financiada e em rápido crescimento está construindo uma plataforma de nuvem de próxima geração projetada para potencializar o ciclo de vida completo da inteligência artificial. A organização está desenvolvendo um portfólio abrangente de infraestrutura, plataforma e serviços de IA que suporta todo o espectro de cargas de trabalho de IA — incluindo computação em larga escala, treinamento de modelos, ajuste fino, inferência e aplicações emergentes de IA agentica.

Apoiada por um investimento significativo de longo prazo, a empresa combina a velocidade, a propriedade e a inovação de uma startup com a estabilidade e os recursos de uma organização controladora estabelecida. As equipes de engenharia são intencionalmente enxutas, altamente colaborativas e nativas de IA, aproveitando automação e ferramentas modernas para construir infraestrutura capaz de suportar as cargas de trabalho de IA mais exigentes da indústria.

Estamos buscando Engenheiros de Virtualização e Orquestração para construir a camada de plataforma que permite aos clientes consumir de forma confiável computação GPU em escala. Esta equipe é responsável por projetar e operar os sistemas de virtualização, Kubernetes, provisionamento e orquestração que potencializam cargas de trabalho de IA em larga escala em infraestrutura de data center de próxima geração.

A Oportunidade

Esta é uma função de engenharia fundamental dentro da maior organização de engenharia de infraestrutura da empresa. Você ajudará a projetar e construir os sistemas que tornam a capacidade de GPU disponível, escalável, segura e confiável em uma plataforma de nuvem de IA multi-tenant.

Você trabalhará na intersecção de virtualização, Kubernetes, sistemas distribuídos, infraestrutura de GPU e computação de alto desempenho, resolvendo desafios complexos em torno de agendamento de cargas de trabalho, alocação de recursos, gerenciamento de cluster e automação de infraestrutura.

Esta oportunidade é ideal para engenheiros que gostam de construir plataformas em larga escala do zero e possuir sistemas de infraestrutura críticos de ponta a ponta.

Localização: Híbrido | Área de Bellevue, WA

Títulos: Engenheiro, Sênior e Staff (múltiplas vagas disponíveis)

Localização

  1. Função híbrida baseada na área de Bellevue, WA.
  1. Aproximadamente três dias por semana no escritório.
  1. Candidatos de outras partes dos EUA que estejam abertos à realocação são encorajados a se candidatar.
  1. Autorização de trabalho nos EUA é necessária. Patrocínio de visto não está disponível no momento.

Por Que Se Juntar?

  1. Construa a plataforma de orquestração que potencializa um dos ambientes de infraestrutura de IA mais avançados da indústria.
  1. Trabalhe diretamente em clusters de GPU, plataformas Kubernetes e sistemas distribuídos em larga escala.
  1. Resolva desafios complexos de infraestrutura em virtualização, agendamento, gerenciamento de recursos e automação.
  1. Junte-se cedo o suficiente para influenciar a arquitetura, as práticas de engenharia e a estratégia da plataforma.
  1. Colabore com uma equipe altamente experiente construindo a base para aplicações de IA de próxima geração.
  1. Desfrute da propriedade e do impacto técnico de um ambiente de startup apoiado por um investimento significativo de longo prazo.

O Que Você Fará

  1. Projetar e construir infraestrutura de virtualização que suporte cargas de trabalho de IA e HPC intensivas em GPU.
  1. Desenvolver e operar sistemas de orquestração baseados em Kubernetes para provisionamento de cluster de GPU e agendamento de cargas de trabalho.
  1. Construir sistemas de provisionamento automatizados que permitam que a capacidade de GPU seja alocada, dimensionada e recuperada de forma eficiente em múltiplos tenants.
  1. Projetar soluções para posicionamento de cargas de trabalho, gerenciamento de recursos e operações de ciclo de vida de cluster.
  1. Colaborar estreitamente com as equipes de hardware, rede, infraestrutura e plataforma de IA para garantir que os sistemas de orquestração estejam alinhados com as arquiteturas e restrições reais do cluster.
  1. Melhorar a confiabilidade, segurança, escalabilidade e maturidade operacional da plataforma de orquestração.
  1. Construir ferramentas e automação que simplifiquem o gerenciamento de infraestrutura e melhorem as experiências de desenvolvedores e clientes.
  1. Contribuir para decisões de arquitetura, padrões de engenharia e melhores práticas à medida que a plataforma evolui.

Requisitos mínimos

O Que Buscamos

  1. Sólida experiência prática com Kubernetes e orquestração de contêineres em ambientes de produção.
  1. Experiência em projetar, construir e operar plataformas de infraestrutura em larga escala.
  1. Experiência com tecnologias de virtualização que suportam ambientes de nuvem, HPC, GPU ou computação distribuída.
  1. Compreensão de provisionamento de cluster de GPU, agendamento de cargas de trabalho e gerenciamento de recursos.
  1. Experiência com infraestrutura baseada em Linux e conceitos de sistemas distribuídos.
  1. Capacidade de possuir de forma independente sistemas complexos desde o projeto até a operação em produção.
  1. Confortável trabalhando em um ambiente de ritmo acelerado onde a arquitetura e os processos estão sendo estabelecidos.

Qualificações Preferenciais

  1. Experiência com tecnologias de agendamento de GPU, como Slurm, plugins de dispositivo Kubernetes, NVIDIA GPU Operator ou frameworks semelhantes.
  1. Experiência em suportar infraestrutura de IA, plataformas de machine learning, ambientes HPC ou provedores de nuvem de GPU.
  1. Experiência em construir plataformas de infraestrutura multi-tenant para provedores de nuvem ou ambientes de computação em larga escala.
  1. Experiência com automação de infraestrutura, Infraestrutura como Código e práticas de engenharia de plataforma.
  1. Familiaridade com redes de alto desempenho e arquiteturas de cluster de GPU.

Compensação

  • Salário base competitivo para o mercado de Bellevue
  • Certos cargos são elegíveis para recompensas adicionais, incluindo aumentos de mérito, bônus anual e incentivos de longo prazo. Esses prêmios são alocados com base no desempenho individual.
  • Funcionários baseados nos EUA têm acesso a seguro médico, odontológico e de visão, um plano 401(k) e contrapartida da empresa, os funcionários também recebem feriados remunerados por ano civil.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores