Esri
Designworks Talent
Engenheiro(a) Sênior de Infraestrutura de Treinamento de IA
Sobre a Oportunidade
Engenheiro(a) de Infraestrutura de Treinamento de IA
Construa a Infraestrutura de Treinamento que Potencializa Modelos de IA de Próxima Geração
Uma empresa de infraestrutura de IA bem financiada e em rápido crescimento está construindo uma plataforma de nuvem de próxima geração projetada para potencializar o ciclo de vida completo da inteligência artificial. A organização está desenvolvendo um portfólio abrangente de infraestrutura, plataforma e serviços de IA que suporta todo o espectro de cargas de trabalho de IA — incluindo computação em larga escala, treinamento de modelos, ajuste fino, inferência e aplicações emergentes de IA agentica.
Apoiada por um investimento significativo de longo prazo, a empresa combina a velocidade, a propriedade e a inovação de uma startup com a estabilidade e os recursos de uma organização controladora estabelecida. As equipes de engenharia são intencionalmente enxutas, altamente colaborativas e nativas de IA, aproveitando ferramentas modernas e automação para construir infraestrutura capaz de suportar as cargas de trabalho de IA mais exigentes da indústria.
Estamos buscando Engenheiros(as) de Infraestrutura de Treinamento de IA para construir e escalar os sistemas distribuídos que potencializam o treinamento de modelos de IA em larga escala. Esta equipe se concentra em confiabilidade, eficiência e excelência operacional em clusters de GPU, permitindo que pesquisadores e engenheiros treinem e implementem modelos avançados de IA em escala.
A Oportunidade
Esta é uma função de engenharia fundamental focada na construção da camada de infraestrutura por trás das cargas de trabalho de treinamento de IA em larga escala. Você trabalhará em sistemas de treinamento distribuído, clusters de GPU, pipelines de modelos e as ferramentas necessárias para tornar o desenvolvimento de IA mais confiável, eficiente e escalável.
Você colaborará estreitamente com as equipes de infraestrutura, orquestração, desempenho e machine learning para resolver desafios complexos em torno de computação distribuída, tolerância a falhas, eficiência de treinamento e prontidão de produção.
Esta oportunidade é ideal para engenheiros(as) que gostam de construir sistemas altamente escaláveis e trabalhar na interseção de pesquisa de IA, engenharia de infraestrutura e computação distribuída.
Localização
Localização: Híbrido | Bellevue, WA (centro)
Cargos: Sênior e Staff (várias vagas disponíveis)
Função híbrida baseada no centro de Bellevue, WA.
Aproximadamente três dias por semana no escritório.
Candidatos(as) de outras partes dos EUA que estejam abertos(as) à realocação são encorajados(as) a se candidatar.
Autorização de trabalho nos EUA é necessária. Patrocínio de visto não está disponível no momento.
Por Que Se Juntar?
- Construa a infraestrutura que potencializa a próxima geração de modelos e aplicações de IA.
- Trabalhe diretamente em sistemas de treinamento distribuído, clusters de GPU e plataformas de IA em larga escala.
- Resolva alguns dos problemas mais desafiadores da indústria em torno de escalabilidade, confiabilidade e eficiência de IA.
- Junte-se cedo o suficiente para influenciar a arquitetura, as ferramentas e as práticas de engenharia.
- Colabore com uma equipe altamente experiente construindo infraestrutura crítica de IA do zero.
- Desfrute da propriedade e do impacto técnico de um ambiente de startup apoiado por um investimento significativo de longo prazo.
O Que Você Fará
- Construir e escalar infraestrutura de treinamento distribuído que suporte grandes modelos de IA em grandes clusters de GPU.
- Projetar e aprimorar sistemas que aumentem a confiabilidade, eficiência e utilização de recursos do treinamento.
- Desenvolver soluções para tolerância a falhas, checkpointing, recuperação e operações de treinamento em larga escala.
- Integrar modelos de IA em pipelines de treinamento de produção em parceria com as equipes de engenharia de plataforma, orquestração e desempenho.
- Diagnosticar e resolver problemas que afetam a taxa de transferência, estabilidade, confiabilidade e eficiência de custos do treinamento.
- Construir ferramentas e automação que melhorem a experiência do desenvolvedor para pesquisadores(as) e engenheiros(as) de IA.
- Estabelecer melhores práticas para infraestrutura de treinamento, processos operacionais e confiabilidade da plataforma.
- Contribuir para a evolução da plataforma de infraestrutura de IA como um membro inicial da equipe de engenharia.
O Que Buscamos
- Experiência prática na construção e operação de sistemas de treinamento distribuído ou infraestrutura de machine learning em larga escala.
- Experiência no suporte a grandes modelos de IA, modelos de fundação, fluxos de trabalho pós-treinamento ou sistemas de ML semelhantes.
- Forte compreensão dos desafios de confiabilidade, escalabilidade e eficiência associados ao treinamento multi-nó com GPU.
- Experiência na integração de sistemas de treinamento com pipelines de machine learning de produção.
- Fortes habilidades de programação e experiência trabalhando com sistemas distribuídos complexos.
- Capacidade de assumir de forma independente projetos tecnicamente desafiadores em um ambiente de engenharia de rápida evolução.
- Confortável em operar com alta responsabilidade e pouca sobrecarga de processos.
Qualificações Preferenciais
- Experiência com frameworks de treinamento distribuído como PyTorch Distributed, DeepSpeed, Megatron-LM, Ray ou tecnologias similares.
- Experiência com ajuste fino supervisionado (SFT), aprendizado por reforço com feedback humano (RLHF) ou outros fluxos de trabalho pós-treinamento.
- Experiência em operar infraestrutura de treinamento de IA em escala dentro de um ambiente de hiperescala, organização de pesquisa de IA, provedor de nuvem ou nuvem de GPU.
- Experiência em otimizar a utilização de GPU, desempenho de treinamento ou confiabilidade de sistemas distribuídos.
- Familiaridade com Kubernetes, cargas de trabalho de IA conteinerizadas e plataformas de infraestrutura em larga escala.
Remuneração
Salário base competitivo para o mercado de Bellevue
Certos cargos são elegíveis para recompensas adicionais, incluindo aumentos por mérito, bônus anual e incentivos de longo prazo. Esses prêmios são alocados com base no desempenho individual.
Funcionários(as) baseados(as) nos EUA têm acesso a seguro médico, odontológico e de visão, um plano 401(k) com contrapartida da empresa, os funcionários(as) também recebem por ano civil, feriados remunerados.
