Roku
Nebius
Engenheiro de Infraestrutura de ML
Sobre a Nebius
A Nebius está liderando uma nova era em infraestrutura de nuvem para a economia global de IA. Estamos construindo uma plataforma de nuvem de IA full-stack que suporta desenvolvedores e empresas desde o treinamento de dados e modelos até a implantação em produção, sem o custo e a complexidade de construir uma grande infraestrutura interna de IA/ML.
Construído por engenheiros, para engenheiros. Desde a orquestração de GPU em larga escala até otimização de inferência, nós cuidamos dos problemas complexos em computação, armazenamento, rede e IA aplicada.
Listada na Nasdaq (NBIS) e sediada em Amsterdã, temos uma presença global com centros de P&D na Europa, Reino Unido, América do Norte e Israel. Nossa equipe de mais de 1,500+ inclui centenas de engenheiros com profundo conhecimento em hardware, software e P&D de IA.
A vaga
Estamos buscando um Engenheiro de IA/ML altamente qualificado para se juntar à nossa equipe e liderar e suportar o benchmarking de plataformas de GPU para cargas de trabalho de machine learning e IA. Você desempenhará um papel crítico na avaliação do desempenho de hardware baseado em GPU para várias arquiteturas de deep learning e frameworks de IA, possibilitando decisões baseadas em dados para otimização de plataforma e desenvolvimento de hardware de próxima geração.
Como é trabalhar na Nebius
Movimentação rápida - Pensamento ousado - Crescimento constante - Impacto significativo - Confiança e autonomia real - Oportunidade de moldar o futuro da IA.
Declaração de Igualdade de Oportunidades
--------------------------------------------------------------------------------
A Nebius é um empregador que oferece igualdade de oportunidades. Estamos comprometidos em promover um ambiente de trabalho inclusivo e diversificado e em fornecer oportunidades de emprego iguais em todos os aspectos do emprego. Não discriminamos com base em raça, cor, religião, sexo (incluindo gravidez), origem nacional, ancestralidade, idade, deficiência, informação genética, estado civil, status de veterano, orientação sexual, identidade ou expressão de gênero, ou qualquer outra característica protegida pela lei aplicável.
Os candidatos devem ter autorização para trabalhar no país em que se candidatam e serão obrigados a fornecer prova de elegibilidade de emprego como condição de contratação.
Se você precisar de acomodações durante o processo de inscrição, por favor, nos informe.
Suas responsabilidades incluirão: *
- Trabalhar em estreita colaboração com equipes de hardware e desenvolvimento para perfilar e analisar o desempenho da GPU no nível do sistema e do kernel. *
- Avaliar e comparar o desempenho da GPU em diferentes plataformas, arquiteturas e pilhas de software (por exemplo, CUDA, ROCm). *
- Depurar e otimizar cargas de trabalho de ML para rodar eficientemente em hardware de GPU, identificando e resolvendo gargalos de desempenho. *
- Realizar testes de aceitação para novos clusters de GPU, garantindo que hardware e software atendam aos requisitos de desempenho, estabilidade e compatibilidade para cargas de trabalho de IA. *
- Realizar experimentos em diversas configurações de sistemas de GPU para avaliar o impacto de diferentes estratégias de interconexão e otimizações em nível de sistema no desempenho e escalabilidade. *
- Desenvolver ferramentas e dashboards para visualizar métricas de desempenho, gargalos e tendências. *
- Contribuir para ferramentas internas, frameworks e melhores práticas
Esperamos que você tenha: *
- Um profundo entendimento dos fundamentos teóricos de machine learning. *
- Profundo entendimento dos aspectos de desempenho de treinamento e inferência de redes neurais grandes (paralelismo de dados/tensor/contexto/especialista, offloading, kernels customizados, recursos de hardware, otimizações de atenção, batching dinâmico etc.). *
- Profunda experiência com frameworks modernos de deep learning (PyTorch, JAX, Megatron-LM, Tensor-LLM). *
- Bom entendimento da pilha de GPU: CUDA, NCCL, drivers e bibliotecas relevantes. *
- Familiaridade com ambientes conteinerizados (por exemplo, Docker, Kubernetes). *
- Fortes habilidades de comunicação e capacidade de trabalhar de forma independente.
Formas de se destacar da multidão: *
- Familiaridade com frameworks modernos de inferência de LLM (vLLM, SGLang, TensorRT). *
- Experiência em Python e ferramentas de profiling de desempenho (por exemplo, Nsight, nvprof, perf). *
- Familiaridade com plataformas de ML em nuvem como AWS, GCP, Azure ML. *
- Contribuições para ferramentas de benchmarking de ML open-source.
Benefícios e Vantagens: *
- Remuneração competitiva. *
- Oportunidades de crescimento na carreira e aprendizado. *
- Flexibilidade e autonomia. *
- Cultura colaborativa e inovadora. *
- Oportunidade de trabalhar em projetos de IA impactantes. *
- Ambiente internacional e equipes talentosas.
