Benjamin
Nebius
Engenheiro Sênior de Confiabilidade de Site — Token Factory (Plataforma de Inferência)
Sobre a Nebius
A Nebius está liderando uma nova era em infraestrutura de nuvem para a economia global de IA. Estamos construindo uma plataforma de nuvem de IA full-stack que suporta desenvolvedores e empresas, desde o treinamento de dados e modelos até a implantação em produção, sem o custo e a complexidade de construir uma grande infraestrutura interna de IA/ML.
Construído por engenheiros, para engenheiros. Da orquestração de GPU em larga escala à otimização de inferência, nós resolvemos os problemas complexos em computação, armazenamento, rede e IA aplicada.
Listada na Nasdaq (NBIS) e sediada em Amsterdã, temos uma presença global com centros de P&D na Europa, Reino Unido, América do Norte e Israel. Nossa equipe de mais de 1,500 pessoas inclui centenas de engenheiros com profundo conhecimento em hardware, software e P&D de IA.
Como é trabalhar na Nebius
A Token Factory faz parte da Nebius Cloud, uma das maiores nuvens de GPU do mundo, executando dezenas de milhares de GPUs. Estamos construindo uma plataforma de inferência que torna todos os tipos de modelos fundamentais — texto, visão, áudio e arquiteturas multimodais emergentes — rápidos, confiáveis e fáceis de implantar em escala massiva. Para cumprir essa promessa, precisamos de um engenheiro que possa fazer a plataforma se comportar impecavelmente sob carga extrema e se recuperar graciosamente quando o inesperado Acontece.
Se a ideia de proteger a infraestrutura que impulsiona a IA multimodal de amanhã te energiza, gostaríamos de ouvir sua história.
Movimento rápido — Pensamento ousado — Crescimento constante — Impacto significativo — Confiança e autonomia real — Oportunidade de moldar o futuro da IA
Nesta função, você será responsável pela confiabilidade, desempenho e observabilidade de toda a pilha de inferência.
Seu dia começa com o design e o aprimoramento de pipelines de telemetria — métricas, logs e traces que transformam centenas de terabytes de sinal em insights claros e acionáveis. A partir daí, você pode ajustar os auto-scalers da Kubernetes para extrair mais eficiência das GPUs, criar módulos do Terraform que incorporem resiliência em cada novo cluster, ou fortalecer nossa lógica de roteamento de requisições e retentativas para que falhas transitórias passem despercebidas pelos usuários. Quando incidentes surgirem, você dependerá da automação e dos runbooks que ajudou a criar para detectar, isolar e remediar problemas em minutos, e então impulsionará a cultura de post-mortem que previne a recorrência. Todo esse esforço aponta para um único objetivo: escalar a plataforma suavemente enquanto atinge metas agressivas de custo e confiabilidade.
Requisitos mínimos
O sucesso na função exige profunda fluência com Kubernetes, Prometheus, Grafana, Terraform, e a arte da infraestrutura como código. Você escreve scripts confortavelmente em Python ou Bash, entende as nuances do design de alertas e SLOs para APIs de alto tráfago, e passou tempo suficiente em produção para saber como back-end distribuídos falham no mundo real. Experiência em gerenciar cargas de trabalho com uso intensivo de GPU — seja com vLLM, Triton, Ray ou outra pilha de aceleradores — será útil, assim como um histórico em MLOps ou plataformas de hospedagem de modelos. Acima de tudo, você se preocupa em construir sistemas autorreparáveis, prospera depurando o desempenho da camada de kernel à aplicação, e gosta de colaborar com engenheiros de software para transformar a confiabilidade em um recurso sobre o qual os usuários nunca precisam pensar.
Os candidatos devem ter autorização para trabalhar no país em que se candidatam e serão obrigados a fornecer prova de elegibilidade de emprego como condição de contratação.
Benefícios e Vantagens: *
- Remuneração competitiva *
- Oportunidades de crescimento na carreira e aprendizado *
- Flexibilidade e autonomia *
- Cultura colaborativa e inovadora *
- Oportunidade de trabalhar em projetos de IA impactantes *
- Ambiente internacional e equipes talentosas
Declaração de Igualdade de Oportunidades
A Nebius é um empregador que oferece igualdade de oportunidades. Estamos comprometidos em promover um ambiente de trabalho inclusivo e diversificado e em fornecer oportunidades de emprego iguais em todos os aspectos do emprego. Não discriminamos com base em raça, cor, religião, sexo (incluindo gravidez), origem nacional, ancestralidade, idade, deficiência, informação genética, estado civil, status de veterano, orientação sexual, identidade ou expressão de gênero, ou qualquer outra característica protegida pela lei aplicável.
Se você precisar de acomodações durante o processo de inscrição, por favor, nos informe.
