Nominal
Nebius
Engenheiro Sênior de Sistemas de Infraestrutura de IA (P&D / GPU / IA)
Sobre a Nebius
A Nebius está liderando uma nova era em infraestrutura de nuvem para a economia global de IA. Estamos construindo uma plataforma de nuvem de IA full-stack que suporta desenvolvedores e empresas desde o treinamento de dados e modelos até a implantação em produção, sem o custo e a complexidade de construir uma grande infraestrutura interna de IA/ML.
Construído por engenheiros, para engenheiros. Desde a orquestração de GPU em larga escala até a otimização de inferência, nós resolvemos os problemas difíceis em computação, armazenamento, rede e IA aplicada.
Listada na Nasdaq (NBIS) e sediada em Amsterdã, temos uma presença global com centros de P&D na Europa, Reino Unido, América do Norte e Israel. Nossa equipe de mais de 1,500 inclui centenas de engenheiros com profundo conhecimento em hardware, software e P&D de IA.
Como é trabalhar na Nebius
Rápido - Pensamento ousado - Crescimento constante - Impacto significativo - Confiança e autonomia real - Oportunidade de moldar o futuro da IA
A função
A função envolve a formulação de hipóteses técnicas, o projeto de testes direcionados, a análise de logs de sistema e dados de hardware de baixo nível, e a distinção entre falhas de GPU, host, firmware, interconexão, térmicas e de hardware físico. Ela exige forte senso de responsabilidade, curiosidade e a capacidade de transformar problemas ambíguos em conclusões baseadas em evidências e procedimentos de solução de problemas repetíveis.
Esta é uma função sênior de engenharia de sistemas focada em diagnosticar e resolver falhas complexas de hardware e plataforma em infraestrutura de IA de alto desempenho. Este engenheiro trabalhará com Linux, servidores GPU, PCIe, firmware, energia e refrigeração para determinar a causa raiz real de problemas que podem não ter um procedimento de solução de problemas existente.
Quais habilidades esperamos que você tenha: *
- Mínimo de 5 anos de experiência prática em engenharia de sistemas em Linux, hardware de servidor, firmware, PCIe e plataformas de GPU ou computação de alto desempenho. *
- Extensa experiência em Linux, particularmente usando Linux como um ambiente para depuração de hardware, solução de problemas em nível de sistema e investigação de plataforma. *
- Conhecimento do kernel Linux e experiência com depuração ou solução de problemas em nível de kernel. *
- Forte conhecimento de arquitetura de servidor moderna, particularmente em ambientes de alto desempenho baseados em GPU. *
- Forte conhecimento de plataformas de GPU NVIDIA e ferramentas de diagnóstico, incluindo nvidia-smi, análise XID e SXID, comportamento do GSP e driver, NVLink, NVSwitch, Fabric Manager, diagnósticos DCGM e testes NCCL *
- Profundo conhecimento de PCIe, incluindo topologia, enumeração, root complexes, endpoints, switches, bridges, retimers, velocidade e largura de link, erros AER e DPC, timeouts de link e falhas de link. Os candidatos devem entender como erros em nível de protocolo podem se relacionar com problemas de camada física ou integridade de sinal. *
- Experiência em benchmarking de sistemas para desempenho, estabilidade, eficiência energética, comportamento térmico e características de carga de trabalho *
- Compreensão aprofundada das interações de firmware em BIOS/UEFI, BMC, CPLD/FPGA, firmware de GPU, firmware de NIC e outros componentes da plataforma. *
- Experiência com comunicação e depuração de hardware de baixo nível usando I²C, SMBus, PMBus, mapas de registradores, máscaras de bits, dados em nível de byte e palavra, e datasheets de dispositivos. *
- Capacidade demonstrada de solucionar problemas complexos de hardware, software e rede. *
- Experiência em investigação profunda de problemas, análise de causa raiz e otimização de desempenho em ambientes de nuvem ou computação de alto desempenho. *
- Fortes habilidades analíticas e de resolução de problemas com mentalidade focada em desempenho. *
- Scripting e automação usando várias linguagens (Python\Go)
Principais benefícios para funcionários: *
- Seguro saúde: 100% de cobertura médica, odontológica e oftalmológica paga pela empresa para funcionários e famílias. *
- Plano 401(k): até 4% de contrapartida da empresa com vesting imediato. *
- Licença parental: 20 semanas pagas para cuidadores primários, 12 semanas para cuidadores secundários. *
- Reembolso de trabalho remoto: até $85/mês para celular e internet. *
- Seguro contra invalidez e seguro de vida: cobertura de seguro de curto prazo, longo prazo e de vida paga pela empresa.
Benefícios e Vantagens: *
- Remuneração competitiva *
- Oportunidades de crescimento e aprendizado na carreira *
- Flexibilidade e autonomia *
- Cultura colaborativa e inovadora *
- Oportunidade de trabalhar em projetos de IA impactantes *
- Ambiente internacional e equipes talentosas
Remuneração *
- Oferecemos um salário competitivo variando de $179,500 a $224,300 + bônus trimestrais por desempenho.
Junte-se à Nebius Hoje!
Declaração de Igualdade de Oportunidades
A Nebius é um empregador que oferece igualdade de oportunidades. Estamos comprometidos em promover um local de trabalho inclusivo e diversificado e em fornecer oportunidades de emprego iguais em todos os aspectos do emprego. Não discriminamos com base em raça, cor, religião, sexo (incluindo gravidez), origem nacional, ancestralidade, idade, deficiência, informação genética, estado civil, status de veterano, orientação sexual, identidade ou expressão de gênero, ou qualquer outra característica protegida pela lei aplicável.
Os candidatos devem ter autorização para trabalhar no país em que se candidatam e serão obrigados a fornecer prova de elegibilidade de emprego como condição de contratação.
Se você precisar de acomodações durante o processo de inscrição, por favor, nos informe.
