Arqiva
Lightning AI
Engenheiro(a) de Infraestrutura (GPU e Computação)
QUEM SOMOS
Lightning AI é a empresa por trás do PyTorch Lightning. Fundada em 2019, construímos uma plataforma ponta a ponta para desenvolver, treinar e implantar sistemas de IA — projetada para transformar ideias da pesquisa em produção com menos atrito.
Através da nossa fusão com a Voltage Park, uma neocloud e Fábrica de IA, a Lightning AI combina software focado no desenvolvedor com computação de larga escala e custo-eficiente. As equipes obtêm as ferramentas de que precisam para experimentação, treinamento e inferência de produção, com segurança, observabilidade e controle integrados.
Atendemos pesquisadores individuais, startups e grandes empresas. A Lightning AI opera globalmente com escritórios na cidade de Nova York, São Francisco, Seattle e Londres, e é apoiada por Coatue, Index Ventures, Bain Capital Ventures e Firstminute.
A FORMA COMO TRABALHAMOS
As pessoas que prosperam aqui são construtores que agem rápido, comunicam-se abertamente, assumem responsabilidade e melhoram continuamente a si mesmas, suas equipes e nossa empresa. Veja como isso se manifesta na prática:
- Aja com Urgência: Agimos rapidamente, tomamos decisões ponderadas e mantemos o ímpeto. Valorizamos a ação em vez da perfeição e aprendemos lançando.
- Assuma Responsabilidade: Somos responsáveis pelos resultados, não apenas pelo nosso trabalho individual. Tomamos decisões que impulsionam a empresa e as executamos.
- Comunique-se Abertamente: Comunicamo-nos diretamente, buscamos entender e criamos clareza para os outros. Conversas honestas nos ajudam a avançar mais rápido juntos.
- Construa Grandes Equipes: Lideramos pelo exemplo, capacitamos os outros e criamos equipes saudáveis onde as pessoas podem fazer seu melhor trabalho.
- Eleve o Padrão: Estamos sempre nos aprimorando. Aprendemos com o feedback, nos desafiamos consistentemente a crescer e focamos no trabalho que mais importa.
- Pense a Longo Prazo: Projetamos para o futuro. Criamos sistemas escaláveis, simplificamos a complexidade e usamos IA e automação para ampliar nosso impacto.
O QUE BUSCAMOS
A Lightning AI está buscando um(a) Engenheiro(a) de Infraestrutura Sênior de GPU e Computação experiente para se juntar à nossa equipe de Engenharia de Infraestrutura.
O QUE VOCÊ FARÁ
Nesta função, você ajudará a colocar em operação, validar e operar infraestrutura de computação bare-metal em larga escala, com foco particular em sistemas habilitados para GPU. Você trabalhará na intersecção de hardware, sistemas e software — gerenciando diagnósticos e validação de sistemas, desenvolvendo automação, melhorando a confiabilidade e garantindo que os clusters estejam prontos para suportar cargas de trabalho exigentes de IA/ML e HPC.
Você desempenhará um papel fundamental na qualificação de sistemas em nível de GPU e sistema, executando ambientes de validação e clusters de teste, e aprimorando as ferramentas e fluxos de trabalho que suportam a implantação de infraestrutura em escala. Isso inclui gerenciar e evoluir nosso pipeline de imagens juntamente com sistemas de provisionamento e validação para garantir que nossa infraestrutura seja consistente, performática e confiável desde o primeiro dia.
IMPLANTAÇÃO E VALIDAÇÃO DE SISTEMAS
- Gerenciar e evoluir sistemas para gerenciamento de imagens, implantação e validação em infraestrutura bare-metal
- Executar e manter clusters de teste usados para validação de sistemas, diagnósticos e implantação
- Validar firmware, drivers e imagens de SO em sistemas habilitados para computação e GPU
- Apoiar esforços de qualificação de hardware para plataformas de próxima geração
DIAGNÓSTICO E DESEMPENHO DE GPU
- Gerenciar fluxos de trabalho de diagnóstico e validação de GPU em infraestrutura de larga escala
- Diagnosticar e resolver problemas complexos em camadas de GPU, drivers, SO e hardware
- Analisar o desempenho do sistema e da GPU usando ferramentas como NVIDIA DCGM
- Identificar padrões de falha e impulsionar melhorias na estabilidade do sistema e na cobertura de validação
AUTOMAÇÃO E FERRAMENTAS
- Construir e manter automação para provisionamento, validação e implantação de sistemas
- Desenvolver ferramentas e fluxos de trabalho baseados em Python ou similares para melhorar a eficiência e reduzir a sobrecarga operacional manual
- Melhorar a confiabilidade, repetibilidade e escalabilidade de pipelines de imagem e sistemas de validação
SISTEMAS E OPERAÇÕES
- Gerenciar e operar sistemas baseados em Linux em ambientes de produção e validação
- Gerenciar tecnologia de virtualização
- Apoiar fluxos de trabalho de provisionamento bare-metal, incluindo sistemas baseados em PXE e imagem
- Interagir com sistemas de gerenciamento de hardware (por exemplo, IPMI, Redfish) para monitoramento e depuração
COLABORAÇÃO INTERFUNCIONAL
- Colaborar com as equipes de Infraestrutura, Hardware e Data Center em implantação e validação de sistemas
- Colaborar com equipes de plataforma e ML para garantir que os sistemas atendam aos requisitos de carga de trabalho
- Contribuir para as melhores práticas de provisionamento, diagnóstico e gerenciamento de ciclo de vida da infraestrutura
REMUNERAÇÃO
Esta função pode ser totalmente remota nos EUA, ou híbrida em um de nossos centros de escritório (NYC, SF, Seattle ou Londres), com viagens ocasionais da equipe e da empresa. Não podemos fornecer patrocínio de visto para esta posição neste momento.
Estamos comprometidos em oferecer remuneração competitiva que reflita o valor que cada membro da equipe traz para nossa missão. As ofertas finais são baseadas em fatores como experiência, habilidades, localização geográfica e expectativas da função. Além do salário base, nosso pacote total de recompensas para funções elegíveis inclui um bônus discricionário, um componente de participação acionária significativo e benefícios abrangentes.
A faixa salarial base anual prevista para esta função é: $180,000—$220,000 USD
Na Lightning AI, estamos comprometidos em promover um local de trabalho inclusivo e diversificado. Acreditamos que equipes diversas impulsionam a inovação e criam melhores produtos. Oferecemos oportunidades iguais de emprego a todos os funcionários e candidatos, sem distinção de raça, cor, religião, gênero, orientação sexual, identidade de gênero, origem nacional, idade, deficiência, status de veterano ou qualquer outra característica protegida. Estamos dedicados a construir uma cultura onde todos possam prosperar e contribuir com seu potencial máximo.
O QUE VOCÊ PRECISA
QUALIFICAÇÕES REQUERIDAS
- 5+ anos de experiência em engenharia de infraestrutura, engenharia de sistemas ou funções relacionadas
- Forte experiência em sistemas Linux em ambientes de produção
- Experiência prática com sistemas habilitados para GPU e ferramentas como NVIDIA DCGM
- Familiaridade com provisionamento bare-metal e fluxos de trabalho de implantação de sistemas
- Proficiência em Python ou linguagens de script/programação similares para automação
- Capacidade de depurar problemas complexos em hardware, SO, GPUs e software de sistema
EXPERIÊNCIA IDEAL
- Experiência com interconexões de alta performance (por exemplo, InfiniBand, NVLink)
- Experiência com ambientes de boot PXE, sistemas LiveCD ou fluxos de trabalho de provisionamento baseados em imagem
- Experiência com interfaces de gerenciamento de hardware como iDRAC, IPMI ou Redfish
- Experiência em operações de data center, incluindo trabalho com hardware físico
- Experiência no suporte a cargas de trabalho de IA/ML ou HPC em escala
- Experiência com frameworks de validação de GPU ou processos de qualificação de hardware em larga escala
BENEFÍCIOS E VANTAGENS
Oferecemos um pacote de benefícios abrangente e competitivo, projetado para apoiar a saúde, o bem-estar e o sucesso a longo prazo de nossos funcionários:
- Cobertura de Saúde Abrangente: Cobertura médica, odontológica e oftalmológica para funcionários e dependentes elegíveis.
- Participação Acionária Significativa: RSUs que dão aos funcionários uma participação no sucesso de longo prazo da empresa.
- Poupança para Aposentadoria: Correspondência de 401(k) (EUA) e contribuições de pensão (Reino Unido).
- Férias Flexíveis: PTO ilimitado, feriados da empresa e feriados flutuantes para apoiar o equilíbrio entre vida pessoal e profissional.
- Recesso de Inverno em Toda a Empresa: Duas semanas de recesso da empresa a cada inverno para desconectar e recarregar.
- Licença Parental e Familiar Remunerada: Licença remunerada para apoiar você e sua família nos momentos importantes da vida.
- Desenvolvimento Profissional: Subsídio anual de aprendizado e desenvolvimento para apoiar seu crescimento profissional.
- Benefícios de Bem-Estar: Subsídios de bem-estar e trabalho remoto para apoiar seu bem-estar físico e mental.
- Programa de Licença Sabática: Quatro semanas de licença sabática remunerada após quatro anos de serviço.
- Trabalho Flexível: Horários flexíveis e um modelo de trabalho híbrido para nossas equipes baseadas em escritório.
- Refeições no Escritório: Refeições gratuitas em nossos centros de escritório.
Os benefícios podem variar por local, equipe e função.
