Zuora
Lightning AI
Engenheiro de Infraestrutura (GPU e Computação)
QUEM SOMOS
Lightning AI é a empresa por trás do PyTorch Lightning. Fundada em 2019, construímos uma plataforma ponta a ponta para desenvolver, treinar e implantar sistemas de IA — projetada para levar ideias da pesquisa à produção com menos atrito. Através da nossa fusão com a Voltage Park, uma neocloud e Fábrica de IA, a Lightning AI combina software desenvolvido para desenvolvedores com computação de larga escala e custo-eficiente. As equipes obtêm as ferramentas de que precisam para experimentação, treinamento e inferência de produção, com segurança, observabilidade e controle integrados. Atendemos pesquisadores individuais, startups e grandes empresas. A Lightning AI opera globalmente com escritórios na cidade de Nova York, São Francisco, Seattle e Londres, e é apoiada pela Coatue, Index Ventures, Bain Capital Ventures e Firstminute.
A FORMA COMO TRABALHAMOS
As pessoas que prosperam aqui são construtores que agem rápido, comunicam-se abertamente, assumem responsabilidades e se aprimoram continuamente, suas equipes e nossa empresa. Veja como isso se traduz na prática:
- Aja com Urgência: Agimos rapidamente, tomamos decisões ponderadas e mantemos o ímpeto. Valorizamos a ação em vez da perfeição e aprendemos lançando.
- Assuma Responsabilidade: Somos responsáveis pelos resultados, não apenas pelo nosso trabalho individual. Tomamos decisões que impulsionam a empresa e as executamos.
- Comunique-se Abertamente: Comunicamo-nos diretamente, buscamos entender e criamos clareza para os outros. Conversas honestas nos ajudam a avançar mais rápido juntos.
- Construa Grandes Equipes: Lideramos pelo exemplo, capacitamos os outros e criamos equipes saudáveis onde as pessoas podem fazer seu melhor trabalho.
- Eleve o Padrão: Estamos sempre nos aprimorando. Aprendemos com o feedback, desafiamos-nos constantemente a crescer e focamos no trabalho que mais importa.
- Pense a Longo Prazo: Projetamos para o futuro. Criamos sistemas escaláveis, simplificamos a complexidade e usamos IA e automação para ampliar nosso impacto.
O QUE BUSCAMOS
A Lightning AI está buscando um Engenheiro de Infraestrutura de GPU e Computação para se juntar à nossa equipe de Engenharia de Infraestrutura.
Nesta função, você ajudará a ativar, validar e operar infraestrutura de computação bare-metal em larga escala, com foco particular em sistemas habilitados para GPU. Você trabalhará na interseção de hardware, sistemas e software — gerenciando diagnósticos e validação de sistemas, desenvolvendo automação, melhorando a confiabilidade e garantindo que os clusters estejam prontos para suportar cargas de trabalho exigentes de IA/ML e HPC.
Você desempenhará um papel fundamental na qualificação de GPU e em nível de sistema, executando ambientes de validação e clusters de teste, e aprimorando as ferramentas e fluxos de trabalho que suportam a ativação de infraestrutura em escala. Isso inclui gerenciar e evoluir nosso pipeline de imagens juntamente com sistemas de provisionamento e validação para garantir que nossa infraestrutura seja consistente, performática e confiável desde o primeiro dia.
Esta função pode ser totalmente remota nos EUA, ou híbrida em um de nossos escritórios centrais (NYC, SF, Seattle ou Londres), com viagens ocasionais da equipe e da empresa. Não podemos fornecer patrocínio de visto para esta posição no momento.
O QUE VOCÊ FARÁ
ATIVAÇÃO E VALIDAÇÃO DE SISTEMAS
- Gerenciar e evoluir sistemas para gerenciamento de imagens, implantação e validação em infraestrutura bare-metal
- Executar e manter clusters de teste usados para validação de sistemas, diagnósticos e ativação
- Validar firmware, drivers e imagens de SO em sistemas de computação e habilitados para GPU
- Apoiar esforços de qualificação de hardware para plataformas de próxima geração
DIAGNÓSTICOS E DESEMPENHO DE GPU
- Gerenciar fluxos de trabalho de diagnóstico e validação de GPU em infraestrutura de larga escala
- Diagnosticar e resolver problemas complexos em camadas de GPU, drivers, SO e hardware
- Analisar o desempenho do sistema e da GPU usando ferramentas como NVIDIA DCGM
- Identificar padrões de falha e impulsionar melhorias na estabilidade do sistema e na cobertura de validação
AUTOMAÇÃO E FERRAMENTAS
- Construir e manter automação para provisionamento, validação e ativação de sistemas
- Desenvolver ferramentas e fluxos de trabalho baseados em Python ou similares para melhorar a eficiência e reduzir a sobrecarga operacional manual
- Melhorar a confiabilidade, repetibilidade e escalabilidade de pipelines de imagens e sistemas de validação
SISTEMAS E OPERAÇÕES
- Gerenciar e operar sistemas baseados em Linux em ambientes de produção e validação
- Gerenciar tecnologia de virtualização
- Apoiar fluxos de trabalho de provisionamento bare-metal, incluindo sistemas baseados em PXE e imagens
- Interagir com sistemas de gerenciamento de hardware (por exemplo, IPMI, Redfish) para monitoramento e depuração
COLABORAÇÃO MULTIFUNCIONAL
- Colaborar com as equipes de Infraestrutura, Hardware e Data Center na ativação e validação de sistemas
- Colaborar com equipes de plataforma e ML para garantir que os sistemas atendam aos requisitos de carga de trabalho
- Contribuir para as melhores práticas de provisionamento, diagnóstico e gerenciamento de ciclo de vida de infraestrutura
O QUE VOCÊ PRECISA
QUALIFICAÇÕES REQUERIDAS
- 5+ anos de experiência em engenharia de infraestrutura, engenharia de sistemas ou funções relacionadas
- Forte experiência em sistemas Linux em ambientes de produção
- Experiência prática com sistemas habilitados para GPU e ferramentas como NVIDIA DCGM
- Familiaridade com provisionamento bare-metal e fluxos de trabalho de ativação de sistemas
- Proficiência em Python ou linguagens de script/programação similares para automação
- Capacidade de depurar problemas complexos em hardware, SO, GPUs e software de sistema
EXPERIÊNCIA IDEAL
- Experiência com interconexões de alta performance (por exemplo, InfiniBand, NVLink)
- Experiência com ambientes de boot PXE, sistemas LiveCD ou fluxos de trabalho de provisionamento baseados em imagem
- Experiência com interfaces de gerenciamento de hardware como iDRAC, IPMI ou Redfish
- Experiência em operações de data center, incluindo trabalho com hardware físico
- Experiência no suporte a cargas de trabalho de IA/ML ou HPC em escala
- Experiência com frameworks de validação de GPU ou processos de qualificação de hardware em larga escala
REMUNERAÇÃO
Estamos comprometidos em oferecer remuneração competitiva que reflita o valor que cada membro da equipe traz para nossa missão. As ofertas finais são baseadas em fatores como experiência, habilidades, localização geográfica e expectativas da função. Além do salário base, nosso pacote total de recompensas para funções elegíveis inclui um bônus discricionário, um componente de participação acionária significativo e benefícios abrangentes. A faixa salarial base anual prevista para esta função é:
$180,000—$220,000 USD
BENEFÍCIOS E VANTAGENS
Oferecemos um pacote de benefícios abrangente e competitivo projetado para apoiar a saúde, o bem-estar e o sucesso a longo prazo de nossos funcionários:
- Cobertura de Saúde Abrangente: Cobertura médica, odontológica e oftalmológica para funcionários e dependentes elegíveis.
- Participação Acionária Significativa: RSUs que dão aos funcionários uma participação no sucesso a longo prazo da empresa.
- Poupança para Aposentadoria: Correspondência 401(k) (EUA) e contribuições de pensão (Reino Unido).
- Férias Flexíveis: PTO ilimitado, feriados da empresa e feriados flutuantes para apoiar o equilíbrio entre vida pessoal e profissional.
- Recesso de Inverno em Toda a Empresa: Duas semanas de recesso da empresa a cada inverno para desconectar e recarregar.
- Licença Parental e Familiar Remunerada: Licença remunerada para apoiar você e sua família em momentos importantes da vida.
- Desenvolvimento Profissional: Subsídio anual de aprendizado e desenvolvimento para apoiar seu crescimento profissional.
- Benefícios de Bem-Estar: Subsídios de bem-estar e trabalho remoto para apoiar seu bem-estar físico e mental.
- Programa de Licença Sabática: Quatro semanas de licença sabática remunerada após quatro anos de serviço.
- Trabalho Flexível: Horários flexíveis e um modelo de trabalho híbrido para nossas equipes baseadas em escritório.
- Refeições no Escritório: Refeições gratuitas em nossos escritórios centrais.
Os benefícios podem variar por local, equipe e função.
Na Lightning AI, estamos comprometidos em promover um ambiente de trabalho inclusivo e diversificado. Acreditamos que equipes diversas impulsionam a inovação e criam melhores produtos. Oferecemos oportunidades iguais de emprego a todos os funcionários e candidatos, sem distinção de raça, cor, religião, gênero, orientação sexual, identidade de gênero, origem nacional, idade, deficiência, status de veterano ou qualquer outra característica protegida. Estamos dedicados a construir uma cultura onde todos possam prosperar e contribuir em seu potencial máximo.
