Lightning AI

Engenheiro de Infraestrutura (GPU e Computação)

Python
Tradução automática. Consulte o original.

QUEM SOMOS

Lightning AI é a empresa por trás do PyTorch Lightning. Fundada em 2019, construímos uma plataforma ponta a ponta para desenvolver, treinar e implantar sistemas de IA — projetada para levar ideias da pesquisa à produção com menos atrito. Através da nossa fusão com a Voltage Park, uma neocloud e Fábrica de IA, a Lightning AI combina software desenvolvido para desenvolvedores com computação de larga escala e custo-eficiente. As equipes obtêm as ferramentas de que precisam para experimentação, treinamento e inferência de produção, com segurança, observabilidade e controle integrados. Atendemos pesquisadores individuais, startups e grandes empresas. A Lightning AI opera globalmente com escritórios na cidade de Nova York, São Francisco, Seattle e Londres, e é apoiada pela Coatue, Index Ventures, Bain Capital Ventures e Firstminute.

A FORMA COMO TRABALHAMOS

As pessoas que prosperam aqui são construtores que agem rápido, comunicam-se abertamente, assumem responsabilidades e se aprimoram continuamente, suas equipes e nossa empresa. Veja como isso se traduz na prática:

  1. Aja com Urgência: Agimos rapidamente, tomamos decisões ponderadas e mantemos o ímpeto. Valorizamos a ação em vez da perfeição e aprendemos lançando.
  1. Assuma Responsabilidade: Somos responsáveis pelos resultados, não apenas pelo nosso trabalho individual. Tomamos decisões que impulsionam a empresa e as executamos.
  1. Comunique-se Abertamente: Comunicamo-nos diretamente, buscamos entender e criamos clareza para os outros. Conversas honestas nos ajudam a avançar mais rápido juntos.
  1. Construa Grandes Equipes: Lideramos pelo exemplo, capacitamos os outros e criamos equipes saudáveis onde as pessoas podem fazer seu melhor trabalho.
  1. Eleve o Padrão: Estamos sempre nos aprimorando. Aprendemos com o feedback, desafiamos-nos constantemente a crescer e focamos no trabalho que mais importa.
  1. Pense a Longo Prazo: Projetamos para o futuro. Criamos sistemas escaláveis, simplificamos a complexidade e usamos IA e automação para ampliar nosso impacto.

O QUE BUSCAMOS

A Lightning AI está buscando um Engenheiro de Infraestrutura de GPU e Computação para se juntar à nossa equipe de Engenharia de Infraestrutura.

Nesta função, você ajudará a ativar, validar e operar infraestrutura de computação bare-metal em larga escala, com foco particular em sistemas habilitados para GPU. Você trabalhará na interseção de hardware, sistemas e software — gerenciando diagnósticos e validação de sistemas, desenvolvendo automação, melhorando a confiabilidade e garantindo que os clusters estejam prontos para suportar cargas de trabalho exigentes de IA/ML e HPC.

Você desempenhará um papel fundamental na qualificação de GPU e em nível de sistema, executando ambientes de validação e clusters de teste, e aprimorando as ferramentas e fluxos de trabalho que suportam a ativação de infraestrutura em escala. Isso inclui gerenciar e evoluir nosso pipeline de imagens juntamente com sistemas de provisionamento e validação para garantir que nossa infraestrutura seja consistente, performática e confiável desde o primeiro dia.

Esta função pode ser totalmente remota nos EUA, ou híbrida em um de nossos escritórios centrais (NYC, SF, Seattle ou Londres), com viagens ocasionais da equipe e da empresa. Não podemos fornecer patrocínio de visto para esta posição no momento.

O QUE VOCÊ FARÁ

ATIVAÇÃO E VALIDAÇÃO DE SISTEMAS

  1. Gerenciar e evoluir sistemas para gerenciamento de imagens, implantação e validação em infraestrutura bare-metal
  1. Executar e manter clusters de teste usados para validação de sistemas, diagnósticos e ativação
  1. Validar firmware, drivers e imagens de SO em sistemas de computação e habilitados para GPU
  1. Apoiar esforços de qualificação de hardware para plataformas de próxima geração

DIAGNÓSTICOS E DESEMPENHO DE GPU

  1. Gerenciar fluxos de trabalho de diagnóstico e validação de GPU em infraestrutura de larga escala
  1. Diagnosticar e resolver problemas complexos em camadas de GPU, drivers, SO e hardware
  1. Analisar o desempenho do sistema e da GPU usando ferramentas como NVIDIA DCGM
  1. Identificar padrões de falha e impulsionar melhorias na estabilidade do sistema e na cobertura de validação

AUTOMAÇÃO E FERRAMENTAS

  1. Construir e manter automação para provisionamento, validação e ativação de sistemas
  1. Desenvolver ferramentas e fluxos de trabalho baseados em Python ou similares para melhorar a eficiência e reduzir a sobrecarga operacional manual
  1. Melhorar a confiabilidade, repetibilidade e escalabilidade de pipelines de imagens e sistemas de validação

SISTEMAS E OPERAÇÕES

  1. Gerenciar e operar sistemas baseados em Linux em ambientes de produção e validação
  1. Gerenciar tecnologia de virtualização
  1. Apoiar fluxos de trabalho de provisionamento bare-metal, incluindo sistemas baseados em PXE e imagens
  1. Interagir com sistemas de gerenciamento de hardware (por exemplo, IPMI, Redfish) para monitoramento e depuração

COLABORAÇÃO MULTIFUNCIONAL

  1. Colaborar com as equipes de Infraestrutura, Hardware e Data Center na ativação e validação de sistemas
  1. Colaborar com equipes de plataforma e ML para garantir que os sistemas atendam aos requisitos de carga de trabalho
  1. Contribuir para as melhores práticas de provisionamento, diagnóstico e gerenciamento de ciclo de vida de infraestrutura

O QUE VOCÊ PRECISA

QUALIFICAÇÕES REQUERIDAS

  1. 5+ anos de experiência em engenharia de infraestrutura, engenharia de sistemas ou funções relacionadas
  1. Forte experiência em sistemas Linux em ambientes de produção
  1. Experiência prática com sistemas habilitados para GPU e ferramentas como NVIDIA DCGM
  1. Familiaridade com provisionamento bare-metal e fluxos de trabalho de ativação de sistemas
  1. Proficiência em Python ou linguagens de script/programação similares para automação
  1. Capacidade de depurar problemas complexos em hardware, SO, GPUs e software de sistema

EXPERIÊNCIA IDEAL

  1. Experiência com interconexões de alta performance (por exemplo, InfiniBand, NVLink)
  1. Experiência com ambientes de boot PXE, sistemas LiveCD ou fluxos de trabalho de provisionamento baseados em imagem
  1. Experiência com interfaces de gerenciamento de hardware como iDRAC, IPMI ou Redfish
  1. Experiência em operações de data center, incluindo trabalho com hardware físico
  1. Experiência no suporte a cargas de trabalho de IA/ML ou HPC em escala
  1. Experiência com frameworks de validação de GPU ou processos de qualificação de hardware em larga escala

REMUNERAÇÃO

Estamos comprometidos em oferecer remuneração competitiva que reflita o valor que cada membro da equipe traz para nossa missão. As ofertas finais são baseadas em fatores como experiência, habilidades, localização geográfica e expectativas da função. Além do salário base, nosso pacote total de recompensas para funções elegíveis inclui um bônus discricionário, um componente de participação acionária significativo e benefícios abrangentes. A faixa salarial base anual prevista para esta função é:

$180,000—$220,000 USD

BENEFÍCIOS E VANTAGENS

Oferecemos um pacote de benefícios abrangente e competitivo projetado para apoiar a saúde, o bem-estar e o sucesso a longo prazo de nossos funcionários:

  • Cobertura de Saúde Abrangente: Cobertura médica, odontológica e oftalmológica para funcionários e dependentes elegíveis.
  • Participação Acionária Significativa: RSUs que dão aos funcionários uma participação no sucesso a longo prazo da empresa.
  • Poupança para Aposentadoria: Correspondência 401(k) (EUA) e contribuições de pensão (Reino Unido).
  • Férias Flexíveis: PTO ilimitado, feriados da empresa e feriados flutuantes para apoiar o equilíbrio entre vida pessoal e profissional.
  • Recesso de Inverno em Toda a Empresa: Duas semanas de recesso da empresa a cada inverno para desconectar e recarregar.
  • Licença Parental e Familiar Remunerada: Licença remunerada para apoiar você e sua família em momentos importantes da vida.
  • Desenvolvimento Profissional: Subsídio anual de aprendizado e desenvolvimento para apoiar seu crescimento profissional.
  • Benefícios de Bem-Estar: Subsídios de bem-estar e trabalho remoto para apoiar seu bem-estar físico e mental.
  • Programa de Licença Sabática: Quatro semanas de licença sabática remunerada após quatro anos de serviço.
  • Trabalho Flexível: Horários flexíveis e um modelo de trabalho híbrido para nossas equipes baseadas em escritório.
  • Refeições no Escritório: Refeições gratuitas em nossos escritórios centrais.

Os benefícios podem variar por local, equipe e função.

Na Lightning AI, estamos comprometidos em promover um ambiente de trabalho inclusivo e diversificado. Acreditamos que equipes diversas impulsionam a inovação e criam melhores produtos. Oferecemos oportunidades iguais de emprego a todos os funcionários e candidatos, sem distinção de raça, cor, religião, gênero, orientação sexual, identidade de gênero, origem nacional, idade, deficiência, status de veterano ou qualquer outra característica protegida. Estamos dedicados a construir uma cultura onde todos possam prosperar e contribuir em seu potencial máximo.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores