Lightning AI

Engenheiro(a) de Infraestrutura (Armazenamento)

Python
Tradução automática. Consulte o original.

QUEM SOMOS

Lightning AI é a empresa por trás do PyTorch Lightning. Fundada em 2019, construímos uma plataforma ponta a ponta para desenvolver, treinar e implantar sistemas de IA — projetada para levar ideias da pesquisa à produção com menos atrito. Através da nossa fusão com a Voltage Park, uma neocloud e Fábrica de IA, a Lightning AI combina software focado no desenvolvedor com computação de larga escala e custo-eficiente. As equipes obtêm as ferramentas de que precisam para experimentação, treinamento e inferência de produção, com segurança, observabilidade e controle integrados. Atendemos pesquisadores individuais, startups e grandes empresas. A Lightning AI opera globalmente com escritórios na cidade de Nova York, São Francisco, Seattle e Londres, e é apoiada pela Coatue, Index Ventures, Bain Capital Ventures e Firstminute.

A FORMA COMO TRABALHAMOS

As pessoas que prosperam aqui são construtores que agem rápido, comunicam-se abertamente, assumem responsabilidade e melhoram continuamente a si mesmas, suas equipes e nossa empresa. Veja como isso funciona na prática:

  • Aja com Urgência: Agimos rapidamente, tomamos decisões ponderadas e mantemos o ímpeto. Valorizamos a ação em vez da perfeição e aprendemos lançando.
  • Assuma Responsabilidade: Somos responsáveis pelos resultados, não apenas pelo nosso trabalho individual. Tomamos decisões que impulsionam a empresa para frente e as executamos.
  • Comunique-se Abertamente: Comunicamo-nos diretamente, buscamos entender e criamos clareza para os outros. Conversas honestas nos ajudam a avançar mais rápido juntos.
  • Construa Grandes Equipes: Lideramos pelo exemplo, capacitamos os outros e criamos equipes saudáveis onde as pessoas podem fazer seu melhor trabalho.
  • Eleve o Padrão: Estamos sempre nos aprimorando. Aprendemos com o feedback, nos desafiamos constantemente a crescer e focamos no trabalho que mais importa.
  • Pense a Longo Prazo: Projetamos para o futuro. Criamos sistemas escaláveis, simplificamos a complexidade e usamos IA e automação para ampliar nosso impacto.

O QUE BUSCAMOS

A Lightning AI está buscando um(a) Engenheiro(a) de Infraestrutura de Armazenamento para se juntar à nossa equipe de Engenharia de Infraestrutura.

O QUE VOCÊ FARÁ

Nesta função, você se concentrará na construção e operação dos sistemas de armazenamento que impulsionam cargas de trabalho de treinamento, inferência e HPC de IA/ML em larga escala. Você trabalhará na intersecção de software, hardware e operações — desenvolvendo automação, melhorando a confiabilidade e escalando sistemas de armazenamento distribuído em nossa infraestrutura bare-metal.

Você ajudará a gerenciar o plano de dados de nossa infraestrutura de armazenamento, suportando acesso a dados de alta taxa de transferência e baixa latência para algumas das cargas de trabalho de IA mais exigentes. Você desempenhará um papel fundamental no gerenciamento e evolução de nossa pilha de armazenamento (incluindo VAST e sistemas compatíveis com S3 como Ceph), garantindo desempenho, confiabilidade e eficiência em escala.

SISTEMAS DE ARMAZENAMENTO E INFRAESTRUTURA

  1. Operar e escalar sistemas de armazenamento distribuído, incluindo VAST e armazenamento de objetos compatível com S3 (por exemplo, Ceph)
  1. Melhorar o desempenho, a confiabilidade e a eficiência dos sistemas de armazenamento que suportam cargas de trabalho de IA/ML em larga escala
  1. Solucionar problemas complexos de armazenamento e caminho de dados em camadas de hardware e software
  1. Otimizar o desempenho do armazenamento para suportar cargas de trabalho de treinamento e inferência de IA de alta taxa de transferência e baixa latência

AUTOMAÇÃO E FERRAMENTAS

  1. Construir e manter automação para provisionamento, gerenciamento e monitoramento de infraestrutura de armazenamento
  1. Desenvolver ferramentas e fluxos de trabalho baseados em Python para reduzir a sobrecarga operacional manual
  1. Melhorar o gerenciamento do ciclo de vida dos clusters de armazenamento, desde a implantação até a manutenção e escalonamento

SISTEMAS E OPERAÇÕES

  1. Gerenciar e operar sistemas baseados em Linux em produção, incluindo ambientes bare-metal
  1. Colaborar com as equipes de infraestrutura e data center no lançamento de hardware, atualizações e resolução de problemas
  1. Suportar planejamento de capacidade, rastreamento de utilização e previsão para sistemas de armazenamento
  1. Utilizar monitoramento e telemetria para diagnosticar problemas e melhorar o desempenho e a confiabilidade do sistema

COLABORAÇÃO INTERFUNCIONAL

  1. Trabalhar em estreita colaboração com as equipes de Engenharia de Infraestrutura, Engenharia de Rede e Plataforma para integrar o armazenamento à plataforma mais ampla
  1. Contribuir para discussões de design sobre novas implantações de infraestrutura e estratégias de escalonamento
  1. Ajudar a definir as melhores práticas para operar sistemas de armazenamento em ambientes de computação de alto desempenho

Esta função pode ser totalmente remota nos EUA, ou híbrida em um de nossos centros de escritório (NYC, SF, Seattle ou Londres), com viagens ocasionais da equipe e da empresa. Não podemos fornecer patrocínio de visto para esta posição neste momento.

Na Lightning AI, estamos comprometidos em promover um local de trabalho inclusivo e diversificado. Acreditamos que equipes diversas impulsionam a inovação e criam melhores produtos. Oferecemos oportunidades iguais de emprego a todos os funcionários e candidatos, sem distinção de raça, cor, religião, gênero, orientação sexual, identidade de gênero, origem nacional, idade, deficiência, status de veterano ou qualquer outra característica protegida. Estamos dedicados a construir uma cultura onde todos possam prosperar e contribuir com todo o seu potencial.

O QUE VOCÊ PRECISA

QUALIFICAÇÕES REQUERIDAS

  1. 5+ anos de experiência em engenharia de infraestrutura, engenharia de sistemas ou funções relacionadas
  1. Experiência prática operando sistemas de armazenamento distribuído (por exemplo, VAST, Ceph ou similar)
  1. Forte experiência em sistemas Linux em ambientes de produção
  1. Proficiência em Python ou linguagens de script/programação similares para automação
  1. Experiência trabalhando com infraestrutura bare-metal e sistemas orientados a hardware
  1. Capacidade de depurar problemas complexos em limites de sistema (armazenamento, SO, hardware, rede)
  1. Experiência com protocolos de rede de armazenamento (por exemplo, NFS ou similar)
  1. Experiência com planejamento de capacidade, monitoramento e ajuste de desempenho

EXPERIÊNCIA IDEAL

  1. Experiência com sistemas de armazenamento VAST em ambientes de produção
  1. Experiência operando armazenamento de objetos compatível com S3 em escala
  1. Experiência em operações de data center, incluindo trabalho com hardware físico
  1. Familiaridade com cargas de trabalho de IA/ML ou HPC e seus requisitos de armazenamento
  1. Experiência em sistemas distribuídos de alto desempenho ou baixa latência
  1. Familiaridade com tecnologias de transferência de dados de alto desempenho (por exemplo, RDMA, GPU Direct Storage)
  1. Experiência no suporte a cargas de trabalho baseadas em GPU ou clusters de computação em larga escala

REMUNERAÇÃO

Estamos comprometidos em oferecer remuneração competitiva que reflita o valor que cada membro da equipe traz para nossa missão. As ofertas finais são baseadas em fatores como experiência, habilidades, localização geográfica e expectativas da função. Além do salário base, nosso pacote total de recompensas para funções elegíveis inclui um bônus discricionário, um componente de participação acionária significativo e benefícios abrangentes.

A faixa salarial base anual prevista para esta função é: $180,000—$220,000 USD

BENEFÍCIOS E VANTAGENS

Oferecemos um pacote de benefícios abrangente e competitivo projetado para apoiar a saúde, o bem-estar e o sucesso a longo prazo de nossos funcionários:

  • Cobertura de Saúde Abrangente: Cobertura médica, odontológica e oftalmológica para funcionários e dependentes elegíveis.
  • Participação Acionária Significativa: RSUs que dão aos funcionários uma participação no sucesso a longo prazo da empresa.
  • Poupança para Aposentadoria: Correspondência 401(k) (EUA) e contribuições de pensão (Reino Unido).
  • Férias Flexíveis: PTO ilimitado, feriados da empresa e feriados flutuantes para apoiar o equilíbrio entre vida pessoal e profissional.
  • Recesso de Inverno em Toda a Empresa: Duas semanas de recesso da empresa a cada inverno para desconectar e recarregar.
  • Licença Parental e Familiar Remunerada: Licença remunerada para apoiar você e sua família em momentos importantes da vida.
  • Desenvolvimento Profissional: Subsídio anual de aprendizado e desenvolvimento para apoiar seu crescimento profissional.
  • Benefícios de Bem-Estar: Subsídios de bem-estar e trabalho remoto para apoiar seu bem-estar físico e mental.
  • Programa de Licença Sabática: Quatro semanas de licença sabática remunerada após quatro anos de serviço.
  • Trabalho Flexível: Horários flexíveis e um modelo de trabalho híbrido para nossas equipes baseadas em escritório.
  • Refeições no Escritório: Refeições gratuitas em nossos centros de escritório.

Os benefícios podem variar por local, equipe e função.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores