Lightning AI

Engenheiro Sênior de Operações de Infraestrutura

PythonKubernetesGo
Tradução automática. Consulte o original.

QUEM SOMOS

Lightning AI é a empresa por trás do PyTorch Lightning. Fundada em 2019, construímos uma plataforma ponta a ponta para desenvolver, treinar e implantar sistemas de IA — projetada para levar ideias da pesquisa à produção com menos atrito.

Através da nossa fusão com a Voltage Park, uma neocloud e Fábrica de IA, a Lightning AI combina software developer-first com computação de larga escala e custo-eficiente. As equipes obtêm as ferramentas de que precisam para experimentação, treinamento e inferência de produção, com segurança, observabilidade e controle integrados.

Atendemos pesquisadores individuais, startups e grandes empresas. A Lightning AI opera globalmente com escritórios na cidade de Nova York, São Francisco, Seattle e Londres, e é apoiada por Coatue, Index Ventures, Bain Capital Ventures e Firstminute.

A FORMA COMO TRABALHAMOS

As pessoas que prosperam aqui são construtores que agem rápido, comunicam-se abertamente, assumem responsabilidade e melhoram continuamente a si mesmas, suas equipes e nossa empresa. Veja como isso se manifesta na prática: *

  1. Agir com Urgência: Agimos rapidamente, tomamos decisões ponderadas e mantemos o ímpeto. Valorizamos a ação em vez da perfeição e aprendemos enviando. *
  1. Assumir Responsabilidade: Somos responsáveis pelos resultados, não apenas pelo nosso trabalho individual. Tomamos decisões que impulsionam a empresa e as executamos. *
  1. Comunicar Abertamente: Comunicamo-nos diretamente, buscamos entender e criamos clareza para os outros. Conversas honestas nos ajudam a avançar mais rápido juntos. *
  1. Construir Grandes Equipes: Lideramos pelo exemplo, capacitamos os outros e criamos equipes saudáveis onde as pessoas podem fazer seu melhor trabalho. *
  1. Elevar o Padrão: Estamos sempre nos aprimorando. Aprendemos com o feedback, nos desafiamos consistentemente a crescer e focamos no trabalho que mais importa. *
  1. Pensar a Longo Prazo: Projetamos para o futuro. Criamos sistemas escaláveis, simplificamos a complexidade e usamos IA e automação para ampliar nosso impacto.

O QUE BUSCAMOS

A Lightning AI está buscando um Engenheiro Sênior de Operações de Infraestrutura experiente para ajudar a operar e escalar a infraestrutura por trás de uma das maiores frotas de GPUs do mundo.

Nossa equipe de Operações de Infraestrutura está no centro da confiabilidade de produção para a infraestrutura de IA da Lightning. A equipe trabalha com Linux, servidores bare-metal, GPUs, redes, armazenamento, provisionamento e orquestração de clusters, servindo como um ponto crítico de escalonamento técnico quando surgem problemas complexos de infraestrutura.

Este não é um papel tradicional de administração de sistemas ou operações baseadas em tickets. Você solucionará problemas em toda a pilha de infraestrutura, será responsável por problemas até a resolução e identificará oportunidades para automatizar o trabalho recorrente. Você também contribuirá para projetos de engenharia de longo prazo que melhoram a confiabilidade, padronizam as operações e permitem que nossa infraestrutura escale eficientemente.

Estamos procurando um generalista de infraestrutura que se sinta confortável em aprofundar quando algo quebra, mas que também se afaste e pergunte como podemos evitar que o mesmo problema aconteça novamente.

Esta função pode ser totalmente remota nos EUA, ou híbrida em um de nossos escritórios centrais nos EUA (NYC, SF ou Seattle) com ocasionais reuniões presenciais da equipe e da empresa. Não podemos fornecer patrocínio de visto para esta posição neste momento.

O QUE VOCÊ FARÁ *

  1. Operar e solucionar problemas de infraestrutura de GPU e bare-metal em larga escala em Linux, computação, redes, armazenamento e orquestração de clusters. *
  1. Servir como ponto de escalonamento técnico para problemas complexos de infraestrutura, conduzindo problemas desde a investigação inicial até a resolução e análise de causa raiz. *
  1. Ser responsável por fluxos de trabalho operacionais em todo o ciclo de vida da infraestrutura, incluindo provisionamento, configuração, validação, manutenção, remediação e descomissionamento. *
  1. Construir automação e ferramentas internas que eliminem o trabalho operacional repetitivo e permitam que a frota de infraestrutura escale eficientemente. *
  1. Identificar modos de falha recorrentes e fazer parceria com a Engenharia de Infraestrutura para construir sistemas mais confiáveis, repetíveis e automatizados. *
  1. Melhorar o provisionamento, monitoramento, diagnóstico e processos operacionais em uma pegada de infraestrutura em rápido crescimento. *
  1. Fazer parceria estreita com Engenharia de Infraestrutura, Engenharia de Rede, Operações de Data Center, Experiência do Cliente e Engenharia de Plataforma para resolver problemas que cruzam limites de equipe ou sistema. *
  1. Participar de uma rotação distribuída de plantão primário/secundário apoiando a infraestrutura de produção.

O QUE VOCÊ PRECISA

QUALIFICAÇÕES REQUERIDAS *

  1. Forte experiência operando e solucionando problemas de infraestrutura de produção baseada em Linux em escala. *
  1. Experiência em solucionar problemas complexos de infraestrutura em computação, redes, armazenamento e sistemas operacionais. *
  1. Fortes habilidades de automação e scripting usando Python, Go, Bash, Ansible ou ferramentas similares. *
  1. Experiência com Kubernetes, Slurm ou outros sistemas de orquestração de clusters e cargas de trabalho. *
  1. Experiência usando sistemas de monitoramento, observabilidade e telemetria para diagnosticar e solucionar problemas de infraestrutura de produção. *
  1. Fortes fundamentos de sistemas e redes, com um histórico de responsabilidade por problemas de produção até a resolução. *
  1. Confortável trabalhando em ambientes ambíguos e colaborando com equipes de engenharia, operações e voltadas para o cliente.

DIFERENCIAIS *

  1. Experiência em solucionar problemas, provisionar ou operar infraestrutura de servidores bare-metal. *
  1. Experiência em operar ou solucionar problemas de infraestrutura de GPU, HPC ou outra computação de alto desempenho. *
  1. Familiaridade com GPUs NVIDIA, DCGM, InfiniBand, RoCE/RDMA, NVLink ou redes de data center de alta velocidade. *
  1. Experiência com tecnologias de gerenciamento e provisionamento de hardware, como PXE, BMC, IPMI, Redfish ou iDRAC. *
  1. Experiência com sistemas de armazenamento distribuídos ou de alto desempenho, como VAST, Ceph, GPFS ou WEKA. *
  1. Experiência com fluxos de trabalho de infraestrutura como código, gerenciamento de configuração ou GitOps.

COMPENSAÇÃO

Estamos comprometidos em oferecer remuneração competitiva que reflita o valor que cada membro da equipe traz para nossa missão. As ofertas finais são baseadas em fatores como experiência, habilidades, localização geográfica e expectativas da função. Além do salário base, nosso pacote total de recompensas para funções elegíveis inclui um bônus discricionário, um componente de participação acionária significativo e benefícios abrangentes.

A faixa salarial base anual prevista para esta função é: $175,000—$200,000 USD

Na Lightning AI, estamos comprometidos em promover um local de trabalho inclusivo e diversificado. Acreditamos que equipes diversas impulsionam a inovação e criam melhores produtos. Oferecemos oportunidades iguais de emprego a todos os funcionários e candidatos, sem distinção de raça, cor, religião, gênero, orientação sexual, identidade de gênero, origem nacional, idade, deficiência, status de veterano ou qualquer outra característica protegida. Estamos dedicados a construir uma cultura onde todos possam prosperar e contribuir com todo o seu potencial.

BENEFÍCIOS E VANTAGENS

Oferecemos um pacote de benefícios abrangente e competitivo projetado para apoiar a saúde, o bem-estar e o sucesso a longo prazo de nossos funcionários: *

  • Cobertura de Saúde Abrangente: Cobertura médica, odontológica e oftalmológica para funcionários e dependentes elegíveis. *
  • Participação Acionária Significativa: RSUs que dão aos funcionários uma participação no sucesso de longo prazo da empresa. *
  • Poupança para Aposentadoria: Correspondência de 401(k) (EUA) e contribuições de pensão (Reino Unido). *
  • Tempo Livre Flexível: PTO ilimitado, feriados da empresa e feriados flutuantes para apoiar o equilíbrio entre vida pessoal e profissional. *
  • Recesso de Inverno em Toda a Empresa: Duas semanas de recesso da empresa a cada inverno para desconectar e recarregar. *
  • Licença Parental e Familiar Remunerada: Licença remunerada para apoiar você e sua família em momentos importantes da vida. *
  • Desenvolvimento Profissional: Subsídio anual de aprendizado e desenvolvimento para apoiar seu crescimento profissional. *
  • Benefícios de Bem-Estar: Subsídios de bem-estar e trabalho remoto para apoiar seu bem-estar físico e mental. *
  • Programa de Licença Sabática: Quatro semanas de licença sabática remunerada após quatro anos de serviço. *
  • Trabalho Flexível: Horários flexíveis e um modelo de trabalho híbrido para nossas equipes baseadas em escritório. *
  • Refeições no Escritório: Refeições gratuitas em nossos escritórios centrais.

Os benefícios podem variar por local, equipe e função.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores