Databricks

Engenheiro(a) de Software Sênior, AI Runtime

Tradução automática. Consulte o original.

Sobre a oportunidade

P-1428 Na Databricks, somos apaixonados por capacitar equipes de dados a resolver os problemas mais complexos do mundo — desde tornar realidade o próximo meio de transporte até acelerar o desenvolvimento de avanços médicos. Fazemos isso construindo e operando a melhor plataforma de infraestrutura de dados e IA do mundo, para que nossos clientes possam utilizar insights profundos de dados para aprimorar seus negócios.

O treinamento e a personalização de modelos de IA de última geração são uma das cargas de trabalho mais exigentes da computação e estão no centro da missão de IA Mosaic da Databricks. O AI Runtime (AIR) é nossa plataforma gerenciada para treinamento e ajuste fino de GPU em larga escala. Ele oferece aos clientes acesso sob demanda a frotas dos mais recentes aceleradores e uma experiência sem servidor que oculta a complexidade de provisionamento, agendamento e orquestração de trabalhos multi-nó, com a resiliência para manter o treinamento em execução por dias ou semanas em milhares de GPUs. O AIR potencializa todo o espectro de treinamento personalizado, desde o ajuste fino de modelos abertos até o pré-treinamento de modelos de fundação em escala de fronteira, para algumas das equipes de IA mais sofisticadas do mundo.

Como Engenheiro(a) de Software Sênior para AI Runtime,

você desempenhará um papel crítico na construção e escalonamento dos sistemas que tornam o treinamento em larga escala rápido, confiável e sem esforço. Você impulsionará a arquitetura e a evolução da pilha de treinamento de GPU gerenciada, abrangendo agendamento e capacidade, desempenho de treinamento distribuído, tolerância a falhas e a experiência do desenvolvedor de lançamento e operação de trabalhos em escala. Além das contribuições práticas para os sistemas principais, você ajudará a moldar a direção técnica do AIR, orientará outros engenheiros, fará parcerias com equipes de produto, pesquisa e plataforma, e contribuirá para as iniciativas que expandem o impacto técnico e de negócios do treinamento personalizado na Databricks.

O impacto que você terá

  1. Impulsionar a arquitetura e a evolução da plataforma de treinamento de GPU gerenciada do AIR, entregando treinamento escalável, de alto rendimento e resiliente em frotas que abrangem milhares de aceleradores.
  1. Resolver os problemas mais difíceis em treinamento em larga escala, incluindo orquestração multi-nó, estratégias de paralelismo distribuído, agendamento de GPU e roteamento dinâmico, carregamento de dados de alto rendimento e checkpoint e restauração para trabalhos de longa duração.
  1. Aumentar a eficiência da GPU e o desempenho do treinamento, elevando a utilização (como utilização de FLOPs do modelo e rendimento de ponta a ponta) e reduzindo o custo por execução de treinamento em diversas arquiteturas de modelo e gerações de hardware.
  1. Construir as bases de resiliência e observabilidade que mantêm os trabalhos multi-nó saudáveis, detectando e recuperando-se de falhas de hardware e software com interrupção mínima para os clientes.
  1. Fazer parceria com equipes de produto, pesquisa e plataforma para moldar as APIs, CLI e a experiência do desenvolvedor que facilitam o lançamento, monitoramento e depuração de trabalhos de treinamento de produção.
  1. Liderar esforços de engenharia de ponta a ponta, desde o design até a implantação em produção, mantendo um alto padrão de desempenho, correção e confiabilidade.
  1. Fazer contribuições diretas de alto impacto para os sistemas centrais por trás do AIR e ajudar a trazer suporte para os mais recentes aceleradores e novas regiões à medida que a frota cresce.
  1. Defender a excelência em engenharia, orientar outros engenheiros por meio de revisões de design e discussões técnicas, e contribuir para a direção técnica da Databricks em infraestrutura de treinamento de IA.

O que procuramos

  1. 5+ anos de experiência na construção e operação de sistemas distribuídos em larga escala, com experiência em infraestrutura de treinamento de GPU, computação de alto desempenho ou sistemas de ML.
  1. Experiência com frameworks de treinamento distribuído (como PyTorch, FSDP, DeepSpeed ou Megatron) e as estratégias de paralelismo (dados, tensor, pipeline e paralelismo de sequência) usadas para treinar modelos grandes.
  1. Forte compreensão dos padrões de resiliência de treinamento, incluindo checkpointing, detecção de falhas e recuperação automática para trabalhos multi-nó de longa duração.
  1. Sólido conhecimento dos fundamentos de desempenho de GPU, incluindo arquitetura de acelerador, interconexões de alta velocidade (como NVLink e InfiniBand ou RoCE), comunicação coletiva e os gargalos que governam o rendimento e a utilização do treinamento.
  1. Experiência na construção e operação de produtos de plataforma gerenciados e multi-tenant na nuvem, com SLAs e SLOs claros para disponibilidade, desempenho e confiabilidade.
  1. Forte base em algoritmos, estruturas de dados e design de sistemas aplicados a sistemas distribuídos em larga escala e sensíveis ao desempenho.
  1. Capacidade comprovada de entregar iniciativas tecnicamente complexas e de alto impacto que criam valor claro para o cliente ou para o negócio.
  1. Fortes habilidades de comunicação e a capacidade de colaborar com equipes de produto, pesquisa e infraestrutura em um ambiente de rápida evolução.
  1. Mentalidade focada no cliente com a capacidade de alinhar detalhes de implementação com metas de produto, e paixão por orientar engenheiros e promover a excelência técnica.
  1. Bacharelado em Ciência da Computação ou área relacionada (mestrado ou doutorado preferencial).

Transparência da Faixa Salarial

A Databricks está comprometida com práticas de remuneração justas e equitativas. As faixas salariais para esta função são listadas abaixo e representam a faixa salarial esperada para funções não comissionáveis ou os ganhos no alvo para funções comissionáveis. A remuneração real é baseada em vários fatores que são exclusivos de cada candidato, incluindo, mas não se limitando a, habilidades relacionadas ao trabalho, profundidade de experiência, certificações e treinamento relevantes e local de trabalho específico. Com base nos fatores acima, a Databricks antecipa a utilização de toda a amplitude da faixa. O pacote total de remuneração para esta posição também pode incluir elegibilidade para bônus anual de desempenho, ações e os benefícios listados acima. Para mais informações sobre em qual faixa seu local está, visite nossa página aqui databricks.com/sites/default/files/2024-08/us-pay-zone-mapping.pdf.

Faixa Salarial Local

$160,000—$225,000 USD

Nosso Compromisso com a Diversidade e Inclusão

Na Databricks, estamos comprometidos em promover uma cultura diversa e inclusiva onde todos possam se destacar. Tomamos grande cuidado para garantir que nossas práticas de contratação sejam inclusivas e atendam aos padrões de igualdade de oportunidades de emprego. Indivíduos que buscam emprego na Databricks são considerados sem levar em conta idade, cor, deficiência, etnia, estado civil ou familiar, identidade ou expressão de gênero, idioma, origem nacional, capacidade física e mental, afiliação política, raça, religião, orientação sexual, status socioeconômico, status de veterano e outras características protegidas.

Conformidade

Se o acesso a tecnologia ou código-fonte controlado por exportação for necessário para o desempenho das funções do cargo, fica a critério do Empregador solicitar uma licença do governo dos EUA para tais posições, e o Empregador pode recusar prosseguir com um candidato com base apenas nisso.

Sobre a Databricks

A Databricks é a empresa de Dados e IA. Mais de 20,000 organizações em todo o mundo — incluindo adidas, AT&T, Bayer, Block, Mastercard, Rivian, Unilever e 70% das Fortune 500 — confiam na Plataforma de Dados + IA da Databricks para construir e escalar aplicativos, análises e agentes de dados e IA. Com sede em São Francisco e mais de 30 escritórios em todo o mundo, a Databricks oferece uma plataforma unificada que inclui Genie, Lakebase, Agent Bricks, Lakeflow, Lakehouse e Unity Catalog. Para saber mais, siga a Databricks no LinkedIn linkedin.com/company/databricks, X x.com/databricks, YouTube youtube.com/@Databricks e Instagram instagram.com/databricksinc/?hl=en.

Benefícios

Na Databricks, nos esforçamos para fornecer benefícios e vantagens abrangentes que atendam às necessidades de todos os nossos funcionários. Para detalhes específicos sobre os benefícios oferecidos em sua região, clique aqui docs.google.com/document/d/154un3e8Xav4BceOSlcYFZRGEuQI54xMxVydRwQn54eQ/edit?usp=sharing.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores