Roku
Databricks
Engenheiro de Software Staff, AI Runtime
Sobre a oportunidade
P-1930
Na Databricks, somos apaixonados por capacitar equipes de dados a resolver os problemas mais difíceis do mundo — desde tornar o próximo modo de transporte uma realidade até acelerar o desenvolvimento de avanços médicos. Fazemos isso construindo e executando a melhor plataforma de infraestrutura de dados e IA do mundo para que nossos clientes possam usar insights profundos de dados para melhorar seus negócios.
O treinamento e a personalização de modelos de IA de última geração são uma das cargas de trabalho mais exigentes da computação e estão no centro da missão Mosaic AI da Databricks. AI Runtime (AIR) é nossa plataforma gerenciada para treinamento e ajuste fino em larga escala de GPU. Ela oferece aos clientes acesso sob demanda a frotas dos mais recentes aceleradores e uma experiência sem servidor que oculta a complexidade de provisionamento, agendamento e orquestração de trabalhos multi-nó, com a resiliência para manter o treinamento em execução por dias ou semanas em milhares de GPUs. O AIR potencializa todo o espectro de treinamento personalizado, desde o ajuste fino de modelos abertos até o pré-treinamento de modelos de fundação em escala de fronteira, para algumas das equipes de IA mais sofisticadas do mundo.
Como Engenheiro de Software Staff para AI Runtime,
você desempenhará um papel crítico na construção e escalonamento dos sistemas que tornam o treinamento em larga escala rápido, confiável e sem esforço. Você impulsionará a arquitetura e a evolução da pilha de treinamento gerenciada de GPU, abrangendo agendamento e capacidade, desempenho de treinamento distribuído, tolerância a falhas e a experiência do desenvolvedor de lançamento e operação de trabalhos em escala. Além de contribuições práticas para sistemas centrais, você ajudará a definir a visão técnica de longo prazo para o AIR, orientará engenheiros seniores, fará parcerias com equipes de produto, pesquisa e plataforma, e liderará as iniciativas que expandem o impacto técnico e de negócios do treinamento personalizado na Databricks.
O impacto que você terá
- Impulsionar a arquitetura e a evolução da plataforma de treinamento gerenciada de GPU do AIR, entregando treinamento escalável, de alto rendimento e resiliente em frotas que abrangem milhares de aceleradores.
- Resolver os problemas mais difíceis em treinamento em larga escala, incluindo orquestração multi-nó, estratégias de paralelismo distribuído, agendamento de GPU e roteamento dinâmico, carregamento de dados de alto rendimento e checkpoint e restauração para trabalhos de longa duração.
- Aumentar a eficiência da GPU e o desempenho do treinamento, elevando a utilização (como utilização de FLOPs do modelo e throughput ponta a ponta) e reduzindo o custo por execução de treinamento em diversas arquiteturas de modelo e gerações de hardware.
- Construir as bases de resiliência e observabilidade que mantêm os trabalhos multi-nó saudáveis, detectando e recuperando-se de falhas de hardware e software com interrupção mínima para os clientes.
- Fazer parceria com equipes de produto, pesquisa e plataforma para moldar as APIs, CLI e a experiência do desenvolvedor que facilitam o lançamento, monitoramento e depuração de trabalhos de treinamento de produção.
- Liderar esforços de engenharia de ponta a ponta, do design à implantação em produção, mantendo um alto padrão de desempenho, correção e confiabilidade.
- Fazer contribuições diretas de alto impacto para os sistemas centrais por trás do AIR e ajudar a habilitar o suporte para os mais recentes aceleradores e novas regiões à medida que a frota cresce.
- Defender a excelência em engenharia, orientar outros engenheiros por meio de revisões de design e discussões técnicas, e ajudar a moldar a direção técnica de longo prazo da Databricks em infraestrutura de treinamento de IA.
Requisitos mínimos
O que procuramos
- 10+ anos de experiência na construção e operação de sistemas distribuídos em larga escala, com profundidade significativa em infraestrutura de treinamento de GPU, computação de alto desempenho ou sistemas de ML.
- Experiência prática com frameworks de treinamento distribuído (como PyTorch, FSDP, DeepSpeed ou Megatron) e as estratégias de paralelismo (dados, tensor, pipeline e paralelismo de sequência) usadas para treinar modelos grandes.
- Forte compreensão de padrões de resiliência de treinamento, incluindo checkpointing, detecção de falhas e recuperação automática para trabalhos multi-nó de longa duração.
- Sólido conhecimento dos fundamentos de desempenho de GPU, incluindo arquitetura do acelerador, interconexões de alta velocidade (como NVLink e InfiniBand ou RoCE), comunicação coletiva e os gargalos que governam o throughput e a utilização do treinamento.
- Experiência na construção e operação de produtos de plataforma gerenciados e multi-tenant na nuvem, com SLAs e SLOs claros para disponibilidade, desempenho e confiabilidade.
- Forte base em algoritmos, estruturas de dados e design de sistemas aplicados a sistemas distribuídos em larga escala e sensíveis ao desempenho.
- Capacidade comprovada de entregar iniciativas tecnicamente complexas e de alto impacto que criam valor claro para o cliente ou para o negócio.
- Fortes habilidades de comunicação e a capacidade de colaborar entre equipes de produto, pesquisa e infraestrutura em um ambiente de rápida evolução.
- Mentalidade estratégica e orientada a produtos com a capacidade de alinhar a execução técnica a uma visão de longo prazo, e paixão por orientar engenheiros e promover a excelência técnica.
- Bacharelado em Ciência da Computação ou área relacionada (mestrado ou doutorado preferencial).
Transparência da Faixa Salarial
A Databricks está comprometida com práticas de remuneração justas e equitativas. As faixas salariais para esta função estão listadas abaixo e representam a faixa salarial esperada para funções não comissionáveis ou os ganhos no alvo para funções comissionáveis. Os pacotes de remuneração reais são baseados em vários fatores que são exclusivos de cada candidato, incluindo, mas não se limitando a, habilidades relacionadas ao trabalho, profundidade de experiência, certificações e treinamento relevantes e local de trabalho específico. Com base nos fatores acima, a Databricks antecipa a utilização de toda a amplitude da faixa. O pacote total de remuneração para esta posição também pode incluir elegibilidade para bônus anual de desempenho, ações e os benefícios listados acima. Para mais informações sobre em qual faixa sua localização se encontra, visite nossa página aqui databricks.com/sites/default/files/2024-08/us-pay-zone-mapping.pdf.
Faixa Salarial Local $190,000—$265,000 USD
Nosso Compromisso com a Diversidade e Inclusão
Na Databricks, estamos comprometidos em promover uma cultura diversa e inclusiva onde todos possam se destacar. Tomamos muito cuidado para garantir que nossas práticas de contratação sejam inclusivas e atendam aos padrões de igualdade de oportunidades de emprego. Indivíduos que procuram emprego na Databricks são considerados independentemente de idade, cor, deficiência, etnia, estado civil ou familiar, identidade ou expressão de gênero, idioma, origem nacional, capacidade física e mental, afiliação política, raça, religião, orientação sexual, status socioeconômico, status de veterano e outras características protegidas.
Conformidade
Se o acesso a tecnologia ou código-fonte controlado para exportação for necessário para o desempenho das funções do cargo, fica a critério do Empregador solicitar uma licença do governo dos EUA para tais posições, e o Empregador pode recusar prosseguir com um candidato apenas com base nisso.
Sobre a Databricks
A Databricks é a empresa de Dados e IA. Mais de 20,000 organizações em todo o mundo — incluindo adidas, AT&T, Bayer, Block, Mastercard, Rivian, Unilever e 70% das empresas da Fortune 500 — confiam na Plataforma de Dados + IA da Databricks para construir e escalar aplicativos, análises e agentes de dados e IA. Com sede em São Francisco e mais de 30 escritórios ao redor do mundo, a Databricks oferece uma plataforma unificada que inclui Genie, Lakebase, Agent Bricks, Lakeflow, Lakehouse e Unity Catalog. Para saber mais, siga a Databricks no LinkedIn linkedin.com/company/databricks, X x.com/databricks, YouTube youtube.com/@Databricks e Instagram instagram.com/databricksinc/?hl=en.
Benefícios
Na Databricks, nos esforçamos para fornecer benefícios e vantagens abrangentes que atendam às necessidades de todos os nossos funcionários. Para detalhes específicos sobre os benefícios oferecidos em sua região, clique aqui docs.google.com/document/d/154un3e8Xav4BceOSlcYFZRGEuQI54xMxVydRwQn54eQ/edit?usp=sharing.
