Databricks

Engenheiro(a) de IA Aplicada Senior Staff - Recuperação de Contexto

SQL
Tradução automática. Consulte o original.

A Missão

P-1549 Na Databricks, somos apaixonados por capacitar equipes de dados a resolver os problemas mais complexos do mundo — desde tornar realidade o próximo meio de transporte até acelerar o desenvolvimento de avanços médicos. Fazemos isso construindo e operando a melhor plataforma de infraestrutura de dados e IA do mundo, para que nossos clientes possam utilizar insights profundos de dados para aprimorar seus negócios.

Os agentes da Databricks são tão bons quanto o contexto que conseguem recuperar. Seja um agente respondendo a uma pergunta sobre a receita do último trimestre, depurando um job com falha, gerando SQL contra um lakehouse de tabelas 10,000, ou resumindo uma página da Wiki, sua qualidade é limitada pelo que ele consegue encontrar — e quão bem ele entende o que encontra.

Estamos contratando um(a) Engenheiro(a) de IA Aplicada Sênior Staff para ser responsável pela recuperação de contexto para agentes Databricks em provedores SaaS. Este é um papel de zero a um com dois objetivos profundamente conectados:

Se você possui profundo conhecimento em Recuperação de Informação, já implementou sistemas de recuperação para cargas de trabalho RAG e de agentes, e deseja construir o substrato — e os agentes sobre ele — que tornam cada agente Databricks mensuravelmente mais inteligente, esta função é para você.

Por Que Esta Posição

  1. Impacto fundamental. A recuperação é o maior fator de qualidade dos agentes. A pilha que você construirá ficará sob todos os agentes Databricks e todos os agentes criados por clientes em nossa plataforma.
  1. Greenfield com escala. Você terá a rara combinação de começar do zero e ter acesso imediato a escala empresarial massiva, dados reais de clientes e uma organização de pesquisa de classe mundial.
  1. A equipe certa. Você trabalhará ao lado de engenheiros e pesquisadores por trás de Lakehouse, Apache Spark™, Delta Lake, MLflow, MosaicML e DBRX.

O Que Você Fará

  1. Construir a pilha de recuperação — compreensão de consulta, compreensão de conteúdo, ranqueamento, recuperação e avaliação — em todos os dados empresariais SaaS armazenados em múltiplos sistemas.
  1. Construir os subagentes de busca que ficam no topo dessa pilha e raciocinam sobre qual contexto é necessário, como recuperá-lo e se o que voltou foi realmente o correto — fechando o ciclo entre a intenção de um agente e o substrato que o atende.
  1. Construir a pilha de recuperação completa do zero. Ser responsável pelo sistema de ponta a ponta: compreensão de consulta, compreensão e indexação de conteúdo, recuperação híbrida, ranqueamento e avaliação. Tomar as decisões arquiteturais que definirão como os agentes Databricks acessarão o contexto nos próximos anos.
  1. Recuperar dados heterogêneos — estruturados e não estruturados. Indexar e ranquear ativos estruturados (tabelas, colunas, consultas SQL, dashboards, código, notebooks, jobs) e conteúdo não estruturado (documentos, wikis, tickets, chats, imagens, vídeos, áudios). Cada modalidade tem seus próprios sinais — projetar a recuperação que os explore em vez de achatá-los.
  1. Conectar-se à área de superfície SaaS que os clientes realmente usam. Construir conectores e adaptadores de recuperação para os sistemas onde o conhecimento empresarial reside. Tratar cada fonte de recuperação com seus próprios sinais de frescor, permissões e ranqueamento.
  1. Otimizar para dois consumidores ao mesmo tempo. A recuperação deve servir tanto para LLMs (contexto fundamentado, eficiente em tokens, resistente a alucinações) quanto para humanos (descoberta intuitiva e explicável). Estes são objetivos diferentes e requerem sinais diferentes — ser responsável por ambos.
  1. Desvendar a compreensão de consulta para agentes. Consultas de agentes não se parecem com consultas da web. Construir reescrita de consulta, decomposição, classificação de intenção e resolução de entidades ajustadas para fluxos de trabalho agenticos de múltiplos turnos.
  1. Desvendar a compreensão de conteúdo em escala. Construir os pipelines que extraem estrutura, entidades, embeddings, resumos e metadados de cada tipo de ativo suportado — e mantê-los atualizados conforme os dados do cliente evoluem.
  1. Construir subagentes de busca que raciocinam sobre a recuperação. Projetar a camada agentica que decide qual contexto é necessário, quais fontes consultar, como decompor e rotear a busca e — criticamente — se o conteúdo recuperado é realmente suficiente para responder à pergunta. Esses subagentes planejarão buscas multi-hop, emitirão consultas de acompanhamento quando os resultados forem fracos, fundamentarão alegações contra evidências recuperadas e retornarão contexto de alta confiança (ou sinalizarão falha) para agentes upstream. É aqui que IR encontra raciocínio agentico.
  1. Construir o ciclo de avaliação para recuperação e subagentes. Implementar avaliações offline (nDCG, MRR, Recall@K, Precision@K), harnesses de LLM-como-juiz, rotulagem human-in-the-loop e experimentação online. Estender a avaliação além das métricas de ranqueamento para medir a qualidade da decisão do subagente — ele fez a pergunta de acompanhamento correta?, ele reconheceu corretamente quando a recuperação falhou?, ele fundamentou sua resposta na evidência correta?. Qualidade que você não pode medir é qualidade que você não pode entregar.
  1. Definir direção técnica e crescer a equipe. Definir o roadmap multianual, mentorar engenheiros seniores, fazer parcerias com líderes de Pesquisa, Produto e Plataforma, e elevar o padrão técnico em toda a organização.

O Que Buscamos

  1. 10+ anos de experiência em engenharia de software, com tempo significativo dedicado à construção de sistemas de recuperação, busca ou RAG em produção em escala.
  1. Profundo conhecimento em Recuperação de Informação (IR): recuperação lexical (BM25, Lucene/Elasticsearch/OpenSearch), recuperação densa (embeddings, índices ANN — FAISS, ScaNN, HNSW), recuperação híbrida e learning-to-rank.
  1. Experiência prática com recuperação moderna da era LLM: arquiteturas RAG, reescrita de consulta, re-ranqueamento com cross-encoders, estratégias de contexto longo e técnicas de fundamentação que reduzem alucinações.
  1. Experiência em projetar sistemas agenticos sobre recuperação — planejadores de busca, recuperação multi-hop/iterativa, verificações de auto-reflexão e suficiência, agentes que usam ferramentas e decidem o que buscar e verificam o que voltou.
  1. Forte compreensão de avaliação de relevância: nDCG, MRR, Precision@K, Recall@K; experimentação offline/online; frameworks de LLM-como-juiz; construção de pipelines de rotulagem humana.
  1. Experiência trabalhando com dados estruturados e não estruturados — você indexou e ranqueou tabelas, código e documentos no mesmo sistema, e tem opiniões sobre como fazer isso bem.
  1. Histórico comprovado de construção de 0→1: você implementou um sistema de recuperação a partir de um repositório vazio, tomou as decisões arquiteturais fundamentais e o expandiu para algo em que os clientes confiam.
  1. Capacidade demonstrada de operar como líder técnico: definir direção entre equipes, mentorar engenheiros seniores e influenciar o roadmap com parceiros de pesquisa, produto e plataforma.

Diferenciais

  1. Experiência em construir recuperação sobre fontes empresariais SaaS (permissões, frescor, multi-tenancy, indexação ciente de ACL).
  1. Background em sistemas agenticos, uso de ferramentas ou recuperação multi-turn para agentes LLM.
  1. Contribuições para projetos open-source de IR/busca, ou publicações em SIGIR, KDD, WWW, EMNLP, ou locais similares.
  1. Experiência em treinar ou ajustar modelos de embedding, rerankers ou modelos de compreensão de consulta.

Localização

Esta posição está baseada em nosso escritório em Mountain View, CA ou San Francisco, CA. Colaboração híbrida no escritório esperada.

Transparência da Faixa Salarial

A Databricks está comprometida com práticas de remuneração justas e equitativas. As faixas salariais para esta função estão listadas abaixo e representam a faixa salarial esperada para funções não comissionáveis ou ganhos no alvo para funções comissionáveis. A remuneração real é baseada em vários fatores exclusivos de cada candidato, incluindo, mas não se limitando a, habilidades relacionadas ao trabalho, profundidade de experiência, certificações e treinamento relevantes e localização específica de trabalho. Com base nos fatores acima, a Databricks antecipa a utilização de toda a amplitude da faixa. O pacote total de remuneração para esta posição também pode incluir elegibilidade para bônus anual de desempenho, ações e os benefícios listados acima. Para mais informações sobre em qual faixa sua localização se encontra, visite nossa página aqui databricks.com/sites/default/files/2024-08/us-pay-zone-mapping.pdf.

Faixa Salarial Local

$228,600—$342,800 USD

Nosso Compromisso com a Diversidade e Inclusão

Na Databricks, estamos comprometidos em promover uma cultura diversa e inclusiva onde todos possam se destacar. Tomamos grande cuidado para garantir que nossas práticas de contratação sejam inclusivas e atendam aos padrões de igualdade de oportunidades de emprego. Indivíduos que procuram emprego na Databricks são considerados sem levar em conta idade, cor, deficiência, etnia, estado civil ou familiar, identidade ou expressão de gênero, idioma, origem nacional, capacidade física e mental, afiliação política, raça, religião, orientação sexual, status socioeconômico, status de veterano e outras características protegidas.

Conformidade

Se o acesso a tecnologia ou código-fonte controlado para exportação for necessário para o desempenho das funções do cargo, fica a critério do Empregador solicitar uma licença do governo dos EUA para tais posições, e o Empregador pode recusar prosseguir com um candidato com base apenas nisso.

Sobre a Databricks

A Databricks é a Empresa de Dados e IA. Mais de 20,000 organizações em todo o mundo — incluindo adidas, AT&T, Bayer, Block, Mastercard, Rivian, Unilever e 70% das Fortune 500 — confiam na Plataforma de Dados + IA Databricks para construir e escalar aplicativos, análises e agentes de dados e IA. Com sede em São Francisco e mais de 30 escritórios em todo o mundo, a Databricks oferece uma plataforma unificada que inclui Genie, Lakebase, Agent Bricks, Lakeflow, Lakehouse e Unity Catalog. Para saber mais, siga a Databricks no LinkedIn linkedin.com/company/databricks, X x.com/databricks, YouTube youtube.com/@Databricks e Instagram instagram.com/databricksinc/?hl=en.

Benefícios

Na Databricks, nos esforçamos para fornecer benefícios e vantagens abrangentes que atendam às necessidades de todos os nossos funcionários. Para detalhes específicos sobre os benefícios oferecidos em sua região, clique aqui docs.google.com/document/d/154un3e8Xav4BceOSlcYFZRGEuQI54xMxVydRwQn54eQ/edit?usp=sharing.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores