Roku
Rubrik Job Board
Engenheiro(a) Sênior de Machine Learning
SOBRE A EQUIPE E A FUNÇÃO
Estamos construindo o SAGE, o Motor de Governança de IA Semântica da Rubrik, que é o primeiro sistema projetado para monitorar, governar e remediar agentes autônomos de IA em tempo real. O SAGE potencializa o Rubrik Agent Cloud: as empresas definem políticas de governança em linguagem natural, e os modelos de linguagem pequenos personalizados do SAGE atuam como juízes em cada ação do agente. Esses modelos são rápidos o suficiente para ficarem no caminho da requisição ativa e precisos o suficiente para que os clientes confiem neles para decisões de permitir/bloquear no tráfego de produção.
Em sua essência, o SAGE é "LLM-como-juiz" aplicado à governança de IA, utilizando a mesma técnica que a maioria das equipes usa para avaliação offline, mas produzida para aplicação em tempo real em escala empresarial. Nosso Policy Guard de SLM de primeira geração já supera os modelos de fronteira maiores com os quais fizemos benchmark em precisão, enquanto roda aproximadamente 5x mais rápido na mesma carga de trabalho. Estamos contratando para ampliar ainda mais essa liderança.
Como Engenheiro(a) de ML Aplicado na equipe SAGE, você trabalhará de ponta a ponta no ciclo de vida do modelo: curando dados, treinando modelos pequenos, servindo-os com latência de produção e fechando o loop de feedback com sinais reais de clientes. Os modelos que você construir não apenas aplicarão políticas no caminho da requisição ativa; eles também impulsionarão o Agent Rewind, a capacidade da Rubrik de desfazer instantânea e precisamente ações destrutivas de agentes autônomos e restaurar os dados afetados a um estado confiável.
Somos uma equipe colaborativa e aplicada que entrega modelos para clientes empresariais em semanas, e somos apaixonados por provar que modelos pequenos e especializados podem superar os LLMs de fronteira nos problemas que mais importam para a segurança e governança de IA.
JUNTE-SE A NÓS PARA PROTEGER E ACELERAR A TRANSFORMAÇÃO DE IA DO MUNDO
NATUREZA DAS ATIVIDADES ESPECIALIZADAS
➢ TREINAMENTO, AJUSTE FINO E DESTILAÇÃO DE MODELOS DE LINGUAGEM PEQUENOS E CLASSIFICADORES DE PRODUÇÃO (25% DO TEMPO)
- Ser o responsável pelo ciclo completo de treinamento dos SLMs e classificadores no caminho de aplicação em tempo real do SAGE, incluindo seleção do modelo base, ajuste fino supervisionado, otimização de preferência (DPO/RLAIF) e destilação de modelos professores de fronteira.
- Treinar modelos de anomalia e severidade de ação que detectam novos padrões de ataque no lado do agente em latência de decisão em tempo real, como comprometimentos de cadeia de suprimentos ou comportamentos destrutivos emergentes não cobertos por nenhuma política explícita. Pontuações de severidade roteiam os eventos de maior impacto para o Agent Rewind para remediação precisa.
- Projetar pipelines de treinamento adversarial, como agentes adversariais desenvolvidos para fins específicos e equipes vermelhas automatizadas cujos resultados alimentam diretamente a próxima execução de treinamento, transformando cada fraqueza descoberta em uma melhoria permanente do modelo.
- Empurrar a fronteira de Pareto de precisão, latência e custo para tarefas específicas de governança por meio de escolhas deliberadas pós-treinamento (LoRA, treinamento ciente de quantização, receitas de destilação, GRPO, etc.) e validar os ganhos em padrões de tráfego de produção.
➢ ENGENHARIA DE INFRAESTRUTURA DE SERVIÇO DE MODELOS E INFERÊNCIA DE ALTO DESEMPENHO (25% DO TEMPO)
- Projetar pipelines de inferência multi-estágio que lidam tanto com a aplicação em tempo real (bloqueio de prompt, resposta e chamada de ferramenta inline) quanto com cargas de trabalho em lote de alto rendimento (pontuação offline, back-testing, mineração de corpus) enquanto processam bilhões de tokens diariamente em frotas globais de agentes de clientes 2000.
- Otimizar implantações ativas por meio de pools de GPU compartilhados, roteamento ciente de cache KV, batching contínuo, quantização FP8/INT8 e decodificação especulativa para minimizar o custo de inferência enquanto mantém SLOs de P99 sub-segundo.
- Construir infraestrutura de camada de serviço que permita ao SAGE bloquear prompts, respostas e chamadas de ferramentas de agentes em tempo real sem se tornar um gargalo de latência. Isso inclui design de gateway de modelo, roteamento de requisição e degradação graciosa.
- Ser o responsável pelos padrões de tráfego canary, shadow e A/B para que novas variantes de modelo sejam validadas contra o tráfego real do cliente antes que tomem decisões de aplicação.
➢ CONSTRUÇÃO DE PIPELINES DE DADOS SINTÉTICOS E FRAMEWORKS DE AVALIAÇÃO ONLINE + OFFLINE (20% DO TEMPO)
- Projetar pipelines automatizados de curadoria de dados que mineram ambientes de clientes ativos (com garantias de privacidade e tenancy) em busca de exemplos de treinamento de alto valor por locatário, como violações de cauda longa, bordas de políticas de quase acerto ou comportamentos de agentes novos, e roteá-los de volta para o loop de treinamento para cada cliente.
- Construir back-testing automatizado de políticas, reproduzindo o tráfego histórico de agentes contra novas versões de modelos e políticas para detectar regressões e recomendar melhorias de políticas antes da implantação visível para o cliente.
- Construir sistemas de avaliação online para decisões de modelos ativos, incluindo pontuação shadow, detecção de drift, monitoramento de calibração e análise de lacunas de cobertura de políticas, garantindo que regressões de qualidade surjam em minutos em vez de semanas.
- Gerar dados sintéticos usando professores de fronteira (prompts adversariais, casos de borda de política, interações multi-turno) com avaliação que confirma que os dados sintéticos melhoram a qualidade downstream, não apenas o tamanho do conjunto de dados.
➢ MINERAÇÃO DE INSIGHTS, DIAGNÓSTICO DE FALHAS E MELHORIA ADAPTATIVA DE MODELOS (15% DO TEMPO)
- Construir harnesses de memória e contexto que fundem sensibilidade de dados, identidade e comportamento histórico do agente em decisões de aplicação em tempo real para garantir que o SAGE raciocine a partir do contexto específico de cada cliente.
- Minerando insights de agentes em milhões de sessões para expor lacunas de segurança, que são então transformadas em novas propostas de políticas, refinamentos de políticas existentes e sinais sobre problemas upstream em todo o ecossistema de agentes (Google ADK, Azure AI Foundry, Vertex AI e outros).
- Construir loops de feedback que transformam decisões de produção, falsos positivos sinalizados por clientes e violações perdidas em refinamentos de políticas em linguagem natural com um clique para reduzir as taxas de falsos positivos sem sacrificar o recall.
- Diagnosticar falhas de modelo de ponta a ponta e distinguir causas raiz de dados, receita de treinamento, arquitetura e camada de serviço, para que as correções cheguem à camada certa na primeira vez.
➢ COLABORAÇÃO INTERFUNCIONAL E TRADUÇÃO DA REALIDADE DO CLIENTE EM PROBLEMAS DE MODELAGEM (15% DO TEMPO)
- Fornecer liderança técnica em um pilar da pilha de modelos SAGE (infraestrutura de treinamento, metodologia de avaliação, arquitetura de serviço ou pipeline de insights), orientando engenheiros que estão começando em ML e moldando o roteiro técnico da equipe.
- Parceria com Gerenciamento de Produto, equipes voltadas para o cliente e analistas de segurança para traduzir requisitos de governança de agentes de clientes em problemas de modelagem bem definidos, e recuar quando ML for a ferramenta errada.
- Comunicar claramente o comportamento do modelo, trade-offs e limitações para stakeholders não-ML, como gerentes de produto e líderes de segurança corporativa, para que as decisões do modelo sejam tomadas com contexto completo.
- Colaborar com as equipes de plataforma Agent Cloud, engenharia de segurança e pesquisa de IA para integrar novos SLMs no caminho de aplicação em tempo real com a latência, observabilidade, rollback e garantias de tenancy corretas.
REQUISITOS MÍNIMOS PARA A POSIÇÃO
Educação: Bacharelado (ou superior) em Ciência da Computação, Machine Learning, Engenharia da Computação, Estatística ou área técnica intimamente relacionada é exigido. Projetar sistemas de treinamento e serviço de SLM de produção requer um profundo entendimento teórico de deep learning moderno, otimização e desempenho de sistemas.
CONHECIMENTO TÉCNICO ESPECIALIZADO
- 2+ anos de experiência profissional em ML com propriedade demonstrável de ponta a ponta em produção; você levou modelos do treinamento para o serviço de tráfego real de clientes e permaneceu responsável por eles através da iteração pós-lançamento.
- Proficiência em Python e PyTorch (ou equivalente) para treinamento e avaliação de nível de produção.
- Experiência prática em treinamento, ajuste fino ou destilação de modelos de linguagem ou classificadores em um ambiente de produção, incluindo SFT e pelo menos uma técnica de otimização de preferência (DPO, RLAIF ou RLHF).
- Experiência em produção com frameworks de serviço (vLLM, SGLang, TensorRT-LLM, ou equivalente), incluindo otimização envolvendo batching contínuo, estratégia de cache KV e quantização em tempo de inferência.
- Experiência em projetar sistemas de ML de ciclo fechado, incluindo a infraestrutura de avaliação, telemetria, curadoria de dados e dados sintéticos que transformam sinais de produção de volta em dados de treinamento e a próxima versão do modelo. Você construiu (não apenas usou) pelo menos um desses loops.
- Conforto em operar em escala de produção, incluindo depuração de modelos que lidam com QPS alto em caminhos de requisição de segurança crítica onde erros têm consequências visíveis para o cliente.
QUALIFICAÇÕES PREFERENCIAIS
- Profundo conhecimento em segurança de IA e red-teaming, incluindo experiência prática com ML adversarial, estratégias de defesa contra injeção de prompt e suítes de avaliação automatizadas para segurança de LLM de nível empresarial.
- Expertise em metodologia de avaliação de modelos, especificamente na construção de pipelines de "LLM-como-juiz", monitoramento de calibração e benchmarks adversariais que expõem os modos de falha sutis que métricas estáticas frequentemente negligenciam.
- Experiência com fusão de contexto e sistemas de recuperação que sintetizam sinais díspares - como sensibilidade de dados, identidade do usuário e histórico comportamental - em decisões de modelo de alta fidelidade.
- Experiência em produção com inferência de baixa latência para caminhos de requisição de streaming ou de segurança crítica onde o throughput do modelo e os SLOs de P99 são primordiais.
- Maestria em treinamento com rótulos eficientes e mineração de dados, utilizando supervisão fraca, aprendizado ativo e recuperação baseada em embedding para expor os exemplos de produção que impulsionam as melhorias de qualidade mais significativas.
- Experiência prática em destilação de conhecimento, transferindo com sucesso capacidades de modelos professores de fronteira para modelos alunos especializados e de pequena escala para serviço de produção.
- Familiaridade com o ecossistema de agentes, incluindo frameworks de uso de ferramentas, arquiteturas de gateway de modelo (MCP, LiteLLM ou equivalente) e padrões de agentes autônomos.
- Contribuições ativas em código aberto para bibliotecas convencionais de treinamento, serviço ou avaliação de ML.
INCLUSÃO @ RUBRIK
Os salários base mínimo e máximo para esta função são publicados abaixo; adicionalmente, a função é elegível para potencial bônus, ações e benefícios. O intervalo exibido reflete o alvo mínimo e máximo para salários de novos contratados para a função com base na localização nos EUA. Dentro do intervalo, o salário oferecido será determinado pela localização de trabalho e fatores adicionais, incluindo habilidades relacionadas ao trabalho, experiência e educação ou treinamento relevantes.
Faixa Salarial nos EUA $188,500—$282,700 USD
Linkedin linkedin.com/company/rubrik-inc/mycompany/verification/ | X (anteriormente Twitter) twitter.com/rubrikinc | Instagram instagram.com/rubrikinc/ | Rubrik.com rubrik.com
Na Rubrik, somos dedicados a promover uma cultura onde pessoas de todas as origens são valorizadas, sentem que pertencem e acreditam que podem ter sucesso. Nosso compromisso com a inclusão está no centro de nossa missão de proteger os dados do mundo.
Nosso objetivo é contratar e promover os melhores talentos, independentemente da origem. Revisamos continuamente nossas práticas de contratação para garantir a equidade e nos esforçamos para criar um ambiente onde cada funcionário tenha igual acesso a oportunidades de crescimento e excelência. Acreditamos em capacitar todos a trazerem seus eus autênticos para o trabalho e a atingirem seu potencial máximo.
Nossa estratégia de inclusão foca em três áreas centrais de nosso negócio e cultura
- Nossa Empresa: Estamos comprometidos em construir uma organização baseada em mérito que oferece acesso igualitário a crescimento e sucesso para todos os funcionários globalmente. Seu potencial é ilimitado aqui.
- Nossa Cultura: Buscamos criar uma atmosfera inclusiva onde indivíduos de todas as origens sintam um forte senso de pertencimento, possam prosperar e fazer seu melhor trabalho. Suas contribuições nos ajudam a inovar e quebrar barreiras.
- Nossas Comunidades: Estamos dedicados a expandir nosso engajamento com as comunidades em que operamos, criando oportunidades para talentos sub-representados e impulsionando maior inovação para nossos clientes. Seu impacto se estende além da Rubrik, contribuindo para comunidades mais seguras e fortes.
EMPREGADOR COM IGUALDADE DE OPORTUNIDADES/VETERANOS/PESSOAS COM DEFICIÊNCIA
A Rubrik é um Empregador com Igualdade de Oportunidades. Todos os candidatos qualificados receberão consideração para emprego sem distinção de raça, cor, religião, sexo, orientação sexual, identidade de gênero, origem nacional, idade, deficiência, informação genética, status de veterano protegido ou qualquer outro status protegido pela lei aplicável. A Rubrik oferece oportunidades de emprego iguais a funcionários e candidatos em todos os termos e condições de emprego, incluindo recrutamento, contratação, promoção, remuneração, treinamento, licença e rescisão.
A Rubrik fornece acomodações razoáveis a candidatos e funcionários qualificados com deficiências de acordo com a lei aplicável. Se você precisar de uma acomodação para participar do processo de inscrição ou para realizar seu trabalho, entre em contato com [email protected] [[email protected]]. As acomodações podem incluir alterações no processo de inscrição, documentos em formato alternativo, um intérprete de língua de sinais ou equipamentos especializados.
EEO É A LEI eeoc.gov/sites/default/files/2023-06/22-088_EEOC_KnowYourRights6.12ScreenRdr.pdf
NOTIFICAÇÃO DOS DIREITOS DO EMPREGADO SOB AS LEIS TRABALHISTAS FEDERAIS dol.gov/sites/dolgov/files/olms/regs/compliance/eo_posters/employeerightsposter2page_19final.pdf
A Rubrik (RBRK), a Empresa de Segurança e Operações de IA, lidera na interseção da proteção de dados, resiliência cibernética e aceleração de IA empresarial. O Rubrik Security Cloud oferece resiliência cibernética completa ao proteger, monitorar e recuperar dados, identidades e cargas de trabalho em nuvens. O Rubrik Agent Cloud acelera implantações de agentes de IA confiáveis em escala ao monitorar e auditar ações de agentes, aplicar guardrails em tempo real, ajustar para precisão e desfazer erros de agentes.
