Roku
Figure
Helix AI Engineer, Reinforcement Learning
Sobre a oportunidade
Figure é uma empresa de robótica de IA que desenvolve robôs humanoides autônomos de propósito geral.
Nosso objetivo é construir sistemas de IA incorporados que possam perceber, raciocinar e agir no mundo real.
Figure está sediada em San Jose, CA, e esta função requer 5 dias por semana de colaboração no escritório.
Os EUA A faixa salarial base para esta posição em tempo integral é entre $200,000 - $400,000
O pagamento oferecido para esta posição pode variar com base em vários fatores individuais, incluindo conhecimento, habilidades e experiência relacionados ao trabalho. O pacote total de remuneração também pode incluir componentes/benefícios adicionais, dependendo da função específica. Esta informação será compartilhada se uma oferta de emprego for estendida.
Nossa equipe Helix é responsável pelo desenvolvimento dos sistemas centrais de IA que impulsionam a autonomia humanoide.
Estamos procurando um Engenheiro de IA Helix, Reinforcement Learning para desenvolver sistemas de aprendizado que permitam aos robôs adquirir habilidades por meio de interação, feedback e experiência.
Esta função se concentra na aplicação e avanço do aprendizado por reforço em ambientes de simulação e do mundo real — melhorando o desempenho da política, a robustez e a tomada de decisão de longo prazo em sistemas incorporados.
RESPONSABILIDADES
- Projetar e implementar algoritmos de aprendizado por reforço para agentes incorporados operando em ambientes do mundo real e simulados
- Treinar políticas que aprendem com interação, feedback e experiência em larga escala em diversas tarefas
- Desenvolver estratégias de modelagem de recompensa, atribuição de crédito e exploração para comportamentos complexos de longo prazo
- Melhorar a robustez da política a desafios do mundo real, como ruído, observabilidade parcial e variabilidade do ambiente
- Trabalhar em configurações de RL online e offline, incluindo aprendizado a partir de dados de robôs registrados em larga escala
- Colaborar estreitamente com as equipes de pretraining, vídeo, generativa, de agentes e de aprendizado de robôs para integrar RL na pilha de autonomia completa
- Construir sistemas de treinamento escaláveis para RL, incluindo rollouts distribuídos, infraestrutura de simulação e gerenciamento de experimentos
- Projetar frameworks de avaliação para medir o desempenho, a estabilidade e a generalização da política
REQUISITOS
- Experiência no desenvolvimento e aplicação de algoritmos de aprendizado por reforço em ambientes complexos
- Forte compreensão dos fundamentos de RL (por exemplo, otimização de política, métodos de valor, RL baseado em modelo)
- Experiência no treinamento de políticas em simulação e/ou sistemas do mundo real
- Proficiência em frameworks de Python e deep learning como PyTorch
- Experiência com experimentação em larga escala e sistemas de treinamento distribuído
- Rigor experimental forte e capacidade de diagnosticar e melhorar sistemas de aprendizado
- Sólidas habilidades em engenharia de software e capacidade de construir sistemas escaláveis e confiáveis
- Capacidade de operar de forma independente e impulsionar problemas técnicos ambíguos e de alto impacto
QUALIFICAÇÕES BÔNUS
- Experiência na aplicação de RL em robótica, sistemas de controle ou IA incorporada
- Experiência com infraestrutura de RL em larga escala (rollouts distribuídos, simulação em escala)
- Background em RL offline, aprendizado por imitação ou abordagens de aprendizado híbrido
- Experiência em modelagem de recompensa ou aprendizado com humanos no loop
- Experiência em laboratórios líderes de IA como OpenAI, Google DeepMind, Anthropic ou xAI
- Familiaridade com sistemas de robótica, ambientes de simulação ou restrições de implantação no mundo real
- Histórico de publicações em aprendizado por reforço, machine learning ou robótica
