Launch Legends
Figure
Ingénieur IA Helix, Apprentissage par Renforcement
À propos du poste
Figure est une entreprise de robotique IA développant des robots humanoïdes autonomes à usage général.
Notre objectif est de construire des systèmes d'IA incarnés capables de percevoir, raisonner et agir dans le monde réel.
Figure est basé à San Jose, CA, et ce poste nécessite 5 jours par semaine de collaboration en présentiel.
Les États-Unis La fourchette de salaire de base pour ce poste à temps plein est comprise entre 200,000 et 400,000 $
La rémunération offerte pour ce poste peut varier en fonction de plusieurs facteurs individuels, notamment les connaissances, les compétences et l'expérience liées au poste. L'ensemble de la rémunération peut également inclure des composantes/avantages supplémentaires en fonction du rôle spécifique. Ces informations seront communiquées si une offre d'emploi est faite.
Notre équipe Helix est responsable du développement des systèmes d'IA centraux qui alimentent l'autonomie humanoïde.
Nous recherchons un Ingénieur IA Helix, Apprentissage par Renforcement pour développer des systèmes d'apprentissage permettant aux robots d'acquérir des compétences par l'interaction, le feedback et l'expérience.
Ce rôle se concentre sur l'application et l'avancement de l'apprentissage par renforcement dans des environnements simulés et réels, améliorant la performance des politiques, la robustesse et la prise de décision à long terme dans les systèmes incarnés.
RESPONSABILITÉS
- Concevoir et implémenter des algorithmes d'apprentissage par renforcement pour des agents incarnés opérant dans des environnements réels et simulés
- Entraîner des politiques qui apprennent à partir de l'interaction, du feedback et d'une expérience à grande échelle sur diverses tâches
- Développer des stratégies de modélisation de récompense, d'attribution de crédit et d'exploration pour des comportements complexes à long terme
- Améliorer la robustesse des politiques face aux défis du monde réel tels que le bruit, l'observabilité partielle et la variabilité de l'environnement
- Travailler sur des scénarios RL en ligne et hors ligne, y compris l'apprentissage à partir de données de robots enregistrées à grande échelle
- Collaborer étroitement avec les équipes de pré-entraînement, vidéo, génératives, agents et apprentissage robotique pour intégrer le RL dans la pile d'autonomie complète
- Construire des systèmes d'entraînement évolutifs pour le RL, y compris des déploiements distribués, une infrastructure de simulation et la gestion des expériences
- Concevoir des cadres d'évaluation pour mesurer la performance, la stabilité et la généralisation des politiques
PROFIL RECHERCHÉ
- Expérience dans le développement et l'application d'algorithmes d'apprentissage par renforcement dans des environnements complexes
- Solide compréhension des fondamentaux du RL (par exemple, optimisation de politique, méthodes de valeur, RL basé sur modèle)
- Expérience dans l'entraînement de politiques en simulation et/ou dans des systèmes réels
- Maîtrise de Python et des frameworks de deep learning tels que PyTorch
- Expérience avec l'expérimentation à grande échelle et les systèmes d'entraînement distribués
- Rigueur expérimentale et capacité à diagnostiquer et améliorer les systèmes d'apprentissage
- Solides compétences en ingénierie logicielle et capacité à construire des systèmes évolutifs et fiables
- Capacité à travailler de manière autonome et à résoudre des problèmes techniques ambigus à fort impact
QUALIFICATIONS COMPLÉMENTAIRES
- Expérience dans l'application du RL à la robotique, aux systèmes de contrôle ou à l'IA incarnée
- Expérience avec l'infrastructure RL à grande échelle (déploiements distribués, simulation à grande échelle)
- Expérience en RL hors ligne, apprentissage par imitation ou approches d'apprentissage hybrides
- Expérience en modélisation de récompense ou en apprentissage avec intervention humaine
- Expérience dans des laboratoires d'IA de premier plan tels que OpenAI, Google DeepMind, Anthropic ou xAI
- Familiarité avec les systèmes robotiques, les environnements de simulation ou les contraintes de déploiement dans le monde réel
- Historique de publications en apprentissage par renforcement, machine learning ou robotique
