Roku
Figure
Ingeniero/a de IA Helix, Aprendizaje por Refuerzo
Sobre la oportunidad
Figure es una empresa de robótica de IA que desarrolla robots humanoides autónomos de propósito general.
Nuestro objetivo es construir sistemas de IA corporeizados que puedan percibir, razonar y actuar en el mundo real.
Figure tiene su sede en San Jose, CA, y este puesto requiere 5 días/semana de colaboración en la oficina.
Estados Unidos El rango salarial base para este puesto a tiempo completo es de entre $200,000 - $400,000.
La remuneración ofrecida para este puesto puede variar según varios factores individuales, incluyendo el conocimiento, las habilidades y la experiencia relacionados con el puesto. El paquete de compensación total también puede incluir componentes/beneficios adicionales dependiendo del puesto específico. Esta información se compartirá si se extiende una oferta de empleo.
Nuestro equipo Helix es responsable del desarrollo de los sistemas centrales de IA que potencian la autonomía humanoide.
Buscamos un/a Ingeniero/a de IA Helix, Aprendizaje por Refuerzo para desarrollar sistemas de aprendizaje que permitan a los robots adquirir habilidades a través de la interacción, la retroalimentación y la experiencia.
Este puesto se centra en aplicar y avanzar el aprendizaje por refuerzo en entornos de simulación y del mundo real, mejorando el rendimiento de las políticas, la robustez y la toma de decisiones a largo plazo en sistemas corporeizados.
RESPONSABILIDADES
- Diseñar e implementar algoritmos de aprendizaje por refuerzo para agentes corporeizados que operan en entornos del mundo real y simulados.
- Entrenar políticas que aprendan de la interacción, la retroalimentación y la experiencia a gran escala en diversas tareas.
- Desarrollar estrategias de modelado de recompensas, asignación de crédito y exploración para comportamientos complejos y de largo horizonte.
- Mejorar la robustez de las políticas frente a desafíos del mundo real como el ruido, la observabilidad parcial y la variabilidad del entorno.
- Trabajar en entornos de RL en línea y fuera de línea, incluido el aprendizaje a partir de datos de robots registrados a gran escala.
- Colaborar estrechamente con los equipos de preentrenamiento, vídeo, generativo, de agentes y de aprendizaje robótico para integrar el RL en la pila de autonomía completa.
- Construir sistemas de entrenamiento escalables para RL, incluyendo rollouts distribuidos, infraestructura de simulación y gestión de experimentos.
- Diseñar marcos de evaluación para medir el rendimiento, la estabilidad y la generalización de las políticas.
REQUISITOS
- Experiencia en el desarrollo y aplicación de algoritmos de aprendizaje por refuerzo en entornos complejos.
- Sólida comprensión de los fundamentos del RL (por ejemplo, optimización de políticas, métodos de valor, RL basado en modelos).
- Experiencia en el entrenamiento de políticas en sistemas simulados y/o del mundo real.
- Dominio de Python y marcos de deep learning como PyTorch.
- Experiencia con experimentación a gran escala y sistemas de entrenamiento distribuidos.
- Rigor experimental sólido y capacidad para diagnosticar y mejorar sistemas de aprendizaje.
- Sólidas habilidades de ingeniería de software y capacidad para construir sistemas escalables y fiables.
- Capacidad para operar de forma independiente y abordar problemas técnicos ambiguos de alto impacto.
CALIFICACIONES ADICIONALES
- Experiencia aplicando RL a la robótica, sistemas de control o IA corporeizada.
- Experiencia con infraestructura de RL a gran escala (rollouts distribuidos, simulación a escala).
- Experiencia en RL fuera de línea, aprendizaje por imitación o enfoques de aprendizaje híbridos.
- Experiencia en modelado de recompensas o aprendizaje con intervención humana (human-in-the-loop).
- Experiencia en laboratorios líderes de IA como OpenAI, Google DeepMind, Anthropic o xAI.
- Familiaridad con sistemas de robótica, entornos de simulación o restricciones de despliegue en el mundo real.
- Historial de publicaciones en aprendizaje por refuerzo, machine learning o robótica.
