Zuora
Anthropic
Ingeniero/a de Investigación, Machine Learning (Aprendizaje por Refuerzo)
SOBRE ANTHROPIC
Anthropic tiene como misión crear sistemas de IA fiables, interpretables y dirigibles. Queremos que la IA sea segura y beneficiosa para nuestros usuarios y para la sociedad en su conjunto. Nuestro equipo es un grupo en rápido crecimiento de investigadores, ingenieros, expertos en políticas y líderes empresariales comprometidos que trabajan juntos para construir sistemas de IA beneficiosos.
SOBRE LOS EQUIPOS
Nuestros equipos de Aprendizaje por Refuerzo lideran la investigación y el desarrollo de aprendizaje por refuerzo de Anthropic, desempeñando un papel fundamental en el avance de nuestros sistemas de IA. Hemos contribuido a todos los modelos de Claude, con impactos significativos en la autonomía y las capacidades de codificación de Claude Sonnet 4.5 y Opus 4.5. Nuestro trabajo abarca varias áreas clave:
- Desarrollar sistemas que permitan a los modelos utilizar ordenadores de forma eficaz
- Avanzar en la generación de código mediante aprendizaje por refuerzo
- Ser pioneros en investigación fundamental de RL para modelos de lenguaje grandes
- Construir infraestructura de RL escalable y metodologías de entrenamiento
- Mejorar las capacidades de razonamiento de los modelos
Colaboramos estrechamente con los equipos de alineación y de equipos rojos fronterizos de Anthropic para garantizar que nuestros sistemas sean capaces y seguros. Nos asociamos con el equipo de entrenamiento de producción aplicada para incorporar innovaciones de investigación en modelos desplegados, y estamos dedicados a implementar nuestra investigación a escala. Nuestros equipos de Aprendizaje por Refuerzo se encuentran en la intersección de la investigación de vanguardia y la excelencia en ingeniería, con un profundo compromiso con la construcción de sistemas escalables y de alta calidad que superen los límites de lo que la IA puede lograr.
SOBRE EL ROL
Como Ingeniero/a de Investigación dentro de Aprendizaje por Refuerzo, colaborarás con un grupo diverso de investigadores e ingenieros para avanzar en las capacidades y la seguridad de los modelos de lenguaje grandes. Este rol combina responsabilidades de investigación e ingeniería, requiriendo que implementes enfoques novedosos y contribuyas a la dirección de la investigación. Trabajarás en investigación fundamental en aprendizaje por refuerzo, creando modelos 'agentes' a través del uso de herramientas para tareas abiertas como el uso de ordenadores y la generación autónoma de software, mejorando las habilidades de razonamiento en áreas como las matemáticas, y desarrollando prototipos para uso interno, productividad y evaluación.
CÓMO SOMOS DIFERENTES
Creemos que la investigación de IA de mayor impacto será "big science". En Anthropic trabajamos como un único equipo cohesionado en solo unos pocos esfuerzos de investigación a gran escala. Y valoramos el impacto —avanzar en nuestros objetivos a largo plazo de IA dirigible y confiable— en lugar de trabajar en acertijos más pequeños y específicos. Vemos la investigación de IA como una ciencia empírica, que tiene tanto en común con la física y la biología como con los esfuerzos tradicionales en informática. Somos un grupo extremadamente colaborativo y organizamos frecuentes discusiones de investigación para garantizar que estamos persiguiendo el trabajo de mayor impacto en cualquier momento dado. Como tal, valoramos enormemente las habilidades de comunicación.
La forma más fácil de entender nuestras direcciones de investigación es leer nuestra investigación reciente. Esta investigación continúa muchas de las direcciones en las que trabajó nuestro equipo antes de Anthropic, incluyendo: GPT-3, Circuit-Based Interpretability, Multimodal Neurons, Scaling Laws, AI & Compute, Concrete Problems in AI Safety, y Learning from Human Preferences.
PROYECTOS REPRESENTATIVOS
- Arquitectar y optimizar la infraestructura central de aprendizaje por refuerzo, desde abstracciones de entrenamiento limpias hasta la gestión de experimentos distribuidos a través de clústeres de GPU. Ayudar a escalar nuestros sistemas para manejar flujos de trabajo de investigación cada vez más complejos.
- Diseñar, implementar y probar entornos de entrenamiento, evaluaciones y metodologías novedosas para agentes de aprendizaje por refuerzo que impulsen el estado del arte para la próxima generación de modelos.
- Impulsar mejoras de rendimiento en toda nuestra pila a través de la creación de perfiles, la optimización y la evaluación comparativa. Implementar soluciones eficientes de caché y depurar sistemas distribuidos para acelerar los flujos de trabajo de entrenamiento y evaluación.
- Colaborar entre equipos de investigación e ingeniería para desarrollar marcos de pruebas automatizadas, diseñar APIs limpios y construir infraestructura escalable que acelere la investigación de IA.
Requisitos mínimos
PUEDES SER UN BUEN CANDIDATO/A SI
- Tienes experiencia en Python y programación asíncrona/concurrente con frameworks como Trio
- Tienes experiencia con frameworks de machine learning (PyTorch, TensorFlow, JAX)
- Tienes experiencia industrial en investigación de machine learning
- Puedes equilibrar la exploración de la investigación con la implementación de ingeniería
- Disfrutas de la programación en parejas (¡nos encanta programar en parejas!)
- Te preocupa la calidad del código, las pruebas y el rendimiento
- Tienes sólidas habilidades de diseño de sistemas y comunicación
- Te apasiona el impacto potencial de la IA y estás comprometido/a con el desarrollo de sistemas seguros y beneficiosos
LOS CANDIDATOS/AS FUERTES PUEDEN TENER
- Familiaridad con arquitecturas y metodologías de entrenamiento de LLM
- Experiencia con técnicas y entornos de aprendizaje por refuerzo
- Experiencia con entornos de virtualización y ejecución de código en sandbox
- Experiencia con Kubernetes
- Experiencia con sistemas distribuidos o computación de alto rendimiento
- Experiencia con Rust y/o C++
LOS CANDIDATOS/AS FUERTES NO NECESARIAMENTE NECESITAN TENER
- Certificaciones formales o credenciales educativas
- Experiencia en investigación académica o historial de publicaciones
Fecha límite para postularse: Ninguna. Las solicitudes se revisarán de forma continua.
El rango de compensación anual para este puesto se indica a continuación. Para los puestos de ventas, el rango proporcionado es el rango de "Objetivo de Ingresos" ("OTE") del puesto, lo que significa que el rango incluye tanto las comisiones de ventas/bonificaciones de ventas objetivo como el salario base anual para el puesto.
Salario Anual: £260,000—£630,000 GBP
LOGÍSTICA
Educación mínima: Título de Grado o una combinación equivalente de educación, formación y/o experiencia
Campo de estudio requerido: Un campo relevante para el puesto, demostrado a través de cursos, formación o experiencia profesional
Años mínimos de experiencia: Los años de experiencia requeridos se correlacionarán con los requisitos del nivel de puesto interno para la posición
Política híbrida basada en la ubicación: Actualmente, esperamos que todo el personal esté en una de nuestras oficinas al menos el 25% del tiempo. Sin embargo, algunos puestos pueden requerir más tiempo en nuestras oficinas.
Patrocinio de visado: ¡Patrocinamos visados! Sin embargo, no podemos patrocinar visados para todos los puestos y todos los candidatos. Pero si te hacemos una oferta, haremos todo lo razonablemente posible para conseguirte un visado, y contamos con un abogado de inmigración para ayudar con esto.
Te animamos a postularte incluso si no crees que cumples con todos los requisitos. No todos los candidatos/as fuertes cumplirán con todos los requisitos enumerados. La investigación muestra que las personas que se identifican como pertenecientes a grupos subrepresentados son más propensas a experimentar el síndrome del impostor y a dudar de la solidez de su candidatura, por lo que te instamos a no excluirte prematuramente y a presentar una solicitud si te interesa este trabajo. Creemos que los sistemas de IA como los que estamos construyendo tienen enormes implicaciones sociales y éticas. Creemos que esto hace que la representación sea aún más importante, y nos esforzamos por incluir una variedad de perspectivas diversas en nuestro equipo.
Tu seguridad nos importa. Para protegerte de posibles estafas, recuerda que los reclutadores de Anthropic solo se pondrán en contacto contigo desde direcciones de correo electrónico @anthropic.com. En algunos casos, podemos asociarnos con agencias de reclutamiento verificadas que se identificarán como que trabajan en nombre de Anthropic. Ten cuidado con los correos electrónicos de otros dominios. Los reclutadores legítimos de Anthropic nunca te pedirán dinero, tarifas o información bancaria antes de tu primer día. Si alguna vez tienes dudas sobre una comunicación, no hagas clic en ningún enlace; visita directamente anthropic.com/careers anthropic.com/careers para ver las aberturas de puestos confirmadas.
¡VEN A TRABAJAR CON NOSOTROS!
Anthropic es una corporación de beneficio público con sede en San Francisco. Ofrecemos compensación y beneficios competitivos, donación opcional de acciones con contrapartida, generosas vacaciones y permisos parentales, horarios de trabajo flexibles y un espacio de oficina agradable en el que colaborar con colegas. Guía sobre el Uso de IA por parte de los Candidatos/as: Conoce nuestra política anthropic.com/candidate-ai-guidance para usar IA en nuestro proceso de solicitud.
