Labelbox

Ingénieur Forward Deployed, Environnements RL

PythonAWSGCPDockerC++RustGo
Traduction automatique. Consultez l’original.

Le Poste

FAÇONNEZ L'AVENIR DE L'IA

Chez Labelbox, nous construisons l'infrastructure critique qui alimente les percées en matière de modèles d'IA dans les principaux laboratoires de recherche et entreprises. Depuis 2018, nous sommes pionniers des approches centrées sur les données, essentielles au développement de l'IA, et notre travail devient encore plus crucial à mesure que les capacités de l'IA se développent de manière exponentielle.

Nous recherchons un Ingénieur Forward Deployed pour concevoir, développer et opérationnaliser les environnements d'apprentissage par renforcement. Vous construirez les environnements d'exécution isolés et reproductibles avec lesquels les agents d'IA interagissent pendant l'entraînement et l'évaluation – par exemple, des benchmarks de tâches basés sur le terminal, des environnements d'utilisation de navigateur et d'ordinateur, et des espaces de travail augmentés par des outils.

Il s'agit d'un rôle d'ingénierie pratique. Vous écrirez du code d'infrastructure de qualité production, vous intégrerez des outils RL open-source et travaillerez en étroite collaboration avec notre équipe d'opérations de données pour garantir que les environnements sont robustes, observables et prêts pour les annotateurs humains comme pour les agents modèles. Vous ne ferez pas de recherche en ML, mais vous devrez comprendre en profondeur comment les boucles d'entraînement RL consomment les environnements et où se situent les goulots d'étranglement.

NOTRE VISION

Nous croyons que les données resteront cruciales pour atteindre l'intelligence artificielle générale. À mesure que les modèles d'IA deviennent plus sophistiqués, le besoin de données d'entraînement de haute qualité et spécialisées ne fera que croître. Rejoignez-nous pour développer de nouveaux produits et services qui permettront les prochaines avancées en matière d'IA.

Labelbox est soutenu par des investisseurs de premier plan, notamment SoftBank, Andreessen Horowitz, B Capital, Gradient Ventures, Databricks Ventures et Kleiner Perkins. Nos clients comprennent des entreprises du Fortune 500 et des laboratoires d'IA de premier plan.

À PROPOS DE LABELBOX

Nous sommes la seule entreprise à proposer trois solutions intégrées pour le développement d'IA de pointe :

  • Plateforme et Outils Entreprise : Outils d'annotation avancés, automatisation des flux de travail et systèmes de contrôle qualité qui permettent aux équipes de produire des données d'entraînement de haute qualité à grande échelle.
  • Service d'Étiquetage de Données de Pointe : Étiquetage de données spécialisé via Alignerr, en s'appuyant sur des experts du domaine pour les modèles d'IA de nouvelle génération.
  • Marketplace d'Experts : Mise en relation des équipes d'IA avec des annotateurs et des experts du domaine hautement qualifiés pour une mise à l'échelle flexible.

SERVICES ALIGNERR CHEZ LABELBOX

Alignerr est l'organisation de données humaines de Labelbox, spécialement conçue pour générer les données d'entraînement de haute qualité qui alimentent la prochaine génération de modèles d'IA. Nous collaborons directement avec les principaux laboratoires d'IA pour produire des environnements d'apprentissage par renforcement, des benchmarks d'évaluation et des ensembles de données annotés par des experts qui font progresser les capacités des modèles. Notre équipe se situe à l'intersection de l'ingénierie logicielle, de l'infrastructure ML et de la production de données en boucle humaine.

POURQUOI NOUS REJOINDRE

  • Environnement à Fort Impact : Nous fonctionnons comme une startup en phase initiale, en privilégiant l'impact sur les processus. Vous assumerez rapidement des responsabilités élargies, avec une croissance de carrière directement liée à vos contributions.
  • Excellence Technique : Travaillez à la pointe du développement de l'IA, en collaborant avec des leaders de l'industrie et en façonnant l'avenir de l'intelligence artificielle.
  • Innovation à Vitesse Grand V : Nous célébrons ceux qui prennent des initiatives, agissent rapidement et produisent des résultats. Notre environnement récompense une grande autonomie et une exécution rapide.
  • Croissance Continue : Chaque rôle exige un apprentissage et une évolution constants. Vous serez entouré d'esprits curieux résolvant des problèmes complexes à la frontière de l'IA.
  • Propriété Claire : Vous saurez exactement ce dont vous êtes responsable et aurez l'autonomie nécessaire pour exécuter. Nous donnons aux gens les moyens d'obtenir des résultats grâce à une propriété et des métriques claires.

LA VIE CHEZ LABELBOX

  • Environnement : Rythme rapide et haute intensité, parfait pour les individus ambitieux qui excellent dans la prise d'initiative et la prise de décision rapide.
  • Croissance : Opportunités d'avancement de carrière directement liées à votre impact.
  • Vision : Participez à la construction des fondations de la technologie la plus transformatrice de l'humanité.

Ce que vous ferez

  1. Concevoir, construire et maintenir des environnements RL isolés pour l'entraînement d'IA agentiques – y compris des émulateurs de terminal, des harnais d'automatisation de navigateur, des simulateurs d'utilisation d'ordinateur et des espaces de travail augmentés par des outils (par exemple, des environnements construits sur des frameworks comme TerminalBench, OSWorld et Tau-bench).
  1. Développer des environnements d'exécution reproductibles et conteneurisés (Docker, VM, sandbox légers) qui prennent en charge les déploiements de tâches déterministes et la collecte de signaux de récompense.
  1. S'intégrer et étendre les outils agentiques open-source et les harnais CLI/API personnalisés pour permettre l'interaction multi-étapes des agents.
  1. Construire des couches d'instrumentation et d'observabilité – journalisation structurée, capture de trajectoire, instantané de l'état – afin que les exécutions d'entraînement et les sessions d'annotation humaine produisent des données propres et auditables.
  1. Collaborer avec les opérations de données pour concevoir des programmes de tâches et des protocoles d'évaluation qui testent rigoureusement les capacités des modèles à travers différents types d'environnements.
  1. Assumer le déploiement et la fiabilité des environnements : pipelines CI/CD, tests automatisés des configurations d'environnement et surveillance des dérives ou des pannes entre les versions.
  1. Prototyper rapidement de nouveaux types d'environnements à mesure que les exigences des clients et internes évoluent, en passant de la spécification au système fonctionnel en quelques jours, pas en semaines.

Ce que nous recherchons

Requis

  1. Plus de 2 ans d'expérience professionnelle en ingénierie logicielle, avec de solides bases en Python et au moins un langage système (Go, Rust, C++).
  1. Expérience démontrée avec la conteneurisation et l'isolation (Docker, Podman, Firecracker ou similaire) dans des contextes de production ou quasi-production.
  1. Familiarité avec les concepts de RL : MDP, mise en forme des récompenses, structure des épisodes, espaces d'observation/action. Vous n'avez pas besoin d'avoir entraîné des modèles, mais vous devez comprendre ce qu'un environnement doit fournir à une boucle d'entraînement RL.
  1. Expérience dans la construction ou la maintenance d'outils de développement, d'outils CLI ou d'automatisation d'infrastructure.
  1. Confort dans l'utilisation de frameworks d'automatisation de navigateur ou d'outils d'interaction terminal.
  1. Fortes aptitudes au débogage – vous pouvez retracer les échecs à travers les limites de processus, les couches de conteneurs et les appels réseau.
  1. Capacité à lire et implémenter à partir d'articles académiques et de dépôts de benchmarks open-source sans encadrement excessif.

Préféré

  1. Expérience directe dans la construction ou la contribution à des environnements RL (Gymnasium/Gym, PettingZoo, ou implémentations d'environnements personnalisés).
  1. Expérience avec des frameworks d'évaluation d'IA agentiques (SWE-bench, WebArena, OSWorld, TerminalBench, ou similaires).
  1. Familiarité avec l'infrastructure GCP ou AWS (Compute Engine, ECS/EKS, Cloud Build).
  1. Expérience antérieure dans une entreprise de données IA, une entreprise de plateforme ML ou un laboratoire de recherche IA.
  1. Contributions à des projets open-source dans l'espace RL, agents ou outils de développement.

Archétype du Candidat

Le candidat idéal est avant tout un ingénieur logiciel performant, avec une curiosité authentique et une connaissance pratique de l'apprentissage par renforcement. Vous avez probablement construit de l'infrastructure ou des outils de développement dans une startup ou une entreprise de taille moyenne, et vous avez été attiré par l'espace ML/IA – peut-être par des projets parallèles, des contributions open-source ou un rôle antérieur adjacent à une équipe ML. Vous êtes le type d'ingénieur qui lit un article de benchmark RL et pense immédiatement à la manière de rendre l'environnement plus robuste, pas à la manière d'améliorer le gradient de politique.

Vous prospérez dans l'ambiguïté. Vous pouvez prendre une exigence de projet peu définie – « construire un environnement qui teste la capacité d'un agent à naviguer dans un système de fichiers et à exécuter des workflows bash multi-étapes » – et livrer un système fonctionnel, testé et documenté sans avoir besoin d'une spécification détaillée. Vous agissez vite, mais vous vous souciez de la fiabilité car vous savez que les environnements qui tombent en panne silencieusement empoisonnent les données d'entraînement.

Pourquoi ce rôle est important

  1. La qualité des environnements RL est l'un des plus grands goulots d'étranglement dans l'entraînement d'IA agentiques aujourd'hui. Les environnements fragiles, non déterministes ou mal instrumentés produisent des signaux de récompense bruités qui dégradent directement les performances du modèle. Vous résoudrez l'un des problèmes d'infrastructure les plus à fort effet de levier en IA.
  1. Vous travaillerez sur un portefeuille de projets couvrant différents laboratoires d'IA et capacités de modèles – pas de monotonie liée à un produit unique. Les types d'environnements que vous construirez évolueront à mesure que la frontière des capacités des agents progresse.
  1. Alignerr est une petite équipe à fort impact au sein d'une entreprise bien financée (Labelbox). Vous aurez une propriété de niveau startup avec des ressources de croissance.

Labelbox s'efforce d'assurer la parité salariale au sein de l'organisation et de discuter de la rémunération de manière transparente. La fourchette de salaire de base annuel attendue pour les candidats basés aux États-Unis est indiquée ci-dessous. Cette fourchette n'inclut pas les éventuels plans d'actions ou avantages supplémentaires. La rémunération exacte varie en fonction de divers facteurs, notamment les compétences et les aptitudes, l'expérience et la situation géographique.

Fourchette de salaire de base annuel

$140,000 — $200,000 USD

Confidentialité de vos données personnelles : Toute information personnelle que vous fournissez à Labelbox dans le cadre de votre candidature sera traitée conformément à la politique de confidentialité des candidats à l'emploi de Labelbox docs.labelbox.com/page/job-applicant-privacy-notice. Tous les e-mails des membres de l'équipe Labelbox proviendront d'une adresse e-mail @labelbox.com. Si vous rencontrez quelque chose qui suscite des soupçons lors de vos interactions, nous vous encourageons à faire preuve de prudence et à suspendre ou interrompre les communications.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter