StrideCare
Labelbox
Engenheiro de Implantação Avançada, Ambientes de RL
A Vaga
MOLDE O FUTURO DA IA
Na Labelbox, estamos construindo a infraestrutura crítica que impulsiona modelos de IA inovadores em laboratórios de pesquisa e empresas líderes. Desde 2018, temos sido pioneiros em abordagens centradas em dados que são fundamentais para o desenvolvimento de IA, e nosso trabalho se torna ainda mais essencial à medida que as capacidades de IA se expandem exponencialmente.
Estamos contratando um Engenheiro de Implantação Avançada para ser o responsável pelo design, desenvolvimento e operacionalização de ambientes de aprendizado por reforço. Você construirá os ambientes de execução isolados e reprodutíveis com os quais os agentes de IA interagem durante o treinamento e a avaliação — coisas como benchmarks de tarefas baseados em terminal, ambientes de navegação e uso de computador, e espaços de trabalho aumentados por ferramentas.
Esta é uma função de engenharia prática. Você escreverá código de infraestrutura de qualidade de produção, integrará com ferramentas de RL de código aberto e trabalhará em estreita colaboração com nossa equipe de operações de dados para garantir que os ambientes sejam robustos, observáveis e prontos tanto para anotadores humanos quanto para agentes de modelo. Você não fará pesquisa de ML, mas precisará entender profundamente como os loops de treinamento de RL consomem os ambientes e onde residem os gargalos.
NOSSA VISÃO
Acreditamos que os dados permanecerão cruciais para alcançar a inteligência artificial geral. À medida que os modelos de IA se tornam mais sofisticados, a necessidade de dados de treinamento de alta qualidade e especializados só crescerá. Junte-se a nós no desenvolvimento de novos produtos e serviços que possibilitam a próxima geração de avanços em IA.
A Labelbox é apoiada por investidores líderes, incluindo SoftBank, Andreessen Horowitz, B Capital, Gradient Ventures, Databricks Ventures e Kleiner Perkins. Nossos clientes incluem empresas Fortune 500 e laboratórios de IA líderes.
SOBRE A LABELBOX
Somos a única empresa que oferece três soluções integradas para o desenvolvimento de IA de ponta:
- Plataforma e Ferramentas Empresariais: Ferramentas avançadas de anotação, automação de fluxo de trabalho e sistemas de controle de qualidade que permitem às equipes produzir dados de treinamento de alta qualidade em escala.
- Serviço de Rotulagem de Dados de Ponta: Rotulagem de dados especializada por meio do Alignerr, aproveitando especialistas no assunto para modelos de IA de próxima geração.
- Marketplace de Especialistas: Conectando equipes de IA com anotadores altamente qualificados e especialistas de domínio para escalonamento flexível.
SERVIÇOS ALIGNERR NA LABELBOX
Alignerr é a organização de dados humanos da Labelbox, construída especificamente para gerar os dados de treinamento de alta qualidade que impulsionam a próxima geração de modelos de IA. Fazemos parceria direta com laboratórios de IA líderes para produzir ambientes de aprendizado por reforço, benchmarks de avaliação e conjuntos de dados anotados por especialistas que impulsionam as capacidades dos modelos. Nossa equipe está na interseção de engenharia de software, infraestrutura de ML e produção de dados com loop humano.
POR QUE SE JUNTAR A NÓS
- Ambiente de Alto Impacto: Operamos como uma startup em estágio inicial, focando em impacto em vez de processos. Você assumirá responsabilidades expandidas rapidamente, com o crescimento da carreira diretamente ligado às suas contribuições.
- Excelência Técnica: Trabalhe na vanguarda do desenvolvimento de IA, colaborando com líderes do setor e moldando o futuro da inteligência artificial.
- Inovação em Velocidade: Celebramos aqueles que assumem a responsabilidade, agem rápido e entregam impacto. Nosso ambiente recompensa alta agência e execução rápida.
- Crescimento Contínuo: Cada função exige aprendizado e evolução contínuos. Você estará cercado por mentes curiosas resolvendo problemas complexos na vanguarda da IA.
- Propriedade Clara: Você saberá exatamente pelo que é responsável e terá a autonomia para executar. Capacitamos as pessoas a gerar resultados por meio de propriedade e métricas claras.
VIDA NA LABELBOX
- Ambiente: Ritmo acelerado e alta intensidade, perfeito para indivíduos ambiciosos que prosperam com responsabilidade e tomada de decisão rápida.
- Crescimento: Oportunidades de avanço na carreira diretamente ligadas ao seu impacto.
- Visão: Faça parte da construção da base para a tecnologia mais transformadora da humanidade.
O que você fará
- Projetar, construir e manter ambientes de RL isolados para treinamento de agentes de IA — incluindo emuladores de terminal, harnesses de automação de navegador, simuladores de uso de computador e espaços de trabalho aumentados por ferramentas (por exemplo, ambientes construídos em frameworks como TerminalBench, OSWorld e Tau-bench).
- Desenvolver ambientes de execução reprodutíveis e conteinerizados (Docker, VMs, ambientes leves) que suportem rollouts de tarefas determinísticas e coleta de sinais de recompensa.
- Integrar e estender ferramentas de agentes de código aberto e harnesses personalizados de CLI/API para permitir interação de agentes em múltiplas etapas.
- Construir camadas de instrumentação e observabilidade — logging estruturado, captura de trajetória, snapshotting de estado — para que as execuções de treinamento e as sessões de anotação humana produzam dados limpos e auditáveis.
- Colaborar com operações de dados para projetar currículos de tarefas e protocolos de avaliação que testem as capacidades do modelo em diferentes tipos de ambientes.
- Ser o responsável pela implantação e confiabilidade do ambiente: pipelines de CI/CD, testes automatizados de configurações de ambiente e monitoramento de desvios ou falhas entre versões.
- Prototipar rapidamente novos tipos de ambiente à medida que os requisitos dos clientes e internos evoluem, passando da especificação para o sistema funcional em dias, não semanas.
O que buscamos
Obrigatório
- 2+ anos de experiência profissional em engenharia de software, com fortes fundamentos em Python e pelo menos uma linguagem de sistemas (Go, Rust, C++).
- Experiência comprovada com conteinerização e isolamento (Docker, Podman, Firecracker ou similar) em contextos de produção ou próximos à produção.
- Familiaridade com conceitos de RL: MDPs, modelagem de recompensa, estrutura de episódio, espaços de observação/ação. Você não precisa ter treinado modelos, mas precisa entender o que um ambiente deve fornecer a um loop de treinamento de RL.
- Experiência na construção ou manutenção de ferramentas de desenvolvedor, ferramentas de linha de comando (CLI) ou automação de infraestrutura.
- Conforto em trabalhar com frameworks de automação de navegador ou ferramentas de interação com terminal.
- Fortes instintos de depuração — você consegue rastrear falhas através de limites de processos, camadas de contêineres e chamadas de rede.
- Capacidade de ler e implementar a partir de artigos acadêmicos e repositórios de benchmarks de código aberto sem necessidade de supervisão extensiva.
Desejável
- Experiência direta na construção ou contribuição para ambientes de RL (Gymnasium/Gym, PettingZoo ou implementações de ambiente personalizadas).
- Experiência com frameworks de avaliação de IA de agentes (SWE-bench, WebArena, OSWorld, TerminalBench ou similar).
- Familiaridade com infraestrutura GCP ou AWS (Compute Engine, ECS/EKS, Cloud Build).
- Experiência anterior em uma empresa de dados de IA, empresa de plataforma de ML ou laboratório de pesquisa de IA.
- Contribuições para projetos de código aberto nas áreas de RL, agentes ou ferramentas de desenvolvimento.
Arquétipo do Candidato
O candidato ideal é, antes de tudo, um engenheiro de software forte, com curiosidade genuína e conhecimento prático de aprendizado por reforço. Você provavelmente construiu infraestrutura ou ferramentas de desenvolvedor em uma startup ou empresa de médio porte, e foi atraído para a área de ML/IA — talvez por meio de projetos paralelos, contribuições de código aberto ou uma função anterior adjacente a uma equipe de ML. Você é o tipo de engenheiro que lê um artigo de benchmark de RL e imediatamente pensa em como tornar o ambiente mais robusto, não em como melhorar o gradiente de política.
Você prospera na ambiguidade. Você pode pegar um requisito de projeto vagamente definido — "construir um ambiente que teste a capacidade de um agente de navegar em um sistema de arquivos e executar fluxos de trabalho bash de múltiplas etapas" — e entregar um sistema funcional, testado e documentado sem precisar de uma especificação detalhada. Você age rápido, mas se preocupa com a confiabilidade porque sabe que ambientes que falham silenciosamente contaminam os dados de treinamento.
Por que esta vaga é importante
- A qualidade do ambiente de RL é um dos maiores gargalos no treinamento de IA de agentes hoje. Ambientes frágeis, não determinísticos ou mal instrumentados produzem sinais de recompensa ruidosos que degradam diretamente o desempenho do modelo. Você estará resolvendo um dos problemas de infraestrutura de maior alavancagem em IA.
- Você trabalhará em um portfólio de projetos que abrange diferentes laboratórios de IA e capacidades de modelo — sem monotonia de produto único. Os tipos de ambiente que você construirá evoluirão à medida que a fronteira das capacidades dos agentes avança.
- Alignerr é uma equipe pequena e de alto impacto dentro de uma empresa bem financiada (Labelbox). Você terá propriedade de nível de startup com recursos de estágio de crescimento.
A Labelbox se esforça para garantir a paridade salarial em toda a organização e discutir a remuneração de forma transparente. A faixa salarial anual base esperada para candidatos baseados nos Estados Unidos está abaixo. Esta faixa não inclui pacotes de ações potenciais ou benefícios adicionais. A remuneração exata varia com base em uma variedade de fatores, incluindo habilidades e competências, experiência e localização geográfica.
Faixa salarial anual base
$140,000—$200,000 USD
Privacidade dos seus Dados Pessoais: Quaisquer dados pessoais que você fornecer à Labelbox como parte de sua inscrição serão processados de acordo com o aviso de privacidade para candidatos a emprego da Labelbox docs.labelbox.com/page/job-applicant-privacy-notice. Quaisquer e-mails de membros da equipe da Labelbox se originarão de um endereço de e-mail @labelbox.com. Se você encontrar algo que levante suspeitas durante suas interações, encorajamos você a ter cautela e suspender ou descontinuar as comunicações.
