Mindrift
Nacre Capital
Engenheiro(a) Sênior de IA, Agentes
Sobre a EveryWatch
A EveryWatch é a maior e mais confiável fonte de dados do mercado secundário de relógios. Fundada por um grupo de amantes de relógios, a EveryWatch foi criada em resposta à crescente popularidade de relógios de luxo, com o objetivo de trazer transparência e insights sem precedentes para o mercado de relógios. A primeira plataforma desse tipo, a EveryWatch combina todos os aspectos do mundo dos relógios sob o mesmo teto: um balcão único para colecionadores, vendedores e entusiastas de relógios.
Visão Geral da Posição
Estamos procurando um(a) Engenheiro(a) Sênior de IA, Agentes - um(a) Arquiteto(a) de Agentes que será responsável por projetar, construir e escalar soluções com IA em toda a EveryWatch. Trabalhando em estreita colaboração com nossas equipes de engenharia, produto, vendas e dados, eles identificarão oportunidades onde IA e LLMs podem automatizar processos complexos, melhorar a tomada de decisões e criar novas capacidades para nossos usuários e equipes internas.
Este é um cargo altamente prático para alguém que combina fortes habilidades de engenharia em Python e LLM com uma mentalidade criativa e proativa. Você não receberá simplesmente um roteiro. Espera-se que você entenda como o negócio opera, identifique onde a IA pode fazer uma diferença significativa, proponha novas soluções e as leve da ideia à produção.
Nosso trabalho atual em IA, incluindo o WatchChat, fornece uma base para construir. A oportunidade agora é expandir essa base para um ecossistema mais amplo de agentes inteligentes que possam trabalhar com os dados exclusivos do mercado de relógios da EveryWatch e apoiar colecionadores, revendedores, equipes de vendas, operações de dados e engenharia.
Em resumo, estamos procurando alguém que não apenas pergunte: "O que podemos construir?", mas "O que deveríamos construir?"
O que você realmente fará
- Inventar o roteiro de agentes. Sentar com vendas, dados e produto, encontrar o trabalho repetitivo de especialistas e voltar com uma lista classificada de agentes que valem a pena construir - com uma visão real sobre viabilidade, custo e impacto. Este é o cerne do trabalho, e não para após o primeiro trimestre.
- Construí-los você mesmo. Você é prático. Você projeta a arquitetura e escreve o código - ferramentas, loops, sub-agentes, memória, estado, avaliação. Não um redator de especificações com uma equipe por baixo.
- Ser o dono da plataforma sob os agentes. Cada novo agente deve ser mais barato de construir do que o anterior: camada de ferramentas compartilhada sobre os dados da EverWatch (preços, leilões, listagens, referências, portfólios), uma superfície MCP sobre nosso backend existente, memória compartilhada, rastreamento e um conjunto de avaliação reutilizável.
- Fortalecer o WatchChat junto conosco. Estado e memória multi-turn, latência, custo, confiabilidade de chamada de ferramenta, portões de regressão. Está vinculado à produção e tem que permanecer correto.
- Tornar a qualidade mensurável. Conjuntos de dados multi-turn de referência, verificadores programáticos para correção de ferramentas/argumentos, LLM como juiz em conjuntos retidos. Se não pudermos medir um agente, não o lançaremos.
- Tratar custo e latência como restrições de design. Modelos baratos para roteamento e intenção, modelos fortes onde eles valem a pena; orçamentos de contexto, cache e - onde compensa - ajuste fino (SFT/LoRA em trajetórias de produção curadas) em vez de prompts cada vez maiores.
O que estamos procurando
Três coisas, e não abriremos mão de nenhuma delas:
- Criativo(a). Você gera ideias de agentes que o negócio não havia pensado, e você consegue distinguir entre um que funcionará e um que demonstra bem. Você começa com um caso de uso, não com um framework.
- Arquiteto(a) forte. Você consegue projetar uma plataforma de agentes que ainda esteja de pé em cinco anos - estado, memória, limites de ferramentas, decomposição de sub-agentes, avaliação, modos de falha, custo. Você será solicitado(a) a criticar nossa arquitetura atual na entrevista, e esperamos que você encontre falhas.
- Altamente prático(a). Você entrega. Profunda experiência em produção, escrevendo o código você mesmo(a), em ritmo acelerado.
Essencial
- +6 anos entregando software de produção, dos quais +2 em sistemas de LLM que usuários reais utilizaram.
- Profundidade real em agentes: ReAct ou loops equivalentes, chamadas de ferramenta/função, planejadores, estado e checkpointing, memória de longo prazo, etapas HITL, streaming. Não "Eu chamei a OpenAI API."
- Experiência prática com LangGraph (ou um forte argumento para algo melhor) mais uma pilha de rastreamento/observabilidade - LangSmith, Langfuse ou similar.
- Python em produção: FastAPI, processamento de jobs assíncronos, limites de serviço claros.
- RAG feito corretamente: recuperação + reclassificação + julgamento de relevância, e avaliação honesta de todos os três.
- Avaliação como um hábito, não como uma reflexão tardia (RAGAS/DeepEval/GEVAL, LLM como juiz, pass@k).
- Experiência em produção na nuvem - AWS (Bedrock, SQS, EC2/EKS, S3) ou equivalente - com Docker e CI/CD.
- A espinha dorsal nos desafia. Queremos explicitamente alguém que pergunte "por que você construiu isso assim?"
Desejável
- Pós-treinamento de LLM: SFT com LoRA/QLoRA, métodos de preferência/RL, design de recompensa e verificador.
- Agentes de voz (LiveKit/Pipecat ou similar), ou trabalho com visão e linguagem.
- Orquestração multi-agente e integrações MCP.
- Texto para SQL sobre um esquema de produção real e complexo.
- Agentes de geração de relatórios/documentos - saída estruturada, com fontes, pronta para o cliente.
- Guardrails, tratamento de PII, detecção de alucinações, pontuação de risco.
- Interesse em relógios, colecionáveis ou dados de mercado. Não é obrigatório - a curiosidade sobre o domínio é.
O que você ganha
- Propriedade de toda a camada de agentes da EverWatch, e o roteiro para ela — não um canto de outra pessoa.
- Um conjunto de dados que não existe em nenhum outro lugar, e usuários que se importam se a resposta está correta.
- Linha direta com o CTO; decisões em dias, não trimestres.
- Orçamento para modelos, ferramentas e os agentes de codificação com os quais você deseja trabalhar.
- Remuneração competitiva, primeiro lugar remoto.
