StrideCare
Arcana Analytics
Engenheiro(a) de IA Sênior — Sistemas de Inferência e Agentes
O Que Estamos Construindo
Cargo: Engenheiro(a) de IA Aplicada — Sistemas de Inferência e Agentes
A Arcana está construindo agentes de IA que sintetizam informações de fontes heterogêneas e entregam respostas estruturadas e raciocinadas em tempo real. O produto só funciona se os agentes forem rápidos, confiáveis e corretos, não aproximadamente corretos.
Nossa stack: Go + Temporal para orquestração, uma arquitetura de agente Plan-Execute-Synthesize e um framework de avaliação que usamos para medir cada regressão. Os problemas são difíceis. A barra de latência é agressiva. Os requisitos de precisão são implacáveis.
Por Que Esta Posição
Os problemas aqui ainda não têm posts de blog sobre eles. Execução paralela de DAGs de agentes sob orçamentos de latência rigorosos, síntese em streaming a partir de resultados parciais de sub-agentes, frameworks de avaliação para sistemas multi-etapas não-determinísticos: estes são genuinamente não resolvidos com qualidade de produção. Equipe pequena. Alta responsabilidade. As decisões de cada engenheiro(a) vão para produção.
Candidatura
Localização: Estados Unidos
Enviar para: [[email protected]]
Incluir:
- Um sistema que você construiu onde a latência era a principal restrição: o que você mediu, o que você mudou, o que se moveu
- Link para qualquer coisa pública (código, textos, palestras)
- Carta de apresentação não é necessária
Respondemos a todas as candidaturas.
O Trabalho
Otimização de Inferência
- Reduzir o TTFT para menos de 400ms para pipelines de agentes multi-etapas
- Otimização de streaming: primeiro token para o usuário enquanto sub-agentes ainda estão em execução
- Estratégia de cache KV, compressão de prompt, gerenciamento dinâmico de janela de contexto
- Roteamento multi-provedor: seleção de modelo por latência, custo e tipo de tarefa entre OpenAI, Anthropic, Gemini e modelos de peso aberto
Arquitetura de Agentes
- Projetar e implementar pipelines Plan-Execute-Synthesize que executam sub-agentes em DAGs paralelos, não em cadeias sequenciais
- Construir orquestração confiável sobre Temporal: retentativas, timeouts, recuperação de falhas parciais, idempotência
- Aplicação de saída estruturada: validação de esquema JSON, loops de retentativa em saída LLM malformada, degradação graciosa
- Design de chamada de ferramenta: design de esquema que LLMs realmente seguem de forma confiável entre provedores
Avaliação e Framework
- Ser o responsável pelo framework de avaliação de ponta a ponta: datasets de ground truth, pipelines de pontuação automatizada, detecção de regressão em cada PR
- Pipelines de LLM-como-juiz para avaliação qualitativa da saída
- Testes de regressão de latência - p50/p95/p99 rastreados em cada implantação
- Design de casos de teste adversariais: consultas ambíguas, dados ausentes, fontes conflitantes, respostas de ferramenta malformadas
Infraestrutura
- Servir modelos e otimização de cold start
- Arquitetura de workers assíncronos para execução paralela de sub-agentes
- Observabilidade: rastrear cada token, cada chamada de ferramenta, cada etapa de síntese
O Que Procuramos
Você construiu algo que roda em produção em escala significativa e entende por que é rápido (ou por que não é).
Sinal forte
- Você trabalhou em pipelines de inferência onde o TTFT era a métrica principal e você o moveu significativamente
- Você construiu sistemas de agentes multi-etapas e sabe onde eles falham, não por ler artigos, mas por vê-los falhar em produção
- Você construiu frameworks de avaliação do zero e tem opiniões sobre o que torna um dataset de ground truth realmente útil -
- Você depurou não-determinismo de LLM em produção e construiu sistemas resilientes a ele
- Você trabalhou com respostas de LLM em streaming e construiu infraestrutura em torno do tratamento de saída parcial
Familiaridade com a stack (nos importamos mais com profundidade do que com correspondência): Go, Python, Temporal, Kafka, PostgreSQL, Docker
De Quem Queremos Ouvir
Você enviou sistemas de inferência em:
- Um produto de IA em tempo real (busca, assistente de codificação, chat em escala)
- Uma empresa de infraestrutura de serving de modelos
- Uma plataforma de agentes (qualquer domínio)
Ou você construiu infraestrutura de avaliação/framework na qual uma equipe de mais de 10 engenheiros realmente confiou para capturar regressões.
Sinal mais fraco (mas não desqualificante)
- Você fez fine-tuning de modelos, mas não enviou sistemas de inferência
- Você usou LangChain/LlamaIndex, mas não construiu a camada subjacente
- Forte background em pesquisa de ML sem exposição a sistemas
