Arcana Analytics

Engenheiro(a) de IA Sênior — Sistemas de Inferência e Agentes

PythonPostgreSQLDockerGo
Tradução automática. Consulte o original.

O Que Estamos Construindo

Cargo: Engenheiro(a) de IA Aplicada — Sistemas de Inferência e Agentes

A Arcana está construindo agentes de IA que sintetizam informações de fontes heterogêneas e entregam respostas estruturadas e raciocinadas em tempo real. O produto só funciona se os agentes forem rápidos, confiáveis e corretos, não aproximadamente corretos.

Nossa stack: Go + Temporal para orquestração, uma arquitetura de agente Plan-Execute-Synthesize e um framework de avaliação que usamos para medir cada regressão. Os problemas são difíceis. A barra de latência é agressiva. Os requisitos de precisão são implacáveis.

Por Que Esta Posição

Os problemas aqui ainda não têm posts de blog sobre eles. Execução paralela de DAGs de agentes sob orçamentos de latência rigorosos, síntese em streaming a partir de resultados parciais de sub-agentes, frameworks de avaliação para sistemas multi-etapas não-determinísticos: estes são genuinamente não resolvidos com qualidade de produção. Equipe pequena. Alta responsabilidade. As decisões de cada engenheiro(a) vão para produção.

Candidatura

Localização: Estados Unidos

Enviar para: [[email protected]]

Incluir:

  1. Um sistema que você construiu onde a latência era a principal restrição: o que você mediu, o que você mudou, o que se moveu
  1. Link para qualquer coisa pública (código, textos, palestras)
  1. Carta de apresentação não é necessária

Respondemos a todas as candidaturas.

O Trabalho

Otimização de Inferência

  1. Reduzir o TTFT para menos de 400ms para pipelines de agentes multi-etapas
  1. Otimização de streaming: primeiro token para o usuário enquanto sub-agentes ainda estão em execução
  1. Estratégia de cache KV, compressão de prompt, gerenciamento dinâmico de janela de contexto
  1. Roteamento multi-provedor: seleção de modelo por latência, custo e tipo de tarefa entre OpenAI, Anthropic, Gemini e modelos de peso aberto

Arquitetura de Agentes

  1. Projetar e implementar pipelines Plan-Execute-Synthesize que executam sub-agentes em DAGs paralelos, não em cadeias sequenciais
  1. Construir orquestração confiável sobre Temporal: retentativas, timeouts, recuperação de falhas parciais, idempotência
  1. Aplicação de saída estruturada: validação de esquema JSON, loops de retentativa em saída LLM malformada, degradação graciosa
  1. Design de chamada de ferramenta: design de esquema que LLMs realmente seguem de forma confiável entre provedores

Avaliação e Framework

  1. Ser o responsável pelo framework de avaliação de ponta a ponta: datasets de ground truth, pipelines de pontuação automatizada, detecção de regressão em cada PR
  1. Pipelines de LLM-como-juiz para avaliação qualitativa da saída
  1. Testes de regressão de latência - p50/p95/p99 rastreados em cada implantação
  1. Design de casos de teste adversariais: consultas ambíguas, dados ausentes, fontes conflitantes, respostas de ferramenta malformadas

Infraestrutura

  1. Servir modelos e otimização de cold start
  1. Arquitetura de workers assíncronos para execução paralela de sub-agentes
  1. Observabilidade: rastrear cada token, cada chamada de ferramenta, cada etapa de síntese

O Que Procuramos

Você construiu algo que roda em produção em escala significativa e entende por que é rápido (ou por que não é).

Sinal forte

  1. Você trabalhou em pipelines de inferência onde o TTFT era a métrica principal e você o moveu significativamente
  1. Você construiu sistemas de agentes multi-etapas e sabe onde eles falham, não por ler artigos, mas por vê-los falhar em produção
  1. Você construiu frameworks de avaliação do zero e tem opiniões sobre o que torna um dataset de ground truth realmente útil -
  1. Você depurou não-determinismo de LLM em produção e construiu sistemas resilientes a ele
  1. Você trabalhou com respostas de LLM em streaming e construiu infraestrutura em torno do tratamento de saída parcial

Familiaridade com a stack (nos importamos mais com profundidade do que com correspondência): Go, Python, Temporal, Kafka, PostgreSQL, Docker

De Quem Queremos Ouvir

Você enviou sistemas de inferência em:

  1. Um produto de IA em tempo real (busca, assistente de codificação, chat em escala)
  1. Uma empresa de infraestrutura de serving de modelos
  1. Uma plataforma de agentes (qualquer domínio)

Ou você construiu infraestrutura de avaliação/framework na qual uma equipe de mais de 10 engenheiros realmente confiou para capturar regressões.

Sinal mais fraco (mas não desqualificante)

  1. Você fez fine-tuning de modelos, mas não enviou sistemas de inferência
  1. Você usou LangChain/LlamaIndex, mas não construiu a camada subjacente
  1. Forte background em pesquisa de ML sem exposição a sistemas

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores