Haeger Consulting
Tensordyne
Engenheiro(a) de Inferência de Implantação Avançada
SOBRE A TENSORDYNE
A Tensordyne está construindo uma nova classe de sistema de inferência de IA projetada para a implantação de alto desempenho e eficiência energética das cargas de trabalho de IA generativa mais exigentes do mundo.
Nossa plataforma combina silício de propósito específico, nova matemática de IA, rede de escalonamento otimizada e arquitetura de memória em um sistema rigidamente integrado, construído especificamente para inferência de IA em larga escala. Trabalhamos com provedores de hiperescala, Neoclouds, desenvolvedores de modelos de ponta, empresas e parceiros de infraestrutura que operam na vanguarda da IA.
À medida que a Tensordyne transita do desenvolvimento de sistemas para a ativação de silício, validação de clientes, implantações beta e lançamento de produção, estamos construindo a organização técnica de clientes que ficará diretamente entre nossas equipes de engenharia e as empresas que implantam a plataforma.
RESUMO DA FUNÇÃO
Estamos procurando um(a) Engenheiro(a) de Inferência de Implantação Avançada que combine profundo conhecimento em sistemas de IA com fortes instintos de cliente. Essa pessoa será responsável pelo caminho desde uma carga de trabalho ou solicitação de modelo do cliente até um resultado técnico e, quando necessário, até um modelo otimizado rodando com sucesso no hardware e software da Tensordyne.
A função se situa na interseção da arquitetura do modelo, desempenho de inferência, otimização de sistemas, ferramentas de desenvolvedor e implantação de clientes. Você trabalhará diretamente com a engenharia, ao mesmo tempo em que atuará como uma ponte técnica para Produto, Desenvolvimento de Negócios, Vendas e clientes.
O QUE VOCÊ FARÁ *
- Transformar cargas de trabalho de clientes em respostas de desempenho rápidas e credíveis por meio de profiling e benchmarking. Definir KPIs relevantes, comparar com linhas de base competitivas e manter nossa metodologia de avaliação atualizada com benchmarks externos. *
- Habilitação e otimização de modelos: converter e ativar modelos de clientes na pilha da Tensordyne, validar a qualidade numérica, identificar gargalos de desempenho e trabalhar com as equipes de compilador, runtime, kernel e sistema para melhorar os resultados. *
- Implantação / engenharia avançada: trabalhar diretamente com clientes e parceiros em Provas de Conceito (PoCs) técnicas, integração, implantação e depuração; traduzir requisitos em critérios de aceitação mensuráveis para qualidade, latência, taxa de transferência e outros KPIs relevantes. *
- Rastrear a precisão do profiling para o hardware comparando continuamente os resultados de profiling/simulação com as implantações de hardware reais, explicar lacunas materiais e sinalizar capacidades ausentes no compilador, SDK, servidor de inferência, gerenciamento de cache KV ou sistemas adjacentes para as equipes responsáveis. *
- Transformar aprendizados repetidos específicos do cliente em ferramentas reutilizáveis, documentação, benchmarks ou melhorias de produto.
QUALIFICAÇÕES ESSENCIAIS *
- Forte experiência prática com modelos de IA e sistemas de inferência, especialmente LLMs densos e MoE (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM), e modelos VLM, de fala e de difusão. *
- Fortes habilidades em Python e PyTorch e a capacidade de entender e modificar o código do modelo. *
- Experiência em profiling, benchmarking ou otimização de inferência de modelos e raciocínio sobre latência, taxa de transferência, memória e utilização. *
- Fortes habilidades de resolução de problemas e comunicação, com a capacidade de conduzir problemas técnicos ambíguos através de limites de equipe. *
- Proficiência no uso de ferramentas de desenvolvedor com IA (por exemplo, Claude Code, Cursor).
FORTES DIFERENCIAIS *
- Experiência com pilhas de serviço e implantação de LLM como vLLM, SGLang ou sistemas similares. *
- Experiência trabalhando diretamente com clientes ou parceiros técnicos externos. *
- Experiência em ativar modelos em novos aceleradores ou hardware não padrão, incluindo depuração de desempenho em limites de framework/runtime/hardware. *
- Experiência prática com técnicas ou ambientes de inferência de produção, como quantização, inferência distribuída ou Kubernetes. *
- Experiência em navegar e contribuir para bases de código Rust.
A CULTURA DA TENSORDYNE FOI CONSTRUÍDA SOBRE OS SEGUINTES VALORES *
- Coloque as pessoas em primeiro lugar. Só teremos sucesso quando nossas pessoas tiverem sucesso. *
- Ética e integridade sempre; Ser aberto, honesto e respeitoso com todos. *
- Pense Grande. Seja ambicioso e tenha metas audaciosas. *
- Busque a excelência. Qualidade e excelência contam em tudo o que fazemos. *
- Assuma a responsabilidade e faça acontecer. Resultados importam! *
- Faça cada pessoa ser melhor junta do que seria individualmente. *
- Abrace as diferenças uns dos outros e aceite que haverá diferenças. *
A Tensordyne é um empregador que oferece igualdade de oportunidades. Acreditamos que equipes diversas estão mais bem equipadas para resolver problemas complexos e construir tecnologia excepcional. Todos os candidatos qualificados receberão consideração para emprego sem distinção de idade, cor, identidade ou expressão de gênero, estado civil, origem nacional, deficiência, status de veterano protegido, raça, religião, gravidez, orientação sexual ou qualquer outra característica protegida pelas leis, regulamentos e ordenanças aplicáveis.
Uma nota para agências de recrutamento: Por favor, não entre em contato com funcionários ou líderes da Tensordyne sobre esta função. Não aceitamos currículos de agências não solicitados e não somos responsáveis por taxas associadas a submissões não solicitadas.
