Terra Quantum
Tensordyne
Engenheiro(a) de Inferência Forward Deployed
Sobre a Tensordyne
A Tensordyne está construindo uma nova classe de sistema de inferência de IA projetada para implantação de alto desempenho e eficiência energética das cargas de trabalho de IA generativa mais exigentes do mundo.
Nossa plataforma combina silício de propósito específico, nova matemática de IA, rede de escalonamento otimizada e arquitetura de memória em um sistema rigidamente integrado, construído especificamente para inferência de IA em larga escala. Trabalhamos com hiperscaladores, Neoclouds, desenvolvedores de modelos de ponta, empresas e parceiros de infraestrutura que operam na vanguarda da IA.
À medida que a Tensordyne transita do desenvolvimento de sistemas para a ativação de silício, validação de clientes, implantações beta e lançamento de produção, estamos construindo a organização técnica de clientes que ficará diretamente entre nossas equipes de engenharia e as empresas que implantam a plataforma.
Resumo da função
Estamos procurando um(a) Engenheiro(a) de Inferência Forward Deployed que combine profundo conhecimento em sistemas de IA com fortes instintos de cliente. Essa pessoa será responsável pelo caminho desde uma carga de trabalho ou solicitação de modelo do cliente até um resultado técnico e, quando necessário, até um modelo otimizado rodando com sucesso no hardware e software da Tensordyne.
A função está na interseção da arquitetura do modelo, desempenho de inferência, otimização de sistemas, ferramentas de desenvolvedor e implantação de clientes. Você trabalhará diretamente com a engenharia, ao mesmo tempo em que atuará como uma ponte técnica para Produto, Desenvolvimento de Negócios, Vendas e clientes.
Valores da Tensordyne
- Pense grande. Busque metas técnicas e de negócios ambiciosas.
- Busque a excelência. A qualidade é importante em tudo o que construímos e entregamos.
- Assuma a responsabilidade e faça acontecer. Assuma a responsabilidade e impulsione resultados.
- Opere com integridade. Seja direto, transparente e respeitoso.
- Vença como equipe. Torne as pessoas ao seu redor mais eficazes.
- Valorize diferentes perspectivas. As equipes mais fortes desafiam suposições e trazem diversas experiências para problemas difíceis.
A Tensordyne é um empregador que oferece igualdade de oportunidades. Acreditamos que equipes diversas estão mais bem equipadas para resolver problemas complexos e construir tecnologia excepcional. Todos os candidatos qualificados receberão consideração para emprego sem distinção de idade, cor, identidade ou expressão de gênero, estado civil, origem nacional, deficiência, status de veterano protegido, raça, religião, gravidez, orientação sexual ou qualquer outra característica protegida pelas leis, regulamentos e ordenanças aplicáveis.
O que você fará
- Transformar cargas de trabalho de clientes em respostas de desempenho rápidas e credíveis por meio de profiling e benchmarking. Definir KPIs relevantes, comparar com benchmarks competitivos e manter nossa metodologia de avaliação atualizada com benchmarks externos.
- Habilitação e otimização de modelos: converter e ativar modelos de clientes na pilha da Tensordyne, validar a qualidade numérica, identificar gargalos de desempenho e trabalhar com as equipes de compilador, runtime, kernel e sistema para melhorar os resultados.
- Implantação / engenharia forward: trabalhar diretamente com clientes e parceiros em Provas de Conceito (PoCs) técnicas, integração, implantação e depuração; traduzir requisitos em critérios de aceitação mensuráveis para qualidade, latência, throughput e outros KPIs relevantes.
- Rastrear a precisão do profiling para o hardware comparando continuamente os resultados de profiling/simulação com implantações de hardware reais, explicar lacunas materiais e sinalizar capacidades ausentes no compilador, SDK, servidor de inferência, gerenciamento de cache KV ou sistemas adjacentes para as equipes responsáveis.
- Transformar aprendizados repetidos específicos do cliente em ferramentas reutilizáveis, documentação, benchmarks ou melhorias de produto.
Qualificações essenciais
- Forte experiência prática com modelos de IA e sistemas de inferência, especialmente LLMs densos e MoE (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM), e modelos VLM, de fala e de difusão.
- Fortes habilidades em Python e PyTorch e a capacidade de entender e modificar o código do modelo.
- Experiência em profiling, benchmarking ou otimização de inferência de modelos e raciocínio sobre latência, throughput, memória e utilização.
- Fortes habilidades de resolução de problemas e comunicação, com a capacidade de conduzir problemas técnicos ambíguos através de limites de equipe.
- Proficiência no uso de ferramentas de desenvolvedor com IA (por exemplo, Claude Code, Cursor).
Diferenciais importantes
- Experiência com stacks de serving e implantação de LLM como vLLM, SGLang ou sistemas similares.
- Experiência trabalhando diretamente com clientes ou parceiros técnicos externos.
- Experiência em ativar modelos em novos aceleradores ou hardware não padronizado, incluindo depuração de desempenho em limites de framework/runtime/hardware.
- Experiência prática com técnicas ou ambientes de inferência de produção, como quantização, inferência distribuída ou Kubernetes.
- Experiência em navegar e contribuir para bases de código Rust.
Observação para agências de recrutamento: Por favor, não entre em contato com funcionários ou líderes da Tensordyne sobre esta função. Não aceitamos currículos de agências não solicitados e não somos responsáveis por taxas associadas a submissões não solicitadas.
