Nominal
Together AI
Engenheiro(a) Sênior de Machine Learning, Voz IA
SOBRE A VAGA
Together AI está construindo a melhor infraestrutura de inferência para aplicações de voz. Nossa plataforma de Voz IA potencializa agentes e aplicações de voz em tempo real, prontos para produção — servindo modelos de speech-to-text e text-to-speech com latência e confiabilidade de ponta.
Estamos procurando um(a) Engenheiro(a) de ML Sênior para impulsionar a camada de serviço de modelos para cargas de trabalho de voz. Você trabalhará diretamente com motores de inferência como TRT-LLM e SGLang para otimizar como servimos modelos como Whisper, Parakeet, Orpheus e Kokoro — empurrando a latência e a taxa de transferência para a fronteira. Você fará o perfil de utilização da GPU, projetará estratégias de batching para áudio em streaming e garantirá que novas arquiteturas de modelos possam ir da pesquisa para a produção rapidamente. Esta é uma contratação fundamental em uma equipe pequena e de alto impacto. A inferência de voz tem desafios únicos — áudio em streaming, tokenização, orçamentos de latência em tempo real — que exigem foco dedicado em engenharia de ML. Você moldará como a Together serve modelos de voz à medida que a indústria se move de arquiteturas de pipeline (ASR → LLM → TTS) em direção a speech-to-speech de ponta a ponta.
RESPONSABILIDADES
- Ser o principal responsável pela pilha de serviço de modelos que potencializa a plataforma de voz da Together em STT, TTS e speech-to-speech.
- Trabalhar diretamente com aceleradores de ponta (H100s, H200s, B200s) para otimizar a inferência de modelos de voz.
- Colaborar com parceiros de modelos (Cartesia, Deepgram, Rime e outros) para levar seus modelos à produção na infraestrutura da Together.
- Construir frameworks de avaliação de qualidade que guiem a seleção de modelos para clientes e informem o roadmap.
- Juntar-se a uma equipe pequena e em estágio inicial com impacto desproporcional em uma área de produto em rápido crescimento.
- Otimizar o desempenho de inferência para modelos de voz (STT, TTS, speech-to-speech) — visando TTFB, taxa de transferência e utilização de GPU de ponta em nosso conjunto de modelos curado.
- Produzir modelos de voz em endpoints serverless e dedicados, incluindo estratégias de batching, inferência em streaming e gerenciamento de memória adaptados para cargas de trabalho de áudio.
- Construir e manter um framework de avaliação de modelos de voz — medindo WER em diferentes sotaques, idiomas e condições de ruído para STT; naturalidade, latência e precisão de pronúncia para TTS.
- Habilitar novas arquiteturas de modelos em nossa pilha de serviço à medida que o campo evolui, incluindo LLMs nativos de áudio, modelos baseados em codec (SNAC) e sistemas speech-to-speech.
- Colaborar com parceiros de modelos para integrar e otimizar seus modelos (Cartesia, Deepgram, Rime e outros) rodando na infraestrutura da Together.
- Fazer o perfil e depurar o desempenho em toda a pilha de inferência — de kernels de GPU a gargalos em nível de framework — e entregar melhorias mensuráveis.
- Trabalhar com o lado de engenharia de plataforma da equipe para garantir que a camada de serviço atenda aos requisitos de latência e confiabilidade de APIs de voz em tempo real.
- Contribuir para as capacidades de fine-tuning de modelos de voz (STT e TTS) à medida que habilitamos os clientes a construir experiências de voz diferenciadas na Together.
- Preparar o terreno para múltiplos novos produtos futuramente.
REQUISITOS
- 5+ anos de experiência em engenharia de ML, com foco em serviço de modelos, otimização de inferência ou infraestrutura de ML.
- Experiência prática com motores de serviço de LLM (vLLM, SGLang, TensorRT-LLM ou similar) — confortável em ler e modificar os internos do motor, não apenas usar APIs.
- Forte proficiência em Python e PyTorch; experiência com perfilamento e otimização de GPU (CUDA, gerenciamento de memória, depuração em nível de kernel).
- Histórico comprovado de entrega de sistemas de ML em produção com melhorias mensuráveis de desempenho.
- Forte senso de produto — você pensa sobre o que os desenvolvedores que criam aplicativos de voz realmente precisam, não apenas sobre o que é tecnicamente interessante.
- Conforto em trabalhar em uma equipe pequena e em estágio inicial onde você usará vários chapéus e agirá rapidamente.
- Bacharelado ou Mestrado em Ciência da Computação, Engenharia Elétrica ou área relacionada, ou experiência prática equivalente
- Experiência com ML de fala e áudio (ASR, arquiteturas TTS, processamento de sinais de áudio) é um forte diferencial, mas não obrigatório — você pode aprender isso rapidamente se tiver fortes fundamentos em engenharia de ML.
- Familiaridade com codecs de áudio e esquemas de tokenização (SNAC, Encodec, DAC) é um diferencial.
- Experiência em treinamento ou fine-tuning de modelos de fala é um diferencial.
SOBRE A TOGETHER AI
Together AI, a Nuvem Nativa de IA, é construída especificamente para engenheiros de IA. Desenvolvedores de aplicações de IA obtêm inferência de alto desempenho que escala de forma confiável, fine-tuning e aprendizado por reforço para criar modelos especializados de ponta, e pré-treinamento em escala massiva para inteligência totalmente customizada, tudo em torno de um marketplace de modelos abertos líderes que as equipes podem executar, adaptar e possuir.
Confiável por Cursor, Decagon, ElevenLabs, Salesforce e Zoom, a Together serve mais de 400 trilhões de tokens por mês.
COMPENSAÇÃO
Oferecemos remuneração competitiva, participação acionária inicial (equity), plano de saúde e outros benefícios competitivos. A faixa salarial base nos EUA para esta posição em tempo integral é:
$200,000 - $260,000 + equity + benefícios.
Nossas faixas salariais são determinadas por localização, nível e cargo. A remuneração individual será determinada pela experiência, habilidades e conhecimento relacionado ao trabalho.
IGUALDADE DE OPORTUNIDADES
Together AI é um Empregador de Igualdade de Oportunidades e se orgulha de oferecer igualdade de oportunidades de emprego a todos, independentemente de raça, cor, ancestralidade, religião, sexo, origem nacional, orientação sexual, idade, cidadania, estado civil, deficiência, identidade de gênero, status de veterano e muito mais.
Por favor, veja nossa política de privacidade em together.ai/privacy
