Pika

Engenheiro(a) de ML, Inferência e Otimização

Tradução automática. Consulte o original.

Sobre a Vaga

Estamos buscando Engenheiros(as) de Inferência de nível Sênior/Staff para acelerar o desempenho dos produtos de IA da Pika. Nesta função altamente técnica, você atuará na intersecção entre aceleração de inferência de ponta, paralelismo de GPU, implantação avançada de modelos e tecnologias de geração de vídeo. Sua expertise impulsionará melhorias significativas na velocidade e eficiência dos modelos, garantindo que nossos sistemas criativos de IA ofereçam experiências de usuário líderes no setor em escala.

Você projetará e otimizará pipelines de inferência, implementará técnicas de aceleração de última geração e trabalhará em estreita colaboração com pesquisadores(as) e engenheiros(as) de toda a equipe para expandir os limites do que é possível na implantação de IA em tempo real. Seus esforços desempenharão um papel fundamental no impulsionamento da próxima geração de modelos de vídeo e linguagem da Pika.

O que você fará

  1. Acelerar Inferência: Liderar e implementar técnicas avançadas de aceleração de inferência, incluindo otimização de atenção e quantização para serviço eficiente de modelos.
  1. Maximizar Paralelismo de GPU: Projetar e otimizar estratégias de GPU em paralelismo de tensor, sequência e pipeline (TP, SP, PP) para máxima eficiência e escalabilidade.
  1. Programação para Desempenho: Desenvolver e otimizar kernels de computação de alto desempenho e cargas de trabalho distribuídas usando CUDA e NCCL.
  1. Avançar Implantação de IA: Colaborar com equipes de pesquisa e engenharia para colocar modelos de videogen e linguagem de grande porte de última geração em produção.
  1. Melhorar Eficiência de Treinamento: (Bônus) Contribuir para melhorias na velocidade, estabilidade e utilização de recursos do treinamento de modelos como parte de nosso ciclo de vida de implantação.
  1. Excelência Técnica: Conduzir revisões de código rigorosas, participar de discussões técnicas e orientar colegas engenheiros(as) sobre as melhores práticas em inferência e programação de GPU.

O que buscamos

  1. Experiência: 5+ anos de experiência em engenharia, com um histórico sólido em aceleração de inferência e implantação de modelos em escala.
  1. Domínio de Inferência: Expertise comprovada em otimização de inferência, incluindo quantização, aceleração de atenção e stacks de compiladores de deep learning.
  1. GPU e Paralelismo: Profundo conhecimento de programação de GPU (CUDA, NCCL) e experiência com SP, TP, PP e outras formas de paralelismo para inferência distribuída.
  1. Conhecimento de Domínio de IA: Familiaridade com modelos de geração de vídeo (videogen) e modelos de linguagem de grande porte (LLMs).
  1. Colaboração: Fortes habilidades de comunicação interdisciplinar; capaz de impulsionar objetivos compartilhados entre as funções de pesquisa e engenharia.
  1. Mentalidade de Propriedade: Autodirigido(a), orientado(a) a soluções e capaz de gerenciar ambiguidades em um ambiente de startup de ritmo acelerado.

Diferenciais

  1. Bônus: Experiência em aprimorar a eficiência, estabilidade ou otimização de recursos de treinamento para modelos grandes.
  1. Experiência com implantação de modelos de vídeo de alta vazão ou em tempo real
  1. Familiaridade com treinamento distribuído e toolkits de otimização
  1. Contribuições para projetos de código aberto em infraestrutura de IA ou compiladores de deep learning
  1. Experiência em startup ou prototipagem rápida

O que oferecemos

  • Salário competitivo na indústria de IA
  • Participação acionária em uma startup em rápido crescimento moldando o futuro da IA
  • Benefícios abrangentes de saúde, auxílios mensais, retiros da empresa
  • Uma cultura de escritório solidária e colaborativa — estamos todos construindo e lançando juntos

Sobre a Pika

Na Pika, estamos criando um futuro onde a criação de vídeo é contínua, intuitiva e universalmente acessível. Nossa missão é capacitar a criatividade, quebrando barreiras técnicas com o poder transformador da IA. Somos uma equipe unida e enérgica baseada em Palo Alto, CA, valorizando a eficiência, a curiosidade e a ambição de causar um impacto significativo no mundo.

Trabalhamos em nosso escritório em Palo Alto 3–5 dias por semana e damos as boas-vindas a candidatos(as) que desejam contribuir presencialmente.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores