Esri
Pika
Engenheiro(a) de ML, Inferência e Otimização
Sobre a Vaga
Estamos buscando Engenheiros(as) de Inferência de nível Sênior/Staff para acelerar o desempenho dos produtos de IA da Pika. Nesta função altamente técnica, você atuará na intersecção entre aceleração de inferência de ponta, paralelismo de GPU, implantação avançada de modelos e tecnologias de geração de vídeo. Sua expertise impulsionará melhorias significativas na velocidade e eficiência dos modelos, garantindo que nossos sistemas criativos de IA ofereçam experiências de usuário líderes no setor em escala.
Você projetará e otimizará pipelines de inferência, implementará técnicas de aceleração de última geração e trabalhará em estreita colaboração com pesquisadores(as) e engenheiros(as) de toda a equipe para expandir os limites do que é possível na implantação de IA em tempo real. Seus esforços desempenharão um papel fundamental no impulsionamento da próxima geração de modelos de vídeo e linguagem da Pika.
O que você fará
- Acelerar Inferência: Liderar e implementar técnicas avançadas de aceleração de inferência, incluindo otimização de atenção e quantização para serviço eficiente de modelos.
- Maximizar Paralelismo de GPU: Projetar e otimizar estratégias de GPU em paralelismo de tensor, sequência e pipeline (TP, SP, PP) para máxima eficiência e escalabilidade.
- Programação para Desempenho: Desenvolver e otimizar kernels de computação de alto desempenho e cargas de trabalho distribuídas usando CUDA e NCCL.
- Avançar Implantação de IA: Colaborar com equipes de pesquisa e engenharia para colocar modelos de videogen e linguagem de grande porte de última geração em produção.
- Melhorar Eficiência de Treinamento: (Bônus) Contribuir para melhorias na velocidade, estabilidade e utilização de recursos do treinamento de modelos como parte de nosso ciclo de vida de implantação.
- Excelência Técnica: Conduzir revisões de código rigorosas, participar de discussões técnicas e orientar colegas engenheiros(as) sobre as melhores práticas em inferência e programação de GPU.
O que buscamos
- Experiência: 5+ anos de experiência em engenharia, com um histórico sólido em aceleração de inferência e implantação de modelos em escala.
- Domínio de Inferência: Expertise comprovada em otimização de inferência, incluindo quantização, aceleração de atenção e stacks de compiladores de deep learning.
- GPU e Paralelismo: Profundo conhecimento de programação de GPU (CUDA, NCCL) e experiência com SP, TP, PP e outras formas de paralelismo para inferência distribuída.
- Conhecimento de Domínio de IA: Familiaridade com modelos de geração de vídeo (videogen) e modelos de linguagem de grande porte (LLMs).
- Colaboração: Fortes habilidades de comunicação interdisciplinar; capaz de impulsionar objetivos compartilhados entre as funções de pesquisa e engenharia.
- Mentalidade de Propriedade: Autodirigido(a), orientado(a) a soluções e capaz de gerenciar ambiguidades em um ambiente de startup de ritmo acelerado.
Diferenciais
- Bônus: Experiência em aprimorar a eficiência, estabilidade ou otimização de recursos de treinamento para modelos grandes.
- Experiência com implantação de modelos de vídeo de alta vazão ou em tempo real
- Familiaridade com treinamento distribuído e toolkits de otimização
- Contribuições para projetos de código aberto em infraestrutura de IA ou compiladores de deep learning
- Experiência em startup ou prototipagem rápida
O que oferecemos
- Salário competitivo na indústria de IA
- Participação acionária em uma startup em rápido crescimento moldando o futuro da IA
- Benefícios abrangentes de saúde, auxílios mensais, retiros da empresa
- Uma cultura de escritório solidária e colaborativa — estamos todos construindo e lançando juntos
Sobre a Pika
Na Pika, estamos criando um futuro onde a criação de vídeo é contínua, intuitiva e universalmente acessível. Nossa missão é capacitar a criatividade, quebrando barreiras técnicas com o poder transformador da IA. Somos uma equipe unida e enérgica baseada em Palo Alto, CA, valorizando a eficiência, a curiosidade e a ambição de causar um impacto significativo no mundo.
Trabalhamos em nosso escritório em Palo Alto 3–5 dias por semana e damos as boas-vindas a candidatos(as) que desejam contribuir presencialmente.
