Esri
The Walt Disney Company
Engenheiro Staff de P&D - Skywalker Sound
Sobre a oportunidade
Título da Vaga:
ID da Requisição: 10127968
Esta função é considerada Híbrida, o que significa que o funcionário trabalhará presencialmente em nosso escritório em Nicasio, CA, e ocasionalmente de casa.
Segmento da Vaga: Skywalker Sound
Negócio Principal da Vaga: Skywalker Sound-Engenharia
Categoria Principal da Vaga: Engenheiro de Software
Tipo de Emprego: Tempo integral
Cidade, Estado, Região, CEP Principal: Nicasio, CA, EUA
Cidade, Estado, Região, CEP Alternativo:
Data de Publicação: 2025-08-19
Descrição da Vaga
Engenheiro Sênior de P&D Staff - Skywalker Sound
O Skywalker Sound Development Group está buscando um Engenheiro Sênior de P&D Staff (IA/ML) altamente qualificado para liderar o desenvolvimento de tecnologias transformadoras de inteligência de áudio para produção de mídia global. Esta função sênior é central para o avanço de nossa plataforma de trilha sonora de próxima geração, com foco em processamento de fala, transferência de estilo, upmixing, separação de fontes e síntese de áudio generativa.
Você irá projetar, construir e otimizar sistemas de machine learning de ponta em escala — aproveitando modelos fundamentais, vocoders neurais, modelos de difusão latente e fluxos de trabalho avançados de retreinamento. Como membro central de nossa equipe de P&D aplicada, você contribuirá para a direção técnica, colaborará com equipes de produto e engenharia, e entregará soluções prontas para produção que se integrem perfeitamente aos fluxos de trabalho criativos e operacionais para criadores de conteúdo de elite em todo o mundo.
O que você fará *
- Liderar a pesquisa, o projeto e a implementação de algoritmos de machine learning de última geração para processamento de fala, transferência de voz, separação de fontes e upmixing em ambientes de pós-produção de mídia. *
- Impulsionar a arquitetura e a implantação de pipelines escaláveis de treinamento de modelos usando PyTorch e frameworks de computação distribuída. *
- Desenvolver modelos generativos de áudio inovadores, incluindo difusão latente, modelos baseados em fluxo, autoencoders variacionais e vocoders neurais, otimizados para produção profissional de trilhas sonoras. *
- Gerenciar o ciclo de vida completo do modelo: pré-treinamento, ajuste fino, validação, otimização de inferência e integração de CI/CD. *
- Orientar o desenvolvimento de fluxos de trabalho de adaptação de modelo personalizados para suportar ajuste por usuário, continuidade entre projetos e implantação flexível. *
- Colaborar com líderes de produto, plataforma e engenharia para definir estratégias de integração dentro de um ambiente seguro de SaaS otimizado para nuvem. *
- Manter-se na vanguarda do áudio generativo, modelagem multimodal e aprendizado autossupervisionado — traduzindo pesquisas emergentes em inovação aplicada. *
- Contribuir para ferramentas internas e infraestrutura que melhorem a velocidade de iteração, reprodutibilidade e explicabilidade dos modelos implantados. *
- Orientar pesquisadores e engenheiros juniores, e contribuir para uma cultura de experimentação rigorosa, colaboração e melhoria contínua.
Requisitos mínimos
O que procuramos *
- Mestrado ou Doutorado em Ciência da Computação, Engenharia Elétrica, Matemática Aplicada ou área relacionada com foco em IA/ML e processamento de sinais multimodais. *
- 5 anos de experiência profissional em ML aplicada, com foco profundo em pesquisa e implantação de IA/ML centrada em áudio. *
- Experiência em construção e escalonamento de modelos usando PyTorch, com fluência em treinamento, ajuste fino e inferência para redes neurais profundas. *
- Experiência comprovada no desenvolvimento de modelos generativos como VAE, GAN, modelos de difusão ou vocoders neurais (por exemplo, HiFi-GAN, WaveNet). *
- Profundo entendimento de domínios de ML específicos de áudio, incluindo separação de fontes, aprimoramento de fala, processamento de música e tarefas transmodais. *
- Experiência com ferramentas de MLOps (por exemplo, Weights & Biases, MLflow, Datachain), contêinerização baseada em Docker e infraestrutura escalável para treinamento distribuído. *
- Fluência nos fundamentos de processamento de sinais de áudio e na integração de DSP em pipelines de ML. *
- Capacidade comprovada de contribuir para o planejamento arquitetônico, estratégia de pesquisa e implantação de produção em ambientes complexos e com múltiplos stakeholders.
Qualificações Preferenciais *
- Familiaridade com frameworks multimodais de áudio/texto/vídeo e representações interdomínio. *
- Experiência na implementação de pipelines de inferência em tempo real ou quase real em ambientes de nuvem ou de borda (por exemplo, AWS, GCP, GPUs on-prem). *
- Conhecimento prático de modelos de áudio de difusão latente (por exemplo, stable-audio, AudioLDM, AudioGen). *
- Forte conhecimento de conjuntos de dados e benchmarks de áudio padrão da indústria (LibriSpeech, VCTK, MUSDB, etc.). *
- Experiência na otimização de pipelines de inferência para aplicações criativas ou uso interativo. *
- Proficiência em frameworks de áudio de baixo nível (C / C++, etc.) *
- Contribuições para pesquisas publicadas em conferências de ponta (NeurIPS, ICASSP, ICLR, Interspeech) e/ou frameworks de ML de código aberto.
A faixa salarial para esta posição em Nicasio, CA é de US$ 209,500.00 a US$ 280,900.00 por ano. O salário base efetivamente oferecido levará em consideração a equidade interna e também poderá variar dependendo da região geográfica do candidato, conhecimento, habilidades e experiência relacionados ao trabalho, entre outros fatores. Um bônus e/ou unidades de incentivo de longo prazo podem ser fornecidos como parte do pacote de remuneração, além de toda a gama de benefícios médicos, financeiros e/ou outros, dependendo do nível e da posição oferecida.
