Nominal
The Walt Disney Company
Staff Data Engineer (Audio/ML) - Skywalker Sound
Título da Vaga: Engenheiro de Dados Staff (Áudio/ML) - Skywalker Sound
ID da Vaga: 10129825
Esta função é considerada híbrida, o que significa que o colaborador trabalhará 2-3 dias presencialmente em nosso escritório em Nicasio, CA, e ocasionalmente de casa.
Segmento da Vaga: Skywalker Sound
Negócio Principal da Vaga: Skywalker Sound-Engineering
Categoria Principal da Vaga: Data Engineering
Tipo de Emprego: Tempo integral
Cidade, Estado, Região, CEP Principal: Nicasio, CA, USA
Cidade, Estado, Região, CEP Alternativo:
Data de Publicação: 2025-09-16
Descrição da Vaga
O Grupo de Desenvolvimento da Skywalker Sound está em busca de um Engenheiro de Dados experiente com foco em Áudio/ML para se especializar na criação, gestão e otimização de pipelines de dados para apoiar pesquisas de ponta em IA/ML. Esta é uma função crítica na preparação de conjuntos de dados de alta qualidade para o treinamento, retreinamento e avaliação de modelos de machine learning personalizados para aplicações de áudio imersivo e multicanal.
Como Engenheiro de Dados (Áudio/ML), você focará no desenvolvimento de pipelines robustos para o processamento de conjuntos de dados de mídia complexos, permitindo que pesquisadores de IA/ML criem soluções transformadoras para processamento de fala, transferência de estilo e separação de fontes. Seu trabalho contribuirá diretamente para a criação de fluxos de trabalho de trilhas sonoras inovadores para a produção global de mídia.
O que você fará
- Projetar, implementar e manter pipelines de dados escaláveis e automatizados para a ingestão, pré-processamento e transformação de conjuntos de dados de áudio em larga escala.
- Garantir que os pipelines suportem fluxos de trabalho eficientes de treinamento e retreinamento de modelos, permitindo a melhoria contínua dos modelos de IA/ML.
- Colaborar com pesquisadores de IA/ML para definir requisitos de dados e integrar feedbacks para melhorar a funcionalidade do pipeline de dados.
- Desenvolver técnicas avançadas de pré-processamento para formatos de áudio imersivo e multicanal (por exemplo, Dolby Atmos, ambisonics de alta ordem).
- Automatizar processos de limpeza, normalização e aumento de dados para preparar conjuntos de dados para várias arquiteturas de modelos, incluindo modelos fundamentais e transformers.
- Integrar conjuntos de dados externos e APIs garantindo a conformidade com padrões legais e éticos de uso de dados.
- Monitorar e otimizar o desempenho do pipeline para lidar com estruturas de dados complexas e dinâmicas de forma eficaz.
- Criar ferramentas e fluxos de trabalho para anotar, rotular e curar conjuntos de dados, incluindo o uso de métodos de aprendizado ativo.
- Realizar análise exploratória de dados para descobrir tendências, validar a qualidade do conjunto de dados e identificar lacunas nos dados.
Requisitos mínimos
O que buscamos
- Mestrado, com preferência para Doutorado em Engenharia de Dados/Ciência de Dados, Ciência da Computação, Processamento de Sinais ou área relacionada.
- 8+ anos de experiência em engenharia de dados ou ciência de dados com foco na construção de pipelines para aplicações de IA/ML.
- Proficiência em Python, com experiência em bibliotecas de manipulação de dados como Pandas, NumPy e utilitários de dados do PyTorch.
- Experiência prática com bibliotecas e ferramentas de processamento de áudio (por exemplo, Librosa, FFmpeg, SoX) para lidar com formatos de áudio complexos.
- Familiaridade com ferramentas de pipeline escaláveis como GitLab, Apache Spark, Airflow ou Luigi, e experiência com fluxos de trabalho conteinerizados (Docker, Kubernetes).
- Sólida compreensão dos requisitos de pipeline de dados para treinamento, retreinamento e avaliação de modelos em fluxos de trabalho de pesquisa iterativos.
- Experiência com formatos de áudio imersivo e multicanal.
- Conhecimento de plataformas e ferramentas baseadas em nuvem para armazenamento e processamento, como AWS S3, Redshift ou Google BigQuery.
- Fortes habilidades de resolução de problemas, com uma mentalidade proativa para lidar com desafios de dados em evolução.
Qualificações Preferenciais
- Experiência na integração de pipelines de dados com fluxos de trabalho de IA/ML, incluindo aprendizado ativo e retreinamento de modelos.
- Familiaridade com conjuntos de dados específicos de áudio e estratégias de gerenciamento de metadados.
- Conhecimento dos princípios de machine learning e como a qualidade dos dados impacta o desempenho do modelo.
- Experiência com pipelines de treinamento distribuído e processamento de conjuntos de dados em larga escala.
- Contribuições para projetos de código aberto ou pesquisas publicadas nas áreas de ciência de dados ou processamento de áudio.
- Experiência com ferramentas de visualização (por exemplo, Tableau, Matplotlib) para garantia de qualidade e análise exploratória de dados.
- Expertise no projeto de sistemas para apoiar o monitoramento e retreinamento de modelos de IA/ML ao longo do tempo.
A faixa salarial para esta posição em Nicasio, CA é de $170,500 a $228,600 por ano. O salário base efetivamente oferecido levará em conta a equidade interna e também pode variar dependendo da região geográfica do candidato, conhecimentos relacionados ao cargo, habilidades e experiência, entre outros fatores. Um bônus e/ou unidades de incentivo de longo prazo podem ser fornecidos como parte do pacote de remuneração, além da gama completa de benefícios médicos, financeiros e/ou outros, dependendo do nível e cargo oferecido.
