CompQsoft, Inc.
The Walt Disney Company
Engenheiro(a) de Dados Staff (Áudio/ML) - Skywalker Sound
Sobre a oportunidade
Título da Vaga:
ID da Vaga: 10129825
Esta função é considerada Híbrida, o que significa que o(a) funcionário(a) trabalhará 2-3 dias presencialmente em nosso escritório em Nicasio, CA, e ocasionalmente de casa.
Segmento da Vaga: Skywalker Sound
Negócio Principal da Vaga: Skywalker Sound-Engenharia
Categoria Principal da Vaga: Engenharia de Dados
Tipo de Emprego: Tempo integral
Cidade, Estado, Região, Código Postal Principal: Nicasio, CA, EUA
Cidade, Estado, Região, Código Postal Alternativo:
Data de Publicação: 2025-09-16
Descrição da Vaga
Engenheiro(a) de Dados Staff (Áudio/ML) - Skywalker Sound
O Skywalker Sound Development Group está buscando um Engenheiro(a) de Dados experiente com foco em Áudio/ML para se especializar na criação, gerenciamento e otimização de pipelines de dados para suportar pesquisa de ponta em IA/ML. Esta é uma função crítica na preparação de conjuntos de dados de alta qualidade para o treinamento, retreinamento e avaliação de modelos de machine learning adaptados para aplicações de áudio imersivo e multicanal.
Como Engenheiro(a) de Dados (Áudio/ML), você se concentrará no desenvolvimento de pipelines robustos para processamento de conjuntos de dados de mídia complexos, permitindo que pesquisadores de IA/ML construam soluções transformadoras para processamento de fala, transferência de estilo e separação de fontes. Seu trabalho contribuirá diretamente para a criação de fluxos de trabalho inovadores de trilha sonora para produção de mídia global.
O que você fará *
- Projetar, implementar e manter pipelines de dados escaláveis e automatizados para ingestão, pré-processamento e transformação de conjuntos de dados de áudio em larga escala. *
- Garantir que os pipelines suportem fluxos de trabalho eficientes de treinamento e retreinamento de modelos, possibilitando a melhoria contínua dos modelos de IA/ML. *
- Colaborar com pesquisadores de IA/ML para definir requisitos de dados e integrar feedback para melhorar a funcionalidade do pipeline de dados. *
- Desenvolver técnicas avançadas de pré-processamento para formatos de áudio imersivo e multicanal (por exemplo, Dolby Atmos, ambisonics de alta ordem). *
- Automatizar processos de limpeza, normalização e aumento de dados para preparar conjuntos de dados para várias arquiteturas de modelos, incluindo modelos fundamentais e transformers. *
- Integrar conjuntos de dados externos e APIs, garantindo a conformidade com padrões legais e éticos de uso de dados. *
- Monitorar e otimizar o desempenho do pipeline para lidar com estruturas de dados complexas e dinâmicas efetivamente. *
- Criar ferramentas e fluxos de trabalho para anotação, rotulagem e curadoria de conjuntos de dados, incluindo o uso de métodos de aprendizado ativo. *
- Realizar análise exploratória de dados para descobrir tendências, validar a qualidade do conjunto de dados e identificar lacunas nos dados.
Requisitos mínimos
O que procuramos *
- Mestrado com preferência por Doutorado em Engenharia/Ciência de Dados, Ciência da Computação, Processamento de Sinais ou área relacionada. *
- 8+ anos de experiência em engenharia de dados ou ciência de dados com foco em construção de pipelines para aplicações de IA/ML. *
- Proficiência em Python, com experiência em bibliotecas de manipulação de dados como Pandas, NumPy e utilitários de dados do PyTorch. *
- Experiência prática com bibliotecas e ferramentas de processamento de áudio (por exemplo, Librosa, FFmpeg, SoX) para lidar com formatos de áudio complexos. *
- Familiaridade com ferramentas de pipeline escaláveis como GitLab, Apache Spark, Airflow ou Luigi, e experiência com fluxos de trabalho em contêineres (Docker, Kubernetes). *
- Forte compreensão dos requisitos de pipeline de dados para treinamento, retreinamento e avaliação de modelos em fluxos de trabalho de pesquisa iterativos. *
- Experiência com formatos de áudio imersivo e multicanal. *
- Conhecimento de plataformas e ferramentas baseadas em nuvem para armazenamento e processamento, como AWS S3, Redshift ou Google BigQuery. *
- Fortes habilidades de resolução de problemas, com uma mentalidade proativa para lidar com desafios de dados em evolução.
Qualificações Preferenciais *
- Experiência na integração de pipelines de dados com fluxos de trabalho de IA/ML, incluindo aprendizado ativo e retreinamento de modelos. *
- Familiaridade com conjuntos de dados específicos de áudio e estratégias de gerenciamento de metadados. *
- Conhecimento dos princípios de machine learning e como a qualidade dos dados impacta o desempenho do modelo. *
- Experiência com pipelines de treinamento distribuído e processamento de conjuntos de dados em larga escala. *
- Contribuições para projetos de código aberto ou pesquisas publicadas nas áreas de ciência de dados ou processamento de áudio. *
- Experiência com ferramentas de visualização (por exemplo, Tableau, Matplotlib) para garantia de qualidade e análise exploratória de dados. *
- Experiência em projetar sistemas para suportar o monitoramento e retreinamento de modelos de IA/ML ao longo do tempo.
A faixa salarial para esta posição em Nicasio, CA é de $173,100.00 a $232,100.00 por ano. O salário base efetivamente oferecido levará em consideração a equidade interna e também poderá variar dependendo da região geográfica do candidato, conhecimento, habilidades e experiência relacionados à vaga, entre outros fatores. Um bônus e/ou unidades de incentivo de longo prazo podem ser fornecidos como parte do pacote de remuneração, além de toda a gama de benefícios médicos, financeiros e/ou outros, dependendo do nível e da posição oferecida.
