StrideCare
The Walt Disney Company
Staff Data Engineer (Audio/ML) - Skywalker Sound
Sobre la oportunidad
Título de la oferta de empleo:
ID de solicitud: 10129825
Este puesto se considera Híbrido, lo que significa que el empleado trabajará 2-3 días en nuestras oficinas de Nicasio, CA y ocasionalmente desde casa.
Segmento de la oferta de empleo: Skywalker Sound
Negocio Principal de la Oferta de Empleo: Skywalker Sound-Engineering
Categoría Principal de la Oferta de Empleo: Ingeniería de Datos
Tipo de Empleo: Tiempo completo
Ciudad, Estado, Región y Código Postal Principales: Nicasio, CA, USA
Ciudad, Estado, Región y Código Postal Alternativos:
Fecha de Publicación: 2025-09-16
Descripción del puesto
Staff Data Engineer (Audio/ML) - Skywalker Sound
El Grupo de Desarrollo de Skywalker Sound busca un Ingeniero de Datos experimentado con enfoque en Audio/ML para especializarse en la creación, gestión y optimización de pipelines de datos que soporten investigación de vanguardia en IA/ML. Este es un rol crítico en la preparación de conjuntos de datos de alta calidad para el entrenamiento, reentrenamiento y evaluación de modelos de machine learning adaptados a aplicaciones de audio inmersivo y multicanal.
Como Ingeniero de Datos (Audio/ML), te centrarás en desarrollar pipelines robustos para el procesamiento de conjuntos de datos multimedia complejos, permitiendo a los investigadores de IA/ML construir soluciones transformadoras para el procesamiento del habla, la transferencia de estilo y la separación de fuentes. Tu trabajo contribuirá directamente a la creación de flujos de trabajo de bandas sonoras innovadoras para la producción multimedia global.
Tus Responsabilidades *
- Diseñar, implementar y mantener pipelines de datos escalables y automatizados para la ingesta, preprocesamiento y transformación de conjuntos de datos de audio a gran escala. *
- Asegurar que los pipelines soporten flujos de trabajo eficientes de entrenamiento y reentrenamiento de modelos, permitiendo la mejora continua de los modelos de IA/ML. *
- Colaborar con investigadores de IA/ML para definir requisitos de datos e integrar feedback para mejorar la funcionalidad del pipeline de datos. *
- Desarrollar técnicas avanzadas de preprocesamiento para formatos de audio inmersivo y multicanal (por ejemplo, Dolby Atmos, ambisonics de orden superior). *
- Automatizar procesos de limpieza, normalización y aumento de datos para preparar conjuntos de datos para diversas arquitecturas de modelos, incluyendo modelos fundacionales y transformers. *
- Integrar conjuntos de datos externos y APIs asegurando el cumplimiento de los estándares legales y éticos de uso de datos. *
- Monitorizar y optimizar el rendimiento del pipeline para manejar estructuras de datos complejas y dinámicas de manera efectiva. *
- Crear herramientas y flujos de trabajo para la anotación, etiquetado y curación de conjuntos de datos, incluyendo el uso de métodos de aprendizaje activo. *
- Realizar análisis exploratorios de datos para descubrir tendencias, validar la calidad del conjunto de datos e identificar lagunas de datos.
Requisitos mínimos
Lo Que Buscamos *
- Máster con preferencia por Doctorado en Ingeniería/Ciencia de Datos, Informática, Procesamiento de Señales o un campo relacionado. *
- 8+ años de experiencia en ingeniería de datos o ciencia de datos con enfoque en la construcción de pipelines para aplicaciones de IA/ML. *
- Dominio de Python, con experiencia en bibliotecas de manipulación de datos como Pandas, NumPy y utilidades de datos de PyTorch. *
- Experiencia práctica con bibliotecas y herramientas de procesamiento de audio (por ejemplo, Librosa, FFmpeg, SoX) para manejar formatos de audio complejos. *
- Familiaridad con herramientas de pipelines escalables como GitLab, Apache Spark, Airflow o Luigi, y experiencia con flujos de trabajo contenerizados (Docker, Kubernetes). *
- Sólida comprensión de los requisitos de los pipelines de datos para el entrenamiento, reentrenamiento y evaluación de modelos en flujos de trabajo de investigación iterativos. *
- Experiencia con formatos de audio inmersivo y multicanal. *
- Conocimiento de plataformas y herramientas basadas en la nube para almacenamiento y procesamiento, como AWS S3, Redshift o Google BigQuery. *
- Sólidas habilidades para la resolución de problemas, con una mentalidad proactiva para abordar desafíos de datos en evolución.
Cualificaciones Preferidas *
- Experiencia en la integración de pipelines de datos con flujos de trabajo de IA/ML, incluyendo aprendizaje activo y reentrenamiento de modelos. *
- Familiaridad con conjuntos de datos específicos de audio y estrategias de gestión de metadatos. *
- Conocimiento de los principios de machine learning y cómo la calidad de los datos impacta el rendimiento del modelo. *
- Experiencia con pipelines de entrenamiento distribuido y procesamiento de conjuntos de datos a gran escala. *
- Contribuciones a proyectos de código abierto o investigación publicada en los campos de la ciencia de datos o el procesamiento de audio. *
- Experiencia con herramientas de visualización (por ejemplo, Tableau, Matplotlib) para aseguramiento de la calidad y análisis exploratorio de datos. *
- Experiencia en el diseño de sistemas para soportar la monitorización y el reentrenamiento de modelos de IA/ML a lo largo del tiempo.
El rango de contratación para este puesto en Nicasio, CA es de $173,100.00 a $232,100.00 anuales. La remuneración base ofrecida tendrá en cuenta la equidad interna y también puede variar según la región geográfica del candidato, el conocimiento, habilidades y experiencia relacionados con el puesto, entre otros factores. Se puede ofrecer un bono y/o unidades de incentivos a largo plazo como parte del paquete de compensación, además de la gama completa de beneficios médicos, financieros y/o de otro tipo, dependiendo del nivel y puesto ofrecido.
