Launch Legends
Avride
Ingeniero/a de Software – Plataforma ML
SOBRE EL EQUIPO
El equipo de Plataforma ML en Avride construye la infraestructura que potencia el entrenamiento de ML y el procesamiento de datos a gran escala para la conducción autónoma. Nos situamos entre la Plataforma Cloud y los ingenieros de ML, convirtiendo primitivas de cómputo, almacenamiento y red de bajo nivel en una plataforma de ML que los equipos realmente utilizan: orquestación escalable, cómputo distribuido y herramientas de nivel de producción para el ciclo de vida completo del modelo.
SOBRE EL PUESTO
Como Ingeniero/a de Plataforma ML en Avride, serás responsable de piezas críticas de la pila de ML: orquestación de flujos de trabajo, ejecución distribuida, gobernanza de recursos, rendimiento. Darás forma a cómo los equipos de ML de toda la empresa ejecutan experimentos y entrenan modelos a escala. Construirás las abstracciones y servicios que hacen que las cargas de trabajo de entrenamiento sean fiables, eficientes en costes y rápidas, ayudando a los equipos de ML a operar a escala en Kubernetes con una gran fiabilidad y una excelente experiencia de desarrollador.
QUÉ HARÁS
- Construir y escalar nuestra plataforma de cómputo ML en Kubernetes, utilizando Argo Workflows para la orquestación de entrenamiento, evaluación y procesamiento de datos
- Diseñar e implementar capacidades centrales de la plataforma, incluyendo un SDK interno basado en Ray para la ejecución distribuida, y gobernanza de recursos multi-inquilino — planificación, prioridades, cuotas y aplicación de políticas en GPU, CPU, memoria y IO
- Mejorar el rendimiento del entrenamiento de extremo a extremo y la eficiencia de la plataforma optimizando patrones de acceso a datos, caché y eliminando cuellos de botella en el almacenamiento, la red y la contención de recursos
- Trabajar directamente con equipos de ML para depurar problemas complejos de cargas de trabajo, impulsar el análisis de causa raíz y convertir problemas recurrentes en soluciones a nivel de plataforma
- Evaluar, integrar y extender herramientas de código abierto (ecosistema Argo Workflows, Ray, Kubernetes) para satisfacer las necesidades cambiantes de la plataforma
QUÉ NECESITARÁS
- Sólida competencia en Python o Go; C++ es un plus
- Historial de diseño y construcción de sistemas y servicios escalables y mantenibles
- Experiencia operando servicios de producción de extremo a extremo: APIs, prácticas de fiabilidad, observabilidad
- Profundo conocimiento de Kubernetes: cómo se comportan realmente la planificación, la gestión de recursos, los controladores y el ciclo de vida de los pods bajo presión
- Sólidas habilidades de depuración de sistemas y Linux: investigación de rendimiento, redes, almacenamiento/IO
- Capacidad para solucionar problemas complejos de producción a través de logs, métricas y trazas, y llevarlos a su resolución
VALORAMOS ESPECIALMENTE
- Experiencia con Argo Workflows, Ray, MLflow o herramientas comparables de ML distribuido
- Experiencia práctica en la construcción u operación de sistemas de entrenamiento de ML a gran escala: planificación de GPU, entrenamiento distribuido, pipelines de datos de entrenamiento
- Historial de optimización del uso de recursos y rendimiento en entornos distribuidos
#LI-MS1
Se requiere que los candidatos estén autorizados para trabajar en EE. UU. El empleador no ofrece reubicación, patrocinio y no hay opciones de trabajo remoto disponibles.
Avride es un empleador que ofrece igualdad de oportunidades y se compromete a proporcionar adaptaciones razonables a los solicitantes y empleados cualificados con discapacidades para garantizar que tengan igualdad de acceso a las oportunidades de empleo. Avride cumple con la Ley de Estadounidenses con Discapacidades (ADA). Si necesita una adaptación razonable para ayudarle en el proceso de solicitud o contratación, o para realizar las funciones esenciales de un puesto, envíe un correo electrónico a [email protected] [[email protected]].
