Orange Business
AgileEngine
Líder Técnico de Plataforma Cloud ID92209
PythonSQLAWSKubernetesTerraform
Traducción automática. Consulta el original.
¿POR QUÉ UNIRSE A NOSOTROS?
AgileEngine es una empresa Inc. 5000 que crea software galardonado para marcas Fortune 500 y startups pioneras en más de 17 industrias. Nos situamos entre los líderes en áreas como desarrollo de aplicaciones e IA/ML, y nuestra cultura centrada en las personas nos ha valido múltiples premios al Mejor Lugar para Trabajar.
Si buscas un lugar para crecer, tener un impacto y trabajar con personas que se preocupan, ¡nos encantaría conocerte!
SOBRE EL ROL
Buscamos un Líder Técnico de Plataforma Cloud para ser responsable de la fiabilidad y orquestación de una plataforma de datos empresarial en un entorno sanitario regulado.
REQUISITOS IMPRESCINDIBLES
- Más de 6 años de experiencia profesional en Ingeniería Cloud, Ingeniería de Plataformas, DevOps o Ingeniería de Fiabilidad de Sitios.
- Profunda experiencia práctica con entornos de producción AWS, incluyendo arquitectura cloud, seguridad, fundamentos de redes, gestión de accesos, monitorización, capacidad y resolución de problemas operativos.
- Experiencia avanzada con Kubernetes y Amazon EKS, incluyendo despliegue de cargas de trabajo, resolución de problemas de clúster y aplicaciones, observabilidad, escalado, actualizaciones, accesos y fiabilidad.
- Experiencia práctica operando Argo Workflows o una plataforma de orquestación comparable que soporte cargas de trabajo de datos en producción.
- Sólida experiencia con Infraestructura como Código, preferiblemente Terraform, y con configuración controlada por código fuente, CI/CD, automatización de lanzamientos y prácticas de reversión.
- Sólida experiencia diseñando y operando soluciones de observabilidad, logging, monitorización, alertas y enrutamiento de incidentes para plataformas distribuidas en producción.
- Capacidad demostrada para liderar incidentes importantes y resolución de problemas interfuncional a través de capas de infraestructura, aplicaciones, pipelines de datos y analítica.
- Experiencia operando plataformas en producción con niveles de servicio definidos, rutas de escalada, runbooks, controles de cambios, procesos de lanzamiento y responsabilidades de guardia.
- Sólido conocimiento práctico de plataformas de datos modernas, incluyendo Snowflake, data lakes basados en S3, SQL, dbt, herramientas de ingesta gestionada como Fivetran o HVR, y pipelines de datos personalizados.
- Comprensión de la calidad de los datos, frescura, linaje, evolución de esquemas, dependencias de pipelines, backfills y procedimientos de recuperación.
- Dominio de Python, Shell, Bash o lenguajes comparables para automatización y herramientas operativas.
- Capacidad para tomar decisiones bien fundamentadas de arquitectura y operativas, comunicar compensaciones, estimar trabajo, identificar riesgos y guiar a los equipos a través del cambio.
- Experiencia probada en mentorizar ingenieros, revisar trabajo técnico, delegar responsabilidades y mejorar procesos de ingeniería en un equipo distribuido.
- Sólidas habilidades de gestión de stakeholders y comunicación, incluyendo la capacidad de recopilar requisitos, explicar riesgos técnicos y presentar recomendaciones a líderes de clientes.
- Sólidas habilidades de comunicación escrita y verbal en inglés.
- Disponibilidad para trabajar dentro de la ventana de servicio de LatAm de aproximadamente 9:00 AM a 6:00 PM, hora del Este, y participar en una rotación acordada de escalada senior y guardia.
DESEABLE
- Experiencia con plataformas de observabilidad de datos como SYNQ y herramientas operativas como Splunk, PagerDuty, Opsgenie o soluciones comparables.
- Experiencia implementando alertas conscientes de dependencias, autorremediación selectiva, análisis de impacto u otras prácticas avanzadas de fiabilidad.
- Experiencia liderando un servicio gestionado, equipo de operaciones de plataforma, función de Ingeniería de Fiabilidad de Sitios o modelo de soporte "follow-the-sun".
- Experiencia en sanidad, servicios financieros u otro entorno regulado.
QUÉ HARÁS
- Ser responsable de la dirección técnica y la fiabilidad de extremo a extremo de la Plataforma de Datos gestionada a través de AWS, Amazon EKS, Kubernetes, Argo Workflows, Snowflake, S3, ingesta personalizada y Fivetran, y dependencias de Tableau.
- Liderar la transición técnica a servicios gestionados, incluyendo descubrimiento de plataforma, mapeo de dependencias, identificación de riesgos, transferencia de conocimiento, shadowing, reverse shadowing y validación de preparación por torre de plataforma.
- Establecer y evolucionar principios de arquitectura cloud, estándares de Infraestructura como Código, prácticas de CI/CD y lanzamiento, patrones de observabilidad, controles operativos y prioridades de ingeniería de plataforma.
- Proporcionar liderazgo técnico para la infraestructura AWS, operaciones de Kubernetes y EKS, Argo Workflows, automatización de despliegues, gestión de secretos y accesos, capacidad de plataforma y fiabilidad de producción.
- Traducir necesidades de negocio, servicio, seguridad y plataforma en requisitos técnicos accionables, planes de implementación y un backlog priorizado de mejora continua.
- Guiar decisiones interplataforma que involucren Snowflake, dbt, Fivetran, ingesta personalizada, operaciones de data-lake S3, orquestación de flujos de trabajo, calidad de datos y dependencias de analítica downstream.
- Liderar la resolución de problemas interplataforma complejos y la escalada L3, coordinando ingenieros cuando los incidentes abarcan infraestructura, ingesta, orquestación, Snowflake y Tableau.
- Dirigir la respuesta técnica durante incidentes importantes, incluyendo evaluación de impacto, comunicación a stakeholders, estrategia de recuperación, análisis de causa raíz, revisión post-incidente y acciones preventivas.
- Asegurar que los cambios y lanzamientos incluyan revisión técnica adecuada, análisis de dependencias, validación, planificación de reversión, trazabilidad y coordinación entre los componentes de plataforma afectados.
- Definir y monitorizar indicadores de fiabilidad como disponibilidad, éxito de ingesta, frescura de datos, fiabilidad de flujos de trabajo, resultados de despliegue, calidad de alertas, tiempo medio de restauración del servicio y patrones de incidentes recurrentes.
- Liderar mejoras en automatización, observabilidad, autorremediación, resiliencia de plataforma, seguridad de despliegue, rendimiento, seguridad, gestión de capacidad y eficiencia de costes cloud.
- Colaborar con Seguridad, Gobernanza, Analítica, IT y stakeholders de plataforma para asegurar acceso de mínimo privilegio, gestión de secretos, auditabilidad, cambios controlados y manejo adecuado de datos regulados.
- Revisar diseños técnicos y cambios de alto impacto, cuestionar supuestos, documentar compensaciones y asegurar que las soluciones sigan siendo seguras, escalables y soportables dentro del modelo operativo de servicio gestionado.
- Mentorizar a ingenieros Senior y Middle, delegar responsabilidades eficazmente, mejorar prácticas de equipo y construir capacidad técnica consistente en todo el equipo distribuido.
- Mantener la alineación entre las ventanas de cobertura de LatAm e India a través de propiedad clara, rutas de escalada, procedimientos operativos y traspasos estructurados.
- Participar en el modelo de escalada senior y guardia para incidentes críticos fuera del horario de servicio.
PERKS Y BENEFICIOS
- Crecimiento profesional: Mentoría, TechTalks y planes de crecimiento personalizados.
- Compensación competitiva: Pago basado en USD con presupuestos para educación, fitness y actividades de equipo.
- Proyectos emocionantes: Soluciones modernas con empresas Fortune 500 y empresas de productos líderes.
- Horario flexible: Horario flexible con opciones remotas y de oficina.
