Vosker
EQ Bank | Canada's Challenger Bank
Ingeniero/a Sénior de Operaciones de Plataforma de IA
Propósito del puesto
El/la Ingeniero/a Sénior de Operaciones de Plataforma de IA es responsable de la fiabilidad, operabilidad y habilitación controlada de la plataforma de IA de la organización. Este puesto garantiza que los servicios y soluciones de la Plataforma de IA estén listos para producción, sean seguros, observables y cumplan con las normativas, mediante la ejecución de prácticas operativas disciplinadas, en la gestión de la plataforma, monitorización, coordinación de incidentes y aplicación de controles de gobernanza.
El/la titular desempeña un papel clave en la habilitación de la adopción segura y escalable de la IA, asegurando que las soluciones de IA se implementen, monitoricen, soporten y mejoren continuamente de acuerdo con los estándares empresariales de fiabilidad, seguridad y cumplimiento.
Actividades Principales
Fiabilidad y Operaciones de la Plataforma de IA
- Administrar y operar la plataforma de IA para garantizar la disponibilidad, el rendimiento y la resiliencia en todos los entornos, integraciones e infraestructuras de soporte.
- Monitorizar el estado de la plataforma utilizando paneles, registros, métricas y alertas, y coordinar las actividades de incidentes y restauración de servicios.
- Liderar el triaje operativo, la coordinación de escaladas y las revisiones post-incidente para fortalecer la estabilidad y resiliencia de los servicios.
- Realizar un seguimiento y reportar los indicadores de fiabilidad del servicio, las tendencias de incidentes y el rendimiento operativo.
Habilitación de la Plataforma de IA y Preparación para Producción
- Habilitar casos de uso de IA aprobados para producción asegurando:
- o Preparación del entorno,
- o Validación de dependencias,
- o Cumplimentación de listas de verificación de preparación operativa,
- o Actividades estructuradas de transición de servicios
- Dar soporte a la gestión del ciclo de vida de la plataforma mediante:
- o Coordinación de lanzamientos,
- o Validación de preparación para cambios,
- o Planificación de mantenimiento y capacidad.
- Asegurar que los cambios en la plataforma de IA cumplan los criterios definidos de preparación operativa y de control antes de su lanzamiento.
Observabilidad, Automatización y AI Ops
- Implementar y mantener capacidades de observabilidad, incluyendo telemetría, registro, métricas y trazas necesarias para las operaciones empresariales de IA.
- Analizar datos operativos para identificar anomalías, problemas recurrentes y patrones de causa raíz.
- Implementar casos de uso de AI Ops como:
- o Correlación de alertas,
- o Detección de anomalías,
- o Soporte de causa raíz,
- o Predicción y perspectivas predictivas,
- o Automatización de tareas operativas repetitivas.
- Mejorar continuamente la eficiencia operativa a través de la automatización específica y la optimización de procesos.
Ejecución de Gobernanza, Riesgo y Control
- Ejecutar controles de gobernanza para soluciones de IA, incluyendo:
- o Controles de uso y acceso,
- o Consideraciones de privacidad de datos,
- o Auditabilidad y trazabilidad,
- o Requisitos de supervisión humana
- Asegurar que las prácticas operativas se alineen con las políticas de seguridad empresariales, los controles de riesgo y los requisitos de cumplimiento.
- Mantener la documentación y la evidencia requeridas para auditorías, revisiones de gobernanza, puntos de control de preparación para producción y validación de controles.
- Identificar lagunas de control y escalar riesgos adecuadamente a los interesados relevantes en gobernanza y riesgo.
Visibilidad de Activos de IA e Integridad Operacional
- Mantener la visibilidad operativa de los activos de la plataforma de IA necesarios para la monitorización, el soporte y la alineación de costes.
- Validar la propiedad de los activos, las relaciones y el estado del ciclo de vida en colaboración con los propietarios de aplicaciones y plataformas.
- Dar soporte a auditorías continuas para asegurar que los activos de IA y la atribución de costes asociada sigan siendo precisos y actuales.
Requisitos de Conocimientos/Habilidades
- Título universitario en Informática, Ingeniería, Tecnología de la Información o un campo relacionado, o experiencia práctica equivalente.
- 5-7 años de experiencia en operaciones de plataforma, ingeniería de fiabilidad de sitios, DevOps, operaciones en la nube u operaciones de TI empresariales.
- Sólida experiencia en el soporte de plataformas y servicios de producción, incluyendo monitorización, respuesta a incidentes, gestión de problemas, restauración de servicios e informes operativos.
Experiencia Técnica
- Experiencia con plataformas en la nube, observabilidad, automatización, gestión de configuración y patrones de integración, incluyendo runbooks de Azure Automation (PowerShell/Python), Azure AI, integraciones de Copilot, AKS, redes virtuales (hub-and-spoke) y App Service.
- Experiencia con herramientas de observabilidad como Azure Monitor, Application Insights y Grafana.
- Sólida experiencia en la administración de Microsoft Power Platform (Power Apps, Power Automate, Dataverse), incluyendo gestión de entornos, roles de seguridad y despliegues de soluciones.
- Administración práctica de Copilot Studio, incluyendo gestión del ciclo de vida del agente, publicación, monitorización, análisis, fuentes de conocimiento y controles de gobernanza. Dominio de Microsoft 365 Admin Center, gestión de usuarios y licencias, RBAC, grupos de Entra ID y administración de inquilinos.
- Experiencia en la implementación de políticas de seguridad, cumplimiento y DLP, siguiendo principios de acceso de mínimo privilegio y estándares de gobernanza operativa.
- Capacidad para monitorizar el estado de la plataforma, gestionar incidentes, optimizar el consumo de licencias y créditos de Copilot, y dar soporte a operaciones de producción en un entorno empresarial.
- Conocimiento de herramientas de gestión de configuración e infraestructura como código (IaC) como Bicep, Terraform, Azure Policy, Key Vault y tecnologías de código abierto relevantes.
- Conocimiento de tecnologías de integración y basadas en eventos como API Management, herramientas de API de código abierto, Service Bus, Event Grid y Apache Kafka.
- Conocimiento práctico de servicios de datos y búsqueda que soportan la plataforma, como Elastic, Azure AI Search y Cosmos DB.
Capacidades Adicionales
- Conocimiento práctico de conceptos operativos de IA/ML, incluyendo soporte del ciclo de vida del modelo, telemetría, controles de gobernanza, prácticas de "human-in-the-loop" y monitorización en producción.
- Sólida comprensión de los procesos ITIL/ITSM, incluyendo prácticas de gestión de cambios, lanzamientos, incidentes, problemas, configuración e informes de servicio.
- Pensador analítico y estructurado con sólidas habilidades de resolución de problemas, análisis de causa raíz, priorización y mejora continua.
- Fuerte orientación al servicio, madurez profesional y capacidad para colaborar eficazmente con equipos de operaciones, ingeniería, seguridad, riesgo, datos y negocio.
- Experiencia en la creación de documentación técnica, procedimientos operativos, manuales de soporte, paneles y materiales de orientación al usuario.
- Conocimiento de consideraciones de seguridad, privacidad, auditoría y cumplimiento relevantes para la IA empresarial y las operaciones de plataforma.
- Conocimiento de redes empresariales, seguridad perimetral y plataformas internas relacionadas como DNA, Fortinet y Akamai es una ventaja.
Complejidades del Puesto / Desafíos de Pensamiento
- Este puesto requiere equilibrar la fiabilidad de la plataforma, la eficiencia operativa y la disciplina de gobernanza en un entorno de IA en rápida evolución.
