Backblaze External Website
MedTrainer, Inc.
Ingeniero/a Senior de DevOps, Fiabilidad y Operaciones de Plataforma
Descripción de la empresa
MedTrainer es la única plataforma de cumplimiento todo en uno diseñada específicamente para organizaciones sanitarias por profesionales sanitarios. Durante más de 13 años, hemos ayudado a los equipos sanitarios a mantenerse preparados para auditorías y seguros en su cumplimiento normativo a través de la innovación continua y una profunda experiencia en el sector.
Nuestra plataforma en la nube unifica la gestión del aprendizaje, la acreditación y el cumplimiento en un único sistema inteligente diseñado para simplificar las complejas operaciones sanitarias. Impulsada por la automatización y flujos de trabajo basados en IA, MedTrainer permite a las organizaciones incorporar personal más rápido, optimizar procesos y escalar de manera eficiente, manteniendo al mismo tiempo los más altos estándares de cumplimiento y preparación de la fuerza laboral.
Descripción del puesto
Buscamos un/a Ingeniero/a Senior de DevOps, Fiabilidad y Operaciones de Plataforma para mejorar la fiabilidad, la estabilidad operativa, la postura de riesgo y la eficacia de entrega de nuestra infraestructura en la nube, plataformas Kubernetes, flujos de trabajo de CI/CD, bases de datos, middleware y sistemas de producción.
En este puesto, trabajarás estrechamente con Ingenieros de DevOps / Ingenieros de Entrega de Software, Ingeniería de Software, Seguridad, Proveedores de Bases de Datos, Soporte, Producto y equipos de liderazgo para reducir el riesgo de producción, mejorar la observabilidad, fortalecer los estándares operativos, automatizar el trabajo repetitivo y permitir vías más seguras hacia la producción.
Proporcionarás orientación sobre diseño, soporte técnico avanzado, automatización, mejores prácticas y estándares de fiabilidad a los Ingenieros de DevOps / Ingenieros de Entrega de Software, mientras que esos equipos conservan la propiedad de la preparación y la implementación de la entrega de aplicaciones.
Este es un puesto técnico individual de nivel senior para alguien con una sólida propiedad de producción, profunda experiencia en infraestructura y plataformas, sólidas prácticas de SRE y la capacidad de identificar de forma proactiva problemas recurrentes e impulsar mejoras permanentes.
En MedTrainer, cada puesto contribuye a crear tecnología que apoya a organizaciones sanitarias más seguras y eficientes. Valoramos la colaboración, la propiedad y la mejora continua en todos los equipos.
Si te entusiasma crecer, tener un impacto y formar parte de una empresa con misión, te animamos a postularte.
Responsabilidades
- Mejorar las prácticas de ingeniería de fiabilidad en todos los sistemas de producción, incluyendo SLI, SLO, presupuestos de errores, postmortems, runbooks, indicadores de salud de servicios y seguimiento de acciones correctivas.
- Liderar mejoras de fiabilidad en plataformas en la nube, AKS, pipelines de CI/CD, entornos de aplicaciones, bases de datos y middleware de soporte.
- Operar y mejorar clústeres AKS, incluyendo actualizaciones, escalado automático, pools de nodos, redes, almacenamiento, identidad, seguridad, fiabilidad y estándares operativos.
- Proporcionar orientación, mejores prácticas y estándares para patrones de despliegue de aplicaciones de Kubernetes.
- Mejorar la fiabilidad de la entrega a través de flujos de trabajo avanzados de Acciones de GitHub, automatización reutilizable, patrones de despliegue seguros, soporte de reversión y optimización de pipelines.
- Construir automatización, capacidades de autoservicio, patrones de infraestructura reutilizables y procedimientos operativos para reducir el trabajo repetitivo, el trabajo basado en tickets, las transferencias manuales y la deriva de la infraestructura.
- Definir, implementar y mantener prácticas de Infraestructura como Código y gestión de configuración utilizando herramientas aprobadas.
- Ser propietario y mantener la gestión de configuración basada en Ansible para el sistema operativo, middleware, servicios de soporte de aplicaciones y automatización operativa.
- Soportar y mejorar entornos en la nube de Azure como plataforma principal, con experiencia en AWS y GCP preferida.
- Implementar y mejorar la observabilidad en métricas, logs, trazas, dashboards, alertas, APM, planificación de capacidad, ajuste de rendimiento y dashboards de incidentes.
- Soportar la respuesta a incidentes para problemas de fiabilidad de producción, despliegue, infraestructura, bases de datos, middleware y aplicaciones, incluyendo recomendación de severidad, coordinación de triaje, comunicación con stakeholders, soporte de mitigación, postmortems y acciones correctivas.
- Operar con conciencia y propiedad de producción, apoyando las mejoras de fiabilidad y la reducción del riesgo de producción.
- Recomendar el bloqueo, retraso o reversión de lanzamientos cuando se identifiquen riesgos de fiabilidad, seguridad, operativos o de continuidad del negocio.
- Comprender el comportamiento del monolito de PHP Symfony lo suficientemente como para soportar la fiabilidad de producción y colaborar eficazmente con los equipos de ingeniería de software.
- Operar, ajustar, monitorizar, hacer copias de seguridad, solucionar problemas y dar soporte directamente a MySQL, ProxySQL y RabbitMQ, mientras se coordina con el proveedor de bases de datos cuando sea necesario.
- Fortalecer las prácticas de seguridad y cumplimiento en la infraestructura, CI/CD y entornos de ejecución, incluyendo la gestión de secretos, control de acceso, escaneo de dependencias e imágenes, firma/procedencia, controles de seguridad de CI/CD, configuración de seguridad en la nube y soporte de auditoría.
- Mejorar las copias de seguridad, restauraciones, recuperación ante desastres, visibilidad de costes en la nube, control de costes y resiliencia operativa en sistemas críticos.
- Mentorizar a Ingenieros de DevOps / Ingenieros de Entrega de Software a través de orientación técnica, revisión de diseño, definición de estándares, intercambio de conocimientos operativos y mejores prácticas de fiabilidad.
- Producir y mantener runbooks, guías de solución de problemas, procedimientos de despliegue, estándares de fiabilidad, notas de arquitectura y artículos de base de conocimiento.
- Proponer iniciativas técnicas relacionadas con la fiabilidad, operaciones de plataforma, observabilidad, automatización, reducción de incidentes, madurez de la nube y reducción de riesgos operativos.
Cualificaciones
- Título de Grado en Informática, Ingeniería, Tecnología de la Información o experiencia profesional equivalente.
- 8+ años de experiencia en DevOps, Ingeniería de Fiabilidad de Sitios, Ingeniería de Plataformas, operaciones en la nube, automatización de infraestructuras, operaciones de producción o roles relacionados.
- Sólidas habilidades de comunicación escrita y verbal en inglés.
- Sólida experiencia operando sistemas de producción donde la fiabilidad, la observabilidad, la respuesta a incidentes, la automatización y la reducción del riesgo operativo son responsabilidades principales.
- Sólida experiencia práctica con entornos de Azure y entornos de producción de Kubernetes / AKS.
- Experiencia diseñando o mejorando CI/CD, Infraestructura como Código, gestión de configuración, observabilidad y automatización de despliegues a escala.
- Sólidas habilidades de resolución de problemas de producción en infraestructura en la nube, Linux, contenedores, Kubernetes, bases de datos, middleware, pipelines de CI/CD y servicios de soporte de aplicaciones.
- Capacidad para comprender el comportamiento de las aplicaciones y dar soporte a la fiabilidad de producción de aplicaciones de PHP Symfony.
- Experiencia operando o dando soporte a MySQL, ProxySQL y RabbitMQ en entornos de producción.
- Sólida comprensión de las prácticas de entrega segura y seguridad de infraestructuras, incluyendo gestión de secretos, mínimo privilegio, revisiones de acceso, seguridad de CI/CD y soporte de auditoría.
- Experiencia con copias de seguridad, restauración, recuperación ante desastres, continuidad del negocio, planificación de capacidad, ajuste de rendimiento y optimización de costes.
- Capacidad para mentorizar ingenieros, definir estándares técnicos, cuestionar constructivamente prácticas débiles y liderar iniciativas técnicas sin autoridad formal de gestión de personas.
- Capacidad de trabajo totalmente remoto, incluyendo comunicación escrita disciplinada, autogestión, colaboración asíncrona y participación fiable en flujos de trabajo de equipos distribuidos.
Tecnologías y/o habilidades esenciales
- Plataformas en la nube: Azure requerido; AWS y GCP preferidos.
- Kubernetes: AKS, operaciones de clúster, solución de problemas, actualizaciones, escalado automático, redes, almacenamiento, identidad, seguridad y estándares de plataforma.
- CI/CD: Acciones de GitHub, flujos de trabajo reutilizables, acciones compuestas, entornos, aprobaciones, OIDC, runners autoalojados, flujos de trabajo de reversión, artefactos, caché y controles de seguridad de pipelines.
- Infraestructura como Código: Terraform o Pulumi; Pulumi con Python preferido.
- Gestión de configuración: Ansible.
- Scripting y automatización: Python requerido; Bash preferido.
- Contenedores: Docker / OCI y hosts de Docker independientes.
- Sistemas operativos: administración y solución de problemas de Linux.
- Bases de datos y middleware: MySQL, ProxySQL, RabbitMQ.
- Observabilidad: New Relic, Logz.io, métricas de Azure, ClickStack preferido, métricas, logs, trazas, dashboards, APM, comprobaciones sintéticas y alertas basadas en SLO.
- Ingeniería de fiabilidad: SLI, SLO, presupuestos de errores, postmortems, runbooks, reducción de trabajo repetitivo, respuesta a incidentes y acciones correctivas.
- Seguridad: HashiCorp Vault, 1Password, gestión de secretos, mínimo privilegio, revisiones de acceso, escaneo de dependencias, escaneo de imágenes de contenedores, firma/procedencia y controles de seguridad de CI/CD.
- Fiabilidad de aplicaciones: contexto de soporte de producción de aplicaciones de PHP Symfony.
- Resiliencia operativa: copias de seguridad, restauración, recuperación ante desastres, continuidad del negocio, planificación de capacidad y ajuste de rendimiento.
- Documentación: runbooks, guías de solución de problemas, procedimientos operativos, estándares y artículos de base de conocimiento.
- Estilo de trabajo: resolución estructurada de problemas, fuerte sentido de la propiedad, conciencia de producción, mentoría, mentalidad de automatización y reducción proactiva de riesgos.
Información adicional
- Trabajo 100% remoto desde cualquier lugar de México.
- Salario mensual competitivo después de impuestos.
- Seguro Médico Mayor y cobertura sanitaria.
- Soporte para oficina en casa y ergonomía, incluyendo internet y electricidad.
- Oportunidades de desarrollo profesional, incluyendo clases de inglés.
- Beneficios de bienestar como descuentos en gimnasios TotalPass.
- Plan de ahorro.
- Días libres remunerados, incluyendo días personales.
- Entorno colaborativo, internacional y orientado al crecimiento.
- Oportunidad de trabajar con tecnologías modernas de nube, automatización, CI/CD, Kubernetes, fiabilidad, observabilidad y plataforma.
- Cultura de ingeniería colaborativa centrada en la automatización, la fiabilidad, la excelencia operativa y la mejora continua.
Rango salarial
Toda su información se mantendrá confidencial de acuerdo con las directrices de EEO.
$70,000—$90,000 MXN
