ComTec Solutions LLC
Futurex
Senior Manager, Site Reliability Engineering - Cloud Infrastructure
Acerca de Futurex
Futurex es un líder con sede en Texas en módulos de seguridad de hardware (HSM), gestión de claves empresariales y protección de datos, en el que confían instituciones financieras globales, procesadores de pagos y proveedores de nube durante más de cuatro décadas. Futurex Cloud Infrastructure ofrece servicios seguros y de alta disponibilidad a clientes de todo el mundo.
Descripción general del puesto
El Senior Manager, Site Reliability Engineering – Cloud Infrastructure es responsable de la disponibilidad, seguridad y excelencia operativa de Futurex Cloud Infrastructure a nivel mundial. Liderará un equipo global distribuido de SRE que gestiona la infraestructura de producción en múltiples regiones, proveedores de nube y centros de datos.
Este puesto se encuentra en la intersección de operaciones en la nube, seguridad y cumplimiento. Nuestros clientes dependen de servicios que no pueden fallar, por lo que la fiabilidad aquí se mide tanto por la confianza del cliente como por el tiempo de actividad.
Reportará a la alta dirección y colaborará estrechamente con Ingeniería, Producto, Seguridad, Cumplimiento y Atención al Cliente.
Cultura corporativa acogedora, de estilo familiar, especialmente adecuada para personas dinámicas, emprendedoras y motivadas.
Uno de los "Mejores Lugares para Trabajar" de San Antonio durante nueve años consecutivos.
Responsabilidades clave
Liderazgo de equipo
- Liderar, contratar y desarrollar un equipo global de SRE en múltiples zonas horarias, con una propiedad clara y cobertura "follow-the-sun".
- Ser responsable del programa global de guardias (on-call), incluyendo el diseño de rotaciones, estándares de tiempo de respuesta, rutas de escalada y cobertura en todas las regiones.
- Hacer que el equipo rinda cuentas en la respuesta a incidentes, el seguimiento de la remediación y el cumplimiento de los estándares operativos.
- Establecer la hoja de ruta de SRE, el plan de personal y el presupuesto operativo.
Fiabilidad y niveles de servicio
- Definir y ser responsable de los SLI, SLO y presupuestos de errores para los servicios de Cloud Infrastructure, y utilizarlos para equilibrar la estabilidad frente a la velocidad de lanzamiento.
- Colaborar con Ventas y Legal para garantizar que los compromisos de SLA con los clientes se cumplan de forma consistente.
- Realizar un seguimiento del cumplimiento de los SLA y del consumo del presupuesto de errores en todos los servicios.
Informes operativos
- Entregar informes periódicos a la alta dirección sobre el tiempo de actividad, el rendimiento de los SLA, las tendencias de incidentes y las métricas de guardias (on-call), como los tiempos de respuesta y el volumen de escalada.
- Mantener paneles que proporcionen a la dirección y a las partes interesadas visibilidad en tiempo real del estado del servicio.
- Producir informes de incidentes dirigidos a clientes y análisis de causa raíz para eventos significativos.
Gestión de incidentes
- Ser responsable del proceso de respuesta a incidentes, incluyendo las definiciones de severidad, las rutas de escalada y las comunicaciones con los clientes.
- Liderar postmortems e impulsar los elementos de remediación hasta su cierre.
- Servir como punto de escalada senior durante incidentes importantes.
Infraestructura y operaciones
- Revisar los estándares de monitorización, observabilidad y alertas.
- Mantener y probar regularmente los planes de recuperación ante desastres y continuidad del negocio frente a los objetivos definidos de RTO y RPO.
Seguridad y cumplimiento
- Operar dentro de los controles requeridos por los marcos de seguridad y cumplimiento de la industria.
- Supervisar los procedimientos operativos seguros, incluyendo el doble control y la cadena de custodia cuando sea necesario.
- Aplicar un estricto aislamiento de inquilinos, acceso con privilegios mínimos y gestión de cambios.
- Apoyar auditorías internas y externas con evidencia operativa precisa.
Cualificaciones requeridas
- Más de 10 años en roles de SRE, DevOps o infraestructura de producción, incluyendo más de 5 años gestionando equipos de ingeniería.
- Experiencia liderando equipos geográficamente distribuidos en múltiples zonas horarias.
- Propiedad demostrada de una plataforma SaaS o en la nube de producción con SLAs contractuales y operaciones 24x7.
- Profundidad práctica en al menos un proveedor de nube importante (AWS, GCP o Azure), con conocimiento práctico de los demás.
- Sólida experiencia en Linux, redes, infraestructura como código (Terraform o similar) y CI/CD.
- Experiencia operando bajo marcos de cumplimiento como PCI DSS, SOC 2 o ISO 27001.
- Un historial de creación de programas de gestión de incidentes, observabilidad y recuperación ante desastres.
- Comunicación escrita y verbal clara con directivos, clientes y auditores.
- Título de Grado en Ciencias de la Computación, Ingeniería o experiencia equivalente.
Cualificaciones preferidas
- Experiencia operando infraestructura criptográfica o sensible a la seguridad.
- Familiaridad con estándares de certificación de seguridad como FIPS 140.
- Experiencia operando entornos híbridos que combinan la nube pública con hardware de centros de datos físicos.
- Experiencia liderando migraciones de centros de datos o expansiones regionales.
- Experiencia en servicios financieros u otra industria altamente regulada.
- Seguro de salud, dental, de visión, de vida y de incapacidad a corto/largo plazo
- Vacaciones pagadas, días festivos y baja por enfermedad
- Compensación competitiva y oportunidades de ascenso
- Plan de jubilación con igualación de contribución del empleador
