Futurex

Senior Manager, Site Reliability Engineering - Cloud Infrastructure

AWSGCPGoTerraform
Traducción automática. Consulta el original.

Acerca de Futurex

Futurex es un líder con sede en Texas en módulos de seguridad de hardware (HSM), gestión de claves empresariales y protección de datos, en el que confían instituciones financieras globales, procesadores de pagos y proveedores de nube durante más de cuatro décadas. Futurex Cloud Infrastructure ofrece servicios seguros y de alta disponibilidad a clientes de todo el mundo.

Descripción general del puesto

El Senior Manager, Site Reliability Engineering – Cloud Infrastructure es responsable de la disponibilidad, seguridad y excelencia operativa de Futurex Cloud Infrastructure a nivel mundial. Liderará un equipo global distribuido de SRE que gestiona la infraestructura de producción en múltiples regiones, proveedores de nube y centros de datos.

Este puesto se encuentra en la intersección de operaciones en la nube, seguridad y cumplimiento. Nuestros clientes dependen de servicios que no pueden fallar, por lo que la fiabilidad aquí se mide tanto por la confianza del cliente como por el tiempo de actividad.

Reportará a la alta dirección y colaborará estrechamente con Ingeniería, Producto, Seguridad, Cumplimiento y Atención al Cliente.

Cultura corporativa acogedora, de estilo familiar, especialmente adecuada para personas dinámicas, emprendedoras y motivadas.

Uno de los "Mejores Lugares para Trabajar" de San Antonio durante nueve años consecutivos.

Responsabilidades clave

Liderazgo de equipo

  1. Liderar, contratar y desarrollar un equipo global de SRE en múltiples zonas horarias, con una propiedad clara y cobertura "follow-the-sun".
  1. Ser responsable del programa global de guardias (on-call), incluyendo el diseño de rotaciones, estándares de tiempo de respuesta, rutas de escalada y cobertura en todas las regiones.
  1. Hacer que el equipo rinda cuentas en la respuesta a incidentes, el seguimiento de la remediación y el cumplimiento de los estándares operativos.
  1. Establecer la hoja de ruta de SRE, el plan de personal y el presupuesto operativo.

Fiabilidad y niveles de servicio

  1. Definir y ser responsable de los SLI, SLO y presupuestos de errores para los servicios de Cloud Infrastructure, y utilizarlos para equilibrar la estabilidad frente a la velocidad de lanzamiento.
  1. Colaborar con Ventas y Legal para garantizar que los compromisos de SLA con los clientes se cumplan de forma consistente.
  1. Realizar un seguimiento del cumplimiento de los SLA y del consumo del presupuesto de errores en todos los servicios.

Informes operativos

  1. Entregar informes periódicos a la alta dirección sobre el tiempo de actividad, el rendimiento de los SLA, las tendencias de incidentes y las métricas de guardias (on-call), como los tiempos de respuesta y el volumen de escalada.
  1. Mantener paneles que proporcionen a la dirección y a las partes interesadas visibilidad en tiempo real del estado del servicio.
  1. Producir informes de incidentes dirigidos a clientes y análisis de causa raíz para eventos significativos.

Gestión de incidentes

  1. Ser responsable del proceso de respuesta a incidentes, incluyendo las definiciones de severidad, las rutas de escalada y las comunicaciones con los clientes.
  1. Liderar postmortems e impulsar los elementos de remediación hasta su cierre.
  1. Servir como punto de escalada senior durante incidentes importantes.

Infraestructura y operaciones

  1. Revisar los estándares de monitorización, observabilidad y alertas.
  1. Mantener y probar regularmente los planes de recuperación ante desastres y continuidad del negocio frente a los objetivos definidos de RTO y RPO.

Seguridad y cumplimiento

  1. Operar dentro de los controles requeridos por los marcos de seguridad y cumplimiento de la industria.
  1. Supervisar los procedimientos operativos seguros, incluyendo el doble control y la cadena de custodia cuando sea necesario.
  1. Aplicar un estricto aislamiento de inquilinos, acceso con privilegios mínimos y gestión de cambios.
  1. Apoyar auditorías internas y externas con evidencia operativa precisa.

Cualificaciones requeridas

  1. Más de 10 años en roles de SRE, DevOps o infraestructura de producción, incluyendo más de 5 años gestionando equipos de ingeniería.
  1. Experiencia liderando equipos geográficamente distribuidos en múltiples zonas horarias.
  1. Propiedad demostrada de una plataforma SaaS o en la nube de producción con SLAs contractuales y operaciones 24x7.
  1. Profundidad práctica en al menos un proveedor de nube importante (AWS, GCP o Azure), con conocimiento práctico de los demás.
  1. Sólida experiencia en Linux, redes, infraestructura como código (Terraform o similar) y CI/CD.
  1. Experiencia operando bajo marcos de cumplimiento como PCI DSS, SOC 2 o ISO 27001.
  1. Un historial de creación de programas de gestión de incidentes, observabilidad y recuperación ante desastres.
  1. Comunicación escrita y verbal clara con directivos, clientes y auditores.
  1. Título de Grado en Ciencias de la Computación, Ingeniería o experiencia equivalente.

Cualificaciones preferidas

  1. Experiencia operando infraestructura criptográfica o sensible a la seguridad.
  1. Familiaridad con estándares de certificación de seguridad como FIPS 140.
  1. Experiencia operando entornos híbridos que combinan la nube pública con hardware de centros de datos físicos.
  1. Experiencia liderando migraciones de centros de datos o expansiones regionales.
  1. Experiencia en servicios financieros u otra industria altamente regulada.
  • Seguro de salud, dental, de visión, de vida y de incapacidad a corto/largo plazo
  • Vacaciones pagadas, días festivos y baja por enfermedad
  • Compensación competitiva y oportunidades de ascenso
  • Plan de jubilación con igualación de contribución del empleador

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores