ComTec Solutions LLC
Futurex
Gerente Sênior, Engenharia de Confiabilidade de Sites - Infraestrutura de Nuvem
Sobre a Futurex
A Futurex é líder sediada no Texas em módulos de segurança de hardware (HSMs), gerenciamento de chaves corporativas e proteção de dados, confiável por instituições financeiras globais, processadores de pagamento e provedores de nuvem há mais de quatro décadas. A Infraestrutura de Nuvem da Futurex oferece serviços seguros e altamente disponíveis para clientes em todo o mundo.
Visão geral da função
O Gerente Sênior, Engenharia de Confiabilidade de Sites – Infraestrutura de Nuvem é o responsável pela disponibilidade, segurança e excelência operacional da Infraestrutura de Nuvem da Futurex em todo o mundo. Você liderará uma equipe globalmente distribuída de SRE que gerencia a infraestrutura de produção em várias regiões, provedores de nuvem e data centers.
Esta função está na intersecção de operações de nuvem, segurança e conformidade. Nossos clientes dependem de serviços que não podem falhar, portanto, a confiabilidade aqui é medida tanto pela confiança do cliente quanto pelo tempo de atividade.
Você se reportará à liderança executiva e fará uma parceria próxima com Engenharia, Produto, Segurança, Conformidade e Suporte ao Cliente.
Cultura corporativa acolhedora, estilo familiar, ideal para indivíduos dinâmicos, empreendedores e motivados
Um dos "Melhores Lugares para Trabalhar" de San Antonio por nove anos consecutivos
Principais responsabilidades
Liderança de equipe
- Liderar, contratar e desenvolver uma equipe global de SRE em vários fusos horários, com propriedade clara e cobertura "follow-the-sun".
- Ser o responsável pelo programa global de plantão (on-call), incluindo o design da rotação, padrões de tempo de resposta, caminhos de escalonamento e cobertura em todas as regiões.
- Responsabilizar a equipe pela resposta a incidentes, acompanhamento de remediação e adesão aos padrões operacionais.
- Definir o roteiro de SRE, plano de pessoal e orçamento operacional.
Confiabilidade e níveis de serviço
- Definir e ser o responsável por SLIs, SLOs e orçamentos de erro para serviços de Infraestrutura de Nuvem, e usá-los para equilibrar estabilidade contra velocidade de lançamento.
- Fazer parceria com Vendas e Jurídico para que os compromissos de SLA do cliente sejam consistentemente cumpridos.
- Rastrear a conformidade com o SLA e o consumo do orçamento de erro em todos os serviços.
Relatórios operacionais
- Entregar relatórios regulares à liderança executiva sobre tempo de atividade, desempenho de SLA, tendências de incidentes e métricas de plantão, como tempos de resposta e volume de escalonamento.
- Manter painéis (dashboards) que forneçam à liderança e aos stakeholders visibilidade em tempo real da saúde do serviço.
- Produzir relatórios de incidentes voltados para o cliente e análises de causa raiz para eventos significativos.
Gerenciamento de incidentes
- Ser o responsável pelo processo de resposta a incidentes, incluindo definições de severidade, caminhos de escalonamento e comunicações com o cliente.
- Liderar postmortems e impulsionar itens de remediação para fechamento.
- Atuar como o ponto de escalonamento sênior durante incidentes importantes.
Infraestrutura e operações
- Revisar padrões de monitoramento, observabilidade e alerta.
- Manter e testar regularmente planos de recuperação de desastres e continuidade de negócios contra alvos definidos de RTO e RPO.
Segurança e conformidade
- Operar dentro dos controles exigidos por frameworks de segurança e conformidade da indústria.
- Supervisionar procedimentos operacionais seguros, incluindo controle duplo e cadeia de custódia, quando necessário.
- Aplicar isolamento estrito de tenant, princípio do menor privilégio de acesso e gerenciamento de mudanças.
- Apoiar auditorias internas e externas com evidências operacionais precisas.
Qualificações exigidas
- 10+ anos em funções de SRE, DevOps ou infraestrutura de produção, incluindo 5+ anos gerenciando equipes de engenharia.
- Experiência liderando equipes geograficamente distribuídas em vários fusos horários.
- Propriedade comprovada de uma plataforma de nuvem ou SaaS de produção com SLAs contratuais e operações 24x7.
- Profundidade prática em pelo menos um grande provedor de nuvem (AWS, GCP ou Azure), com conhecimento prático dos outros.
- Forte experiência em Linux, redes, infraestrutura como código (Terraform ou similar) e CI/CD.
- Experiência operando sob frameworks de conformidade como PCI DSS, SOC 2 ou ISO 27001.
- Um histórico de construção de programas de gerenciamento de incidentes, observabilidade e DR.
- Comunicação escrita e verbal clara com executivos, clientes e auditores.
- Bacharelado em Ciência da Computação, Engenharia ou experiência equivalente.
Qualificações preferenciais
- Experiência operando infraestrutura criptográfica ou sensível à segurança.
- Familiaridade com padrões de certificação de segurança como FIPS 140.
- Experiência operando ambientes híbridos que combinam nuvem pública com hardware de data center físico.
- Experiência liderando migrações de data center ou expansões regionais.
- Experiência em serviços financeiros ou outra indústria altamente regulamentada.
- Seguro de saúde, odontológico, oftalmológico, de vida e contra invalidez de curto/longo prazo
- Férias remuneradas, feriados e licença médica
- Remuneração competitiva e oportunidades de crescimento
- Plano de aposentadoria com contrapartida do empregador
