Astreya
RemoteStar
Gerente Sênior de Engenharia de Confiabilidade de Site Remoto (Remoto)
PythonAWSGCPGoTerraform
Tradução automática. Consulte o original.
Descrição da vaga
A RemoteStar está buscando contratar um Gerente Sênior de Engenharia de Confiabilidade de Site para um de nossos clientes, com política de trabalho totalmente remota.
Sobre o Cliente
O cliente está construindo o marketplace B2B de diamantes. É um marketplace líder de mercado B2B de diamantes e pedras preciosas, conectando joalheiros a fornecedores de pedras preciosas. Eles têm presença em Londres, Hong Kong, Amsterdã, Mumbai e agora em Nova York em 2001.
Sobre a função
Como Gerente de SRE, você desempenhará um papel crítico em garantir a confiabilidade, escalabilidade e desempenho de nossa infraestrutura e serviços, por meio de contribuição técnica direta, além de construção e gerenciamento de equipe.
- Assumir total propriedade do ambiente de produção, tanto do ponto de vista técnico quanto de processos.
- Garantir a operação contínua e estável dos sistemas em produção e gerenciar todas as questões de suporte on-call.
- Projetar e operar um novo processo de rastreamento de incidentes para garantir que as causas raiz sejam encontradas e remediadas em tempo hábil pela equipe de desenvolvimento.
- Criar e manter ferramentas de monitoramento e automação de ponta. Impulsionar iniciativas de automação para otimizar fluxos de trabalho operacionais e melhorar a eficiência. Desenvolver e manter ferramentas, scripts e dashboards para monitorar a saúde, o desempenho e a confiabilidade do sistema.
- Construir uma equipe de SRE de primeira classe. Através de uma combinação de liderança pelo exemplo, coaching e mentoria, moldar a equipe que você gostaria de ter ao seu redor. Fornecer liderança e orientação para a equipe de SRE, promovendo uma cultura de colaboração, inovação e melhoria contínua.
RESPONSABILIDADES
- Experiência comprovada em uma função sênior ou de liderança em SRE, com um histórico sólido na construção e manutenção de infraestrutura e serviços altamente confiáveis.
- Experiência em gerenciamento de incidentes, incluindo resposta a incidentes, resolução e análise post-mortem.
- Proficiência em ferramentas de monitoramento, alerta e observabilidade como Prometheus, Grafana, ELK stack ou Datadog.
- Experiência com plataformas de nuvem como AWS, Azure ou GCP, incluindo ferramentas de infraestrutura como código como Terraform ou CloudFormation.
- Fortes habilidades de scripting e automação, com proficiência em linguagens como Python, Bash ou Go.
- Excelentes habilidades de comunicação e colaboração, com a capacidade de trabalhar efetivamente com equipes multifuncionais em um ambiente remoto.
- Capacidades de liderança demonstradas, com paixão por mentorar e desenvolver membros da equipe.
O QUE ELES OFERECEM
- Ambiente de trabalho dinâmico em uma empresa em rápido crescimento
- Trabalhar em um ambiente internacional
- Trabalhar em um ambiente agradável com pouca hierarquia
- Desafiador intelectualmente, desempenhar um papel massivo no sucesso e escalabilidade do cliente
- Horário de trabalho flexível
