RemoteStar

Gerente Sênior de Engenharia de Confiabilidade de Site Remoto (Remoto)

PythonAWSGCPGoTerraform
Tradução automática. Consulte o original.

Descrição da vaga

A RemoteStar está buscando contratar um Gerente Sênior de Engenharia de Confiabilidade de Site para um de nossos clientes, com política de trabalho totalmente remota.

Sobre o Cliente

O cliente está construindo o marketplace B2B de diamantes. É um marketplace líder de mercado B2B de diamantes e pedras preciosas, conectando joalheiros a fornecedores de pedras preciosas. Eles têm presença em Londres, Hong Kong, Amsterdã, Mumbai e agora em Nova York em 2001.

Sobre a função

Como Gerente de SRE, você desempenhará um papel crítico em garantir a confiabilidade, escalabilidade e desempenho de nossa infraestrutura e serviços, por meio de contribuição técnica direta, além de construção e gerenciamento de equipe.

  1. Assumir total propriedade do ambiente de produção, tanto do ponto de vista técnico quanto de processos.
  1. Garantir a operação contínua e estável dos sistemas em produção e gerenciar todas as questões de suporte on-call.
  1. Projetar e operar um novo processo de rastreamento de incidentes para garantir que as causas raiz sejam encontradas e remediadas em tempo hábil pela equipe de desenvolvimento.
  1. Criar e manter ferramentas de monitoramento e automação de ponta. Impulsionar iniciativas de automação para otimizar fluxos de trabalho operacionais e melhorar a eficiência. Desenvolver e manter ferramentas, scripts e dashboards para monitorar a saúde, o desempenho e a confiabilidade do sistema.
  1. Construir uma equipe de SRE de primeira classe. Através de uma combinação de liderança pelo exemplo, coaching e mentoria, moldar a equipe que você gostaria de ter ao seu redor. Fornecer liderança e orientação para a equipe de SRE, promovendo uma cultura de colaboração, inovação e melhoria contínua.

RESPONSABILIDADES

  1. Experiência comprovada em uma função sênior ou de liderança em SRE, com um histórico sólido na construção e manutenção de infraestrutura e serviços altamente confiáveis.
  1. Experiência em gerenciamento de incidentes, incluindo resposta a incidentes, resolução e análise post-mortem.
  1. Proficiência em ferramentas de monitoramento, alerta e observabilidade como Prometheus, Grafana, ELK stack ou Datadog.
  1. Experiência com plataformas de nuvem como AWS, Azure ou GCP, incluindo ferramentas de infraestrutura como código como Terraform ou CloudFormation.
  1. Fortes habilidades de scripting e automação, com proficiência em linguagens como Python, Bash ou Go.
  1. Excelentes habilidades de comunicação e colaboração, com a capacidade de trabalhar efetivamente com equipes multifuncionais em um ambiente remoto.
  1. Capacidades de liderança demonstradas, com paixão por mentorar e desenvolver membros da equipe.

O QUE ELES OFERECEM

  • Ambiente de trabalho dinâmico em uma empresa em rápido crescimento
  • Trabalhar em um ambiente internacional
  • Trabalhar em um ambiente agradável com pouca hierarquia
  • Desafiador intelectualmente, desempenhar um papel massivo no sucesso e escalabilidade do cliente
  • Horário de trabalho flexível

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores