Backblaze External Website
IPSY
Engenheiro de Confiabilidade de Site (SRE) - Contrato
SOBRE NÓS
Junte-se a nós para inspirar todos a expressar sua beleza única.
IPSY é a plataforma mais poderosa da indústria da beleza, unindo marcas, criadores e consumidores hiperengajados com acesso sem precedentes uns aos outros através da melhor assinatura de beleza. Lar da assinatura de amostras IPSY Original, da assinatura de tamanho completo IPSY Extra e da coleção trimestral de edição limitada IPSY Ultimate, nós selecionamos a beleza para milhões de membros para que eles possam brincar, explorar e expressar sua beleza única todos os dias.
Acreditamos que autodescoberta, autoexpressão e confiança são bonitas. Concorda? Então junte-se a nós! Explore carreiras e saiba mais sobre nossos valores, cultura e benefícios em todas as nossas marcas: Carreiras IPSY.
Temos orgulho de ser uma empresa com foco em trabalho remoto. Nossos membros de equipe totalmente remotos têm a chance de viver e trabalhar onde quiserem, porque acreditamos que o trabalho deve se encaixar na sua vida, não o contrário. Oferecemos atividades virtuais mensais, eventos presenciais para toda a empresa, desenvolvimento profissional e sessões de aprendizado para ajudar nossos membros de equipe a se manterem conectados, engajados e impactantes enquanto trabalham virtualmente.
Sobre a Vaga
Estamos em busca de um Site Reliability Engineer contratado para integrar nossa equipe de Foundation / SREIQ e ajudar a manter a IPSY rápida, disponível e resiliente para milhões de membros da comunidade de beleza. Você estará no centro de como detectamos, respondemos e aprendemos com incidentes, atuando em parceria com as áreas de Engenharia, Produto e toda a organização de Tecnologia para proteger os fluxos críticos dos quais nossos membros dependem diariamente.
Esta é uma função de confiabilidade prática. Você será responsável pela observabilidade e alertas no Datadog, participará de nossa rotação de plantão, atuará como um Parceiro de SRE durante incidentes, contribuirá para análises de causa raiz e automatizará implacavelmente o trabalho repetitivo de nossas operações. Somos uma equipe com foco em automação e que abraça a IA: esperamos que você utilize ferramentas modernas de IA para depurar mais rápido, redigir runbooks e RCAs, e construir automação mais inteligente.
O Engenheiro de SRE se reportará ao Gerente de Engenharia de Infraestrutura e será totalmente remoto do México ou Colômbia, cobrindo o fuso horário PST.
Remoto nos Estados Unidos: Posições remotas que podem ser realizadas em qualquer um dos estados onde a IPSY tem presença comercial estabelecida: Arizona, Califórnia, Connecticut, Flórida, Illinois, Kansas, Massachusetts, Missouri, Carolina do Norte, Nova York, Nova Jersey, Nevada, Ohio, Pensilvânia, Texas e Washington. Aviso de Privacidade da Califórnia
Cuidado com golpes de emprego! Recrutadores da IPSY usam apenas endereços de e-mail @ipsy.com. Não fazemos entrevistas por texto/mensagem/Teams. Não pedimos downloads de software (exceto Zoom) e nunca pediremos informações sensíveis (como SSN/informações bancárias). Suspeita de fraude? Denuncie às autoridades e para [email protected].
Declaração EEO: Celebramos a diversidade e somos um empregador que oferece igualdade de oportunidades. Não discriminamos com base em raça, religião, cor, origem nacional, gênero, orientação sexual, idade, estado civil, status de veterano, status de deficiência ou qualquer outra característica protegida.
Se você precisar de acomodação razoável no processo de inscrição ou emprego, entre em contato conosco.
IPSY está sediada nos EUA e para garantir a conformidade com as leis de emprego específicas do país, fazemos parceria com a DEEL, que nos auxilia no recrutamento e folha de pagamento de funcionários.
#LI-CF1 #LI-Remote
O que você fará
- Construir e manter a observabilidade em toda a nossa plataforma no Datadog: dashboards, monitores, APM, pipelines de logs e alertas significativos e com baixo ruído, vinculados ao impacto do usuário.
- Definir e rastrear SLIs, SLOs e orçamentos de erro para serviços específicos, e usá-los para impulsionar conversas sobre confiabilidade com os proprietários dos serviços.
- Participar da rotação de plantão e atuar como um Parceiro de SRE durante incidentes: triagem, classificação de prioridade (P1-P6), validação de hipóteses e suporte à resolução com orientação em situações complexas.
- Gerenciar a resposta a incidentes de acordo com nossa estrutura, cumprindo os tempos de resposta alvo (resposta P1 em ~15 minutos), e mantendo documentação clara e em tempo real do status, descobertas, decisões e próximos passos.
- Gerenciar escalonamento e alertas através do Opsgenie, e postar atualizações estruturadas nos canais do Slack de incidentes na cadência esperada.
- Garantir passagens de turno limpas e continuidade de RCA, assegurando que as notas estejam completas e a propriedade do incidente seja transferida de forma limpa entre turnos e fusos horários.
- Contribuir ativamente para revisões pós-incidente sem culpa (RCAs), identificando causas raiz e itens de ação para prevenir recorrências.
- Automatizar o trabalho repetitivo: construir scripts, ferramentas e remediação automatizada/auto-reparadora para reduzir o trabalho operacional manual e acelerar a recuperação.
- Utilizar ferramentas de IA (por exemplo, Claude, Cursor) para acelerar a depuração, gerar e manter runbooks, redigir RCAs e construir automação.
- Ajudar a melhorar a confiabilidade de nossa pilha de nuvem e de terceiros (por exemplo, AWS, Netlify, CommerceTools, Auth0, Contentful).
- Contribuir para a confiabilidade de CI/CD, segurança de implantação e práticas de infraestrutura como código.
- Manter e melhorar os runbooks de SRE e fluxos de trabalho de triagem para que toda a organização responda de forma consistente.
Requisitos mínimos
O que procuramos
- Uma ótima atitude, forte senso de responsabilidade e um desejo genuíno de aprender, testar e experimentar coisas novas.
- Uma fome natural por automação: você instintivamente procura maneiras de remover o trabalho repetitivo, criar scripts para tarefas repetitivas e escalar a si mesmo através de ferramentas.
- Conforto e curiosidade com ferramentas de IA, e um desejo de aplicá-las à depuração, documentação, RCAs e fluxos de trabalho de confiabilidade do dia a dia.
- Experiência prática com ferramentas de observabilidade e monitoramento, idealmente Datadog (dashboards, monitores, APM, logs); experiência com outras plataformas (por exemplo, Grafana, Prometheus, New Relic, CloudWatch) se traduz bem.
- Experiência em participar de plantões e resposta a incidentes, incluindo triagem, priorização, escalonamento e revisões pós-incidente.
- Compreensão prática dos fundamentos de SRE: SLIs / SLOs / orçamentos de erro, redução de trabalho repetitivo e equilíbrio entre confiabilidade e velocidade de entrega.
- Conhecimento prático de infraestrutura em nuvem (AWS preferencial) e arquiteturas modernas distribuídas / microsserviços e de gateway API.
- Habilidades de scripting e automação (por exemplo, Python, Bash ou similar); conforto em ler e raciocinar sobre código entre serviços.
- Familiaridade com pipelines de CI/CD e infraestrutura como código (por exemplo, Terraform).
- Comunicação forte e calma: capaz de participar de um canal de incidentes, fornecer atualizações de status claras e contribuir para um RCA legível.
- Uma mentalidade colaborativa e a capacidade de trabalhar efetivamente em uma equipe distribuída e em múltiplos fusos horários.
Bônus se você tiver
- Experiência operando plataformas de consumo ou e-commerce de alto tráfego, especialmente durante eventos de pico (vendas relâmpago, lançamentos de produtos).
- Experiência com Opsgenie (ou PagerDuty / similar) para alertas e escalonamento.
- Experiência com plataformas de e-commerce / assinatura como CommerceTools, e provedores de identidade como Auth0.
- Experiência com análise de produtos e monitoramento (por exemplo, Amplitude) para conectar a confiabilidade ao comportamento do usuário.
O que oferecemos
- Salário competitivo (USD)
- Férias remuneradas e flexibilidade para trabalhar em casa
