Orange Business
AgileEngine
Líder Técnico de Plataforma em Nuvem ID92209
PythonSQLAWSKubernetesTerraform
Tradução automática. Consulte o original.
POR QUE SE JUNTAR A NÓS
AgileEngine é uma empresa Inc. 5000 que cria softwares premiados para marcas Fortune 500 e startups inovadoras em mais de 17 setores. Estamos entre os líderes em áreas como desenvolvimento de aplicações e IA/ML, e nossa cultura 'people-first' nos rendeu múltiplos prêmios de Melhor Lugar para Trabalhar.
Se você procura um lugar para crescer, causar impacto e trabalhar com pessoas que se importam, adoraríamos conhecer você!
SOBRE A VAGA
Estamos procurando um Líder Técnico de Plataforma em Nuvem para ser responsável pela confiabilidade e orquestração de uma plataforma de dados corporativa em um ambiente regulamentado de saúde.
REQUISITOS ESSENCIAIS
- Mais de 6 anos de experiência profissional em Engenharia de Nuvem, Engenharia de Plataforma, DevOps ou Engenharia de Confiabilidade de Sites (SRE)
- Profundo conhecimento prático em ambientes de produção AWS, incluindo arquitetura de nuvem, segurança, fundamentos de rede, gerenciamento de acesso, monitoramento, capacidade e solução de problemas operacionais.
- Experiência avançada com Kubernetes e Amazon EKS, incluindo implantação de cargas de trabalho, solução de problemas de cluster e aplicações, observabilidade, escalonamento, atualizações, acesso e confiabilidade.
- Experiência prática operando Argo Workflows ou uma plataforma de orquestração comparável que suporte cargas de trabalho de dados em produção.
- Forte experiência com Infraestrutura como Código, preferencialmente Terraform, e com configuração controlada por fonte, CI/CD, automação de releases e práticas de rollback.
- Forte experiência em projetar e operar soluções de observabilidade, logging, monitoramento, alertas e roteamento de incidentes para plataformas distribuídas em produção.
- Habilidade demonstrada em liderar incidentes importantes e solução de problemas interfuncionais em infraestrutura, aplicações, pipelines de dados e camadas de análise.
- Experiência operando plataformas em produção com níveis de serviço definidos, caminhos de escalonamento, runbooks, controles de mudança, processos de release e responsabilidades de plantão (on-call).
- Sólido conhecimento prático de plataformas de dados modernas, incluindo Snowflake, data lakes baseados em S3, SQL, dbt, ferramentas de ingestão gerenciada como Fivetran ou HVR, e pipelines de dados customizados.
- Compreensão de qualidade de dados, frescor, linhagem, evolução de schema, dependências de pipeline, backfills e procedimentos de recuperação.
- Proficiência em Python, Shell, Bash ou linguagens comparáveis para automação e ferramentas operacionais.
- Capacidade de tomar decisões bem fundamentadas de arquitetura e operação, comunicar trade-offs, estimar trabalho, identificar riscos e guiar equipes através de mudanças.
- Experiência comprovada em mentorar engenheiros, revisar trabalho técnico, delegar responsabilidades e melhorar processos de engenharia em uma equipe distribuída.
- Fortes habilidades de gerenciamento de stakeholders e comunicação, incluindo a capacidade de coletar requisitos, explicar riscos técnicos e apresentar recomendações para líderes de clientes.
- Fortes habilidades de comunicação escrita e verbal em inglês.
- Disponibilidade para trabalhar na janela de serviço da América Latina, aproximadamente das 9:00 às 18:00, Horário do Leste (ET), e participar de um rodízio de escalonamento sênior e plantão acordado.
DESEJÁVEIS
- Experiência com plataformas de observabilidade de dados como SYNQ e ferramentas operacionais como Splunk, PagerDuty, Opsgenie ou soluções comparáveis.
- Experiência implementando alertas cientes de dependências, remediação automática seletiva, análise de impacto ou outras práticas avançadas de confiabilidade.
- Experiência liderando um serviço gerenciado, equipe de operações de plataforma, função de Engenharia de Confiabilidade de Sites (SRE) ou modelo de suporte 'follow-the-sun'.
- Experiência em saúde, serviços financeiros ou outro ambiente regulamentado.
O QUE VOCÊ FARÁ
- Ser o responsável pela direção técnica e confiabilidade de ponta a ponta da Plataforma de Dados gerenciada em AWS, Amazon EKS, Kubernetes, Argo Workflows, Snowflake, S3, Fivetran e pipelines de ingestão customizados, e dependências de Tableau.
- Liderar a transição técnica para serviços gerenciados, incluindo descoberta da plataforma, mapeamento de dependências, identificação de riscos, transferência de conhecimento, shadowing, reverse shadowing e validação de prontidão por torre da plataforma.
- Estabelecer e evoluir princípios de arquitetura de nuvem, padrões de Infraestrutura como Código, práticas de CI/CD e release, padrões de observabilidade, controles operacionais e prioridades de engenharia de plataforma.
- Fornecer liderança técnica para infraestrutura AWS, operações de Kubernetes e EKS, Argo Workflows, automação de implantação, gerenciamento de segredos e acesso, capacidade da plataforma e confiabilidade de produção.
- Traduzir necessidades de negócios, serviços, segurança e plataforma em requisitos técnicos acionáveis, planos de implementação e um backlog priorizado de melhoria contínua.
- Guiar decisões interplataformas envolvendo Snowflake, dbt, Fivetran, ingestão customizada, operações de data lake S3, orquestração de workflows, qualidade de dados e dependências de análise downstream.
- Liderar solução de problemas interplataformas complexos e escalonamento L3, coordenando engenheiros quando incidentes abrangem infraestrutura, ingestão, orquestração, Snowflake e Tableau.
- Direcionar a resposta técnica durante incidentes importantes, incluindo avaliação de impacto, comunicação com stakeholders, estratégia de recuperação, análise de causa raiz, revisão pós-incidente e ações preventivas.
- Garantir que mudanças e releases incluam revisão técnica apropriada, análise de dependências, validação, planejamento de rollback, rastreabilidade e coordenação entre os componentes de plataforma afetados.
- Definir e monitorar indicadores de confiabilidade como disponibilidade, sucesso de ingestão, frescor dos dados, confiabilidade de workflow, resultados de implantação, qualidade de alertas, tempo médio para restaurar serviço e padrões de incidentes recorrentes.
- Liderar melhorias em automação, observabilidade, remediação automática, resiliência da plataforma, segurança de implantação, desempenho, segurança, gerenciamento de capacidade e eficiência de custo na nuvem.
- Colaborar com Segurança, Governança, Análise, TI e stakeholders da plataforma para garantir acesso com privilégio mínimo, gerenciamento de segredos, auditabilidade, mudanças controladas e manuseio apropriado de dados regulamentados.
- Revisar projetos técnicos e mudanças de alto impacto, desafiar suposições, documentar trade-offs e garantir que as soluções permaneçam seguras, escaláveis e suportáveis dentro do modelo operacional de serviço gerenciado.
- Mentorar engenheiros Sênior e Pleno, delegar responsabilidades efetivamente, melhorar práticas da equipe e construir capacidade técnica consistente em toda a equipe distribuída.
- Manter o alinhamento entre as janelas de cobertura da América Latina e Índia através de responsabilidades claras, caminhos de escalonamento, procedimentos operacionais e handoffs estruturados.
- Participar do modelo de escalonamento sênior e plantão para incidentes críticos fora do horário de serviço normal.
BENEFÍCIOS E VANTAGENS
- Crescimento profissional: Mentoria, Tech Talks e roteiros de crescimento personalizados.
- Remuneração competitiva: Pagamento baseado em USD com orçamentos para educação, fitness e atividades em equipe.
- Projetos empolgantes: Soluções modernas com empresas Fortune 500 e as principais empresas de produtos.
- Horário flexível: Horário flexível com opções remotas e de escritório.
