ISS
Luma Financial Technologies
Engenheiro de Suporte à Produção
PythonSQLAWSKubernetes
Tradução automática. Consulte o original.
Sobre a vaga
Estamos em busca de um Engenheiro de Suporte de Produção proativo e qualificado para integrar nossa equipe de operações de TI. Nesta função crítica, você será responsável por supervisionar e gerenciar incidentes relacionados aos nossos ambientes de engenharia e produção. O candidato ideal desempenhará um papel fundamental na garantia da estabilidade e confiabilidade de nossos sistemas de produção, coordenando e resolvendo incidentes de maneira ágil e eficiente, trabalhando em estreita colaboração com Engenheiros de Software, Infraestrutura e equipes de Suporte para realizar a triagem, diagnóstico e resolução de problemas técnicos em tempo real.
O que você fará
Monitoramento de Aplicações e Gestão de Incidentes
- Resposta a incidentes L2/L3: Realizar triagem, investigação e resolução de bugs em produção, interrupções de sistema e problemas que impactem o cliente, dentro dos prazos de SLA.
- Monitoramento proativo: Monitorar o desempenho de sistemas de engenharia e produção, métricas de aplicação e logs de servidor utilizando ferramentas como Datadog.
- Análise de Causa Raiz (RCA): Liderar relatórios pós-incidente e colaborar com desenvolvedores para projetar correções de longo prazo que previnam a recorrência de incidentes.
Operações Técnicas e Manutenção
- Implantações e Releases: Auxiliar em implantações blue-green, hotfixes e janelas de manutenção programadas em produção.
- Gestão de Ambientes: Manter a alta disponibilidade em ambientes de produção, staging e recuperação de desastres (DR).
- Banco de Dados e Correções de Dados: Executar com segurança consultas SQL, migrações de dados ou reconciliações manuais de registros quando necessário.
Automação e Melhoria de Processos
- Automação: Escrever scripts (Bash, Python, PowerShell) para automatizar tarefas operacionais repetitivas, análise de logs e alertas de monitoramento.
- Documentação de Runbooks: Criar, atualizar e padronizar runbooks operacionais, matrizes de escalonamento e guias de solução de problemas.
Qualificações
Requisitos
- Formação: Bacharelado em Ciência da Computação, Tecnologia da Informação ou área correlata (ou experiência prática equivalente).
- Experiência: 3+ anos em funções de Suporte de Produção, Site Reliability Engineering (SRE) ou Suporte a Aplicações.
- Sistemas Operacionais: Sólidas habilidades de linha de comando em ambientes Linux/Unix.
- Banco de Dados / SQL: Forte capacidade de escrever consultas SQL complexas, analisar consultas lentas e compreender esquemas de banco de dados (MongoDB, MySQL ou MS SQL).
- Scripting: Proficiência em pelo menos uma linguagem de script (Python, Bash, Shell ou PowerShell) para automação.
- Ferramentas de Monitoramento: Experiência prática com plataformas de agregação de logs e monitoramento (ex: Datadog).
- Protocolos e Arquitetura: Compreensão de REST APIs, arquitetura de microsserviços, fundamentos de rede (TCP/IP, DNS, status HTTP) e servidores web (Nginx, Apache).
- Soft Skills: Excelentes habilidades analíticas para solucionar falhas complexas de sistema sob pressão, além das habilidades de comunicação necessárias para traduzir ideias técnicas para stakeholders não técnicos.
- Disponibilidade de Sobreaviso: Disposição para participar de uma escala de sobreaviso rotativa (cobertura de suporte 24/7).
Diferenciais
- Experiência em Plataformas: Experiência com plataformas de nuvem (AWS ou Azure). Familiaridade com conteinerização e orquestração (Kubernetes). Experiência com sistemas de chamados como Jira. Exposição a ferramentas de CI/CD (GitHub Actions, GitLab CI).
- Exposição ao Setor: Experiência prévia em fintechs, seguradoras ou organizações de serviços financeiros em geral.
