Backblaze External Website
MedTrainer, Inc.
Engenheiro(a) Sênior de DevOps, Confiabilidade e Operações de Plataforma
Descrição da Empresa
A MedTrainer é a única plataforma de conformidade tudo-em-um desenvolvida especificamente para organizações de saúde, por profissionais de saúde. Há mais de 13 anos, ajudamos equipes de saúde a permanecerem prontas para auditorias e confiantes em sua conformidade regulatória por meio de inovação contínua e profundo conhecimento do setor.
Nossa plataforma baseada em nuvem unifica o gerenciamento de aprendizado, credenciamento e conformidade em um único sistema inteligente projetado para simplificar operações complexas de saúde. Impulsionada por automação e fluxos de trabalho orientados por IA, a MedTrainer permite que as organizações integrem mais rapidamente, otimizem processos e escalem eficientemente, mantendo os mais altos padrões de conformidade e prontidão da força de trabalho.
Descrição da Vaga
Estamos procurando um(a) Engenheiro(a) Sênior de DevOps, Confiabilidade e Operações de Plataforma para melhorar a confiabilidade, estabilidade operacional, postura de risco e eficácia de entrega de nossa infraestrutura de nuvem, plataformas Kubernetes, fluxos de trabalho de CI/CD, bancos de dados, middleware e sistemas de produção.
Nesta função, você trabalhará em estreita colaboração com Engenheiros de DevOps / Engenheiros de Entrega de Software, Engenharia de Software, Segurança, provedores de banco de dados, Suporte, Produto e equipes de liderança para reduzir o risco de produção, melhorar a observabilidade, fortalecer os padrões operacionais, automatizar trabalhos repetitivos e permitir caminhos mais seguros para a produção.
Você fornecerá orientação de design, suporte técnico avançado, automação, melhores práticas e padrões de confiabilidade para Engenheiros de DevOps / Engenheiros de Entrega de Software, enquanto essas equipes mantêm a propriedade da prontidão e implementação da entrega de aplicativos.
Esta é uma função técnica sênior de contribuidor individual para alguém que tenha forte propriedade de produção, profunda experiência em infraestrutura e plataforma, práticas sólidas de SRE e a capacidade de identificar proativamente problemas recorrentes e impulsionar melhorias permanentes.
Na MedTrainer, cada função contribui para a construção de tecnologia que apoia organizações de saúde mais seguras e eficientes. Valorizamos a colaboração, a propriedade e a melhoria contínua em todas as equipes.
Se você está animado para crescer, causar impacto e fazer parte de uma empresa com propósito, nós o(a) encorajamos a se candidatar.
Responsabilidades
- Melhorar as práticas de engenharia de confiabilidade em sistemas de produção, incluindo SLIs, SLOs, orçamentos de erros, postmortems, runbooks, indicadores de saúde de serviço e rastreamento de ações corretivas.
- Liderar melhorias de confiabilidade em plataformas de nuvem, AKS, pipelines de CI/CD, ambientes de aplicativos, bancos de dados e middleware de suporte.
- Operar e melhorar clusters AKS, incluindo atualizações, autoescalonamento, pools de nós, rede, armazenamento, identidade, segurança, confiabilidade e padrões operacionais.
- Fornecer orientação, melhores práticas e padrões para padrões de implantação de aplicativos Kubernetes.
- Melhorar a confiabilidade da entrega por meio de fluxos de trabalho avançados de GitHub Actions, automação reutilizável, padrões de implantação seguros, suporte a rollback e otimização de pipeline.
- Construir automação, capacidades de autoatendimento, padrões de infraestrutura reutilizáveis e procedimentos operacionais para reduzir o trabalho repetitivo (toil), trabalho baseado em tickets, transferências manuais e desvios de infraestrutura.
- Definir, implementar e manter práticas de Infraestrutura como Código e gerenciamento de configuração usando ferramentas aprovadas.
- Possuir e manter o gerenciamento de configuração baseado em Ansible para SO, middleware, serviços de suporte a aplicativos e automação operacional.
- Suportar e melhorar ambientes de nuvem Azure como a plataforma principal, com experiência em AWS e GCP preferencial.
- Implementar e melhorar a observabilidade em métricas, logs, traces, dashboards, alertas, APM, planejamento de capacidade, ajuste de desempenho e dashboards de incidentes.
- Suportar a resposta a incidentes para problemas de confiabilidade de produção, implantação, infraestrutura, banco de dados, middleware e aplicativos, incluindo recomendação de severidade, coordenação de triagem, comunicação com stakeholders, suporte de mitigação, postmortems e ações corretivas.
- Operar com consciência e propriedade de produção, apoiando melhorias de confiabilidade e redução de risco de produção.
- Recomendar o bloqueio, atraso ou rollback de releases quando riscos de confiabilidade, segurança, operacionais ou de continuidade de negócios forem identificados.
- Compreender o comportamento do monólito PHP Symfony o suficiente para suportar a confiabilidade de produção e colaborar efetivamente com as equipes de engenharia de software.
- Operar, ajustar, monitorar, fazer backup, solucionar problemas e suportar MySQL, ProxySQL e RabbitMQ diretamente, enquanto coordena com o provedor de banco de dados quando necessário.
- Fortalecer práticas de segurança e conformidade em infraestrutura, CI/CD e ambientes de tempo de execução, incluindo gerenciamento de segredos, controle de acesso, escaneamento de dependências e imagens, assinatura/proveniência, controles de segurança de CI/CD, configuração de segurança na nuvem e suporte a auditoria.
- Melhorar backup, restauração, recuperação de desastres, visibilidade de custos na nuvem, controle de custos e resiliência operacional em sistemas críticos.
- Orientar Engenheiros de DevOps / Engenheiros de Entrega de Software por meio de orientação técnica, revisão de design, definição de padrões, compartilhamento de conhecimento operacional e melhores práticas de confiabilidade.
- Produzir e manter runbooks, guias de solução de problemas, procedimentos de implantação, padrões de confiabilidade, notas de arquitetura e artigos de base de conhecimento.
- Propor iniciativas técnicas relacionadas à confiabilidade, operações de plataforma, observabilidade, automação, redução de incidentes, maturidade da nuvem e redução de risco operacional.
Qualificações
- Bacharelado em Ciência da Computação, Engenharia, Tecnologia da Informação ou experiência profissional equivalente.
- 8+ anos de experiência em DevOps, Site Reliability Engineering, Platform Engineering, operações em nuvem, automação de infraestrutura, operações de produção ou cargos relacionados
- Fortes habilidades de comunicação escrita e verbal em inglês.
- Forte experiência operando sistemas de produção onde confiabilidade, observabilidade, resposta a incidentes, automação e redução de risco operacional são responsabilidades centrais.
- Forte experiência prática com Azure e ambientes de produção Kubernetes / AKS.
- Experiência em projetar ou melhorar CI/CD, Infraestrutura como Código, gerenciamento de configuração, observabilidade e automação de implantação em escala.
- Fortes habilidades de solução de problemas de produção em infraestrutura de nuvem, Linux, contêineres, Kubernetes, bancos de dados, middleware, pipelines de CI/CD e serviços de suporte a aplicativos.
- Capacidade de entender o comportamento do aplicativo e suportar a confiabilidade de produção de aplicativos PHP Symfony.
- Experiência operando ou suportando MySQL, ProxySQL e RabbitMQ em ambientes de produção.
- Forte compreensão de práticas de entrega segura e segurança de infraestrutura, incluindo gerenciamento de segredos, menor privilégio, revisões de acesso, segurança de CI/CD e suporte a auditoria.
- Experiência com backup, restauração, recuperação de desastres, continuidade de negócios, planejamento de capacidade, ajuste de desempenho e otimização de custos.
- Capacidade de orientar engenheiros, definir padrões técnicos, desafiar construtivamente práticas fracas e liderar iniciativas técnicas sem autoridade formal de gerenciamento de pessoas.
- Capacidade de trabalho totalmente remota, incluindo comunicação escrita disciplinada, autogerenciamento, colaboração assíncrona e participação confiável em fluxos de trabalho de equipe distribuída.
Tecnologias e/ou habilidades essenciais
- Plataformas de nuvem: Azure obrigatório; AWS e GCP preferenciais.
- Kubernetes: AKS, operações de cluster, solução de problemas, atualizações, autoescalonamento, rede, armazenamento, identidade, segurança e padrões de plataforma.
- CI/CD: GitHub Actions, fluxos de trabalho reutilizáveis, ações compostas, ambientes, aprovações, OIDC, runners auto-hospedados, fluxos de trabalho de rollback, artefatos, cache e controles de segurança de pipeline.
- Infraestrutura como Código: Terraform ou Pulumi; Pulumi com Python preferencial.
- Gerenciamento de configuração: Ansible.
- Scripting e automação: Python obrigatório; Bash preferencial.
- Contêineres: Docker / OCI e hosts Docker autônomos.
- Sistemas operacionais: administração e solução de problemas de Linux.
- Bancos de dados e middleware: MySQL, ProxySQL, RabbitMQ.
- Observabilidade: New Relic, Logz.io, Azure Metrics, ClickStack preferencial, métricas, logs, traces, dashboards, APM, verificações sintéticas e alertas baseados em SLO.
- Engenharia de confiabilidade: SLIs, SLOs, orçamentos de erros, postmortems, runbooks, redução de toil, resposta a incidentes e ações corretivas.
- Segurança: HashiCorp Vault, 1Password, gerenciamento de segredos, menor privilégio, revisões de acesso, escaneamento de dependências, escaneamento de imagens de contêineres, assinatura/proveniência e controles de segurança de CI/CD.
- Confiabilidade de aplicativos: contexto de suporte de produção de aplicativos PHP Symfony.
- Resiliência operacional: backup, restauração, recuperação de desastres, continuidade de negócios, planejamento de capacidade e ajuste de desempenho.
- Documentação: runbooks, guias de solução de problemas, procedimentos operacionais, padrões e artigos de base de conhecimento.
- Estilo de trabalho: resolução estruturada de problemas, forte propriedade, consciência de produção, mentoria, mentalidade de automação e redução proativa de riscos.
Informações Adicionais
- Trabalho 100% remoto de qualquer lugar do México.
- Salário mensal competitivo após impostos.
- Seguro Médico Principal e cobertura de saúde.
- Suporte para home office e ergonomia, incluindo internet e eletricidade.
- Oportunidades de desenvolvimento profissional, incluindo aulas de inglês.
- Benefícios de bem-estar, como descontos em academias TotalPass.
- Plano de poupança.
- Folga remunerada, incluindo dias pessoais.
- Ambiente colaborativo, internacional e voltado para o crescimento.
- Oportunidade de trabalhar com tecnologias modernas de nuvem, automação, CI/CD, Kubernetes, confiabilidade, observabilidade e plataforma.
- Cultura de engenharia colaborativa focada em automação, confiabilidade, excelência operacional e melhoria contínua.
Faixa salarial
Todas as suas informações serão mantidas confidenciais de acordo com as diretrizes de EEO.
$70,000—$90,000 MXN
