MedTrainer, Inc.

Engenheiro(a) Sênior de DevOps, Confiabilidade e Operações de Plataforma

PythonAWSGCPDockerKubernetesPHPTerraform
Tradução automática. Consulte o original.

Descrição da Empresa

A MedTrainer é a única plataforma de conformidade tudo-em-um desenvolvida especificamente para organizações de saúde, por profissionais de saúde. Há mais de 13 anos, ajudamos equipes de saúde a permanecerem prontas para auditorias e confiantes em sua conformidade regulatória por meio de inovação contínua e profundo conhecimento do setor.

Nossa plataforma baseada em nuvem unifica o gerenciamento de aprendizado, credenciamento e conformidade em um único sistema inteligente projetado para simplificar operações complexas de saúde. Impulsionada por automação e fluxos de trabalho orientados por IA, a MedTrainer permite que as organizações integrem mais rapidamente, otimizem processos e escalem eficientemente, mantendo os mais altos padrões de conformidade e prontidão da força de trabalho.

Descrição da Vaga

Estamos procurando um(a) Engenheiro(a) Sênior de DevOps, Confiabilidade e Operações de Plataforma para melhorar a confiabilidade, estabilidade operacional, postura de risco e eficácia de entrega de nossa infraestrutura de nuvem, plataformas Kubernetes, fluxos de trabalho de CI/CD, bancos de dados, middleware e sistemas de produção.

Nesta função, você trabalhará em estreita colaboração com Engenheiros de DevOps / Engenheiros de Entrega de Software, Engenharia de Software, Segurança, provedores de banco de dados, Suporte, Produto e equipes de liderança para reduzir o risco de produção, melhorar a observabilidade, fortalecer os padrões operacionais, automatizar trabalhos repetitivos e permitir caminhos mais seguros para a produção.

Você fornecerá orientação de design, suporte técnico avançado, automação, melhores práticas e padrões de confiabilidade para Engenheiros de DevOps / Engenheiros de Entrega de Software, enquanto essas equipes mantêm a propriedade da prontidão e implementação da entrega de aplicativos.

Esta é uma função técnica sênior de contribuidor individual para alguém que tenha forte propriedade de produção, profunda experiência em infraestrutura e plataforma, práticas sólidas de SRE e a capacidade de identificar proativamente problemas recorrentes e impulsionar melhorias permanentes.

Na MedTrainer, cada função contribui para a construção de tecnologia que apoia organizações de saúde mais seguras e eficientes. Valorizamos a colaboração, a propriedade e a melhoria contínua em todas as equipes.

Se você está animado para crescer, causar impacto e fazer parte de uma empresa com propósito, nós o(a) encorajamos a se candidatar.

Responsabilidades

  1. Melhorar as práticas de engenharia de confiabilidade em sistemas de produção, incluindo SLIs, SLOs, orçamentos de erros, postmortems, runbooks, indicadores de saúde de serviço e rastreamento de ações corretivas.
  1. Liderar melhorias de confiabilidade em plataformas de nuvem, AKS, pipelines de CI/CD, ambientes de aplicativos, bancos de dados e middleware de suporte.
  1. Operar e melhorar clusters AKS, incluindo atualizações, autoescalonamento, pools de nós, rede, armazenamento, identidade, segurança, confiabilidade e padrões operacionais.
  1. Fornecer orientação, melhores práticas e padrões para padrões de implantação de aplicativos Kubernetes.
  1. Melhorar a confiabilidade da entrega por meio de fluxos de trabalho avançados de GitHub Actions, automação reutilizável, padrões de implantação seguros, suporte a rollback e otimização de pipeline.
  1. Construir automação, capacidades de autoatendimento, padrões de infraestrutura reutilizáveis e procedimentos operacionais para reduzir o trabalho repetitivo (toil), trabalho baseado em tickets, transferências manuais e desvios de infraestrutura.
  1. Definir, implementar e manter práticas de Infraestrutura como Código e gerenciamento de configuração usando ferramentas aprovadas.
  1. Possuir e manter o gerenciamento de configuração baseado em Ansible para SO, middleware, serviços de suporte a aplicativos e automação operacional.
  1. Suportar e melhorar ambientes de nuvem Azure como a plataforma principal, com experiência em AWS e GCP preferencial.
  1. Implementar e melhorar a observabilidade em métricas, logs, traces, dashboards, alertas, APM, planejamento de capacidade, ajuste de desempenho e dashboards de incidentes.
  1. Suportar a resposta a incidentes para problemas de confiabilidade de produção, implantação, infraestrutura, banco de dados, middleware e aplicativos, incluindo recomendação de severidade, coordenação de triagem, comunicação com stakeholders, suporte de mitigação, postmortems e ações corretivas.
  1. Operar com consciência e propriedade de produção, apoiando melhorias de confiabilidade e redução de risco de produção.
  1. Recomendar o bloqueio, atraso ou rollback de releases quando riscos de confiabilidade, segurança, operacionais ou de continuidade de negócios forem identificados.
  1. Compreender o comportamento do monólito PHP Symfony o suficiente para suportar a confiabilidade de produção e colaborar efetivamente com as equipes de engenharia de software.
  1. Operar, ajustar, monitorar, fazer backup, solucionar problemas e suportar MySQL, ProxySQL e RabbitMQ diretamente, enquanto coordena com o provedor de banco de dados quando necessário.
  1. Fortalecer práticas de segurança e conformidade em infraestrutura, CI/CD e ambientes de tempo de execução, incluindo gerenciamento de segredos, controle de acesso, escaneamento de dependências e imagens, assinatura/proveniência, controles de segurança de CI/CD, configuração de segurança na nuvem e suporte a auditoria.
  1. Melhorar backup, restauração, recuperação de desastres, visibilidade de custos na nuvem, controle de custos e resiliência operacional em sistemas críticos.
  1. Orientar Engenheiros de DevOps / Engenheiros de Entrega de Software por meio de orientação técnica, revisão de design, definição de padrões, compartilhamento de conhecimento operacional e melhores práticas de confiabilidade.
  1. Produzir e manter runbooks, guias de solução de problemas, procedimentos de implantação, padrões de confiabilidade, notas de arquitetura e artigos de base de conhecimento.
  1. Propor iniciativas técnicas relacionadas à confiabilidade, operações de plataforma, observabilidade, automação, redução de incidentes, maturidade da nuvem e redução de risco operacional.

Qualificações

  1. Bacharelado em Ciência da Computação, Engenharia, Tecnologia da Informação ou experiência profissional equivalente.
  1. 8+ anos de experiência em DevOps, Site Reliability Engineering, Platform Engineering, operações em nuvem, automação de infraestrutura, operações de produção ou cargos relacionados
  1. Fortes habilidades de comunicação escrita e verbal em inglês.
  1. Forte experiência operando sistemas de produção onde confiabilidade, observabilidade, resposta a incidentes, automação e redução de risco operacional são responsabilidades centrais.
  1. Forte experiência prática com Azure e ambientes de produção Kubernetes / AKS.
  1. Experiência em projetar ou melhorar CI/CD, Infraestrutura como Código, gerenciamento de configuração, observabilidade e automação de implantação em escala.
  1. Fortes habilidades de solução de problemas de produção em infraestrutura de nuvem, Linux, contêineres, Kubernetes, bancos de dados, middleware, pipelines de CI/CD e serviços de suporte a aplicativos.
  1. Capacidade de entender o comportamento do aplicativo e suportar a confiabilidade de produção de aplicativos PHP Symfony.
  1. Experiência operando ou suportando MySQL, ProxySQL e RabbitMQ em ambientes de produção.
  1. Forte compreensão de práticas de entrega segura e segurança de infraestrutura, incluindo gerenciamento de segredos, menor privilégio, revisões de acesso, segurança de CI/CD e suporte a auditoria.
  1. Experiência com backup, restauração, recuperação de desastres, continuidade de negócios, planejamento de capacidade, ajuste de desempenho e otimização de custos.
  1. Capacidade de orientar engenheiros, definir padrões técnicos, desafiar construtivamente práticas fracas e liderar iniciativas técnicas sem autoridade formal de gerenciamento de pessoas.
  1. Capacidade de trabalho totalmente remota, incluindo comunicação escrita disciplinada, autogerenciamento, colaboração assíncrona e participação confiável em fluxos de trabalho de equipe distribuída.

Tecnologias e/ou habilidades essenciais

  1. Plataformas de nuvem: Azure obrigatório; AWS e GCP preferenciais.
  1. Kubernetes: AKS, operações de cluster, solução de problemas, atualizações, autoescalonamento, rede, armazenamento, identidade, segurança e padrões de plataforma.
  1. CI/CD: GitHub Actions, fluxos de trabalho reutilizáveis, ações compostas, ambientes, aprovações, OIDC, runners auto-hospedados, fluxos de trabalho de rollback, artefatos, cache e controles de segurança de pipeline.
  1. Infraestrutura como Código: Terraform ou Pulumi; Pulumi com Python preferencial.
  1. Gerenciamento de configuração: Ansible.
  1. Scripting e automação: Python obrigatório; Bash preferencial.
  1. Contêineres: Docker / OCI e hosts Docker autônomos.
  1. Sistemas operacionais: administração e solução de problemas de Linux.
  1. Bancos de dados e middleware: MySQL, ProxySQL, RabbitMQ.
  1. Observabilidade: New Relic, Logz.io, Azure Metrics, ClickStack preferencial, métricas, logs, traces, dashboards, APM, verificações sintéticas e alertas baseados em SLO.
  1. Engenharia de confiabilidade: SLIs, SLOs, orçamentos de erros, postmortems, runbooks, redução de toil, resposta a incidentes e ações corretivas.
  1. Segurança: HashiCorp Vault, 1Password, gerenciamento de segredos, menor privilégio, revisões de acesso, escaneamento de dependências, escaneamento de imagens de contêineres, assinatura/proveniência e controles de segurança de CI/CD.
  1. Confiabilidade de aplicativos: contexto de suporte de produção de aplicativos PHP Symfony.
  1. Resiliência operacional: backup, restauração, recuperação de desastres, continuidade de negócios, planejamento de capacidade e ajuste de desempenho.
  1. Documentação: runbooks, guias de solução de problemas, procedimentos operacionais, padrões e artigos de base de conhecimento.
  1. Estilo de trabalho: resolução estruturada de problemas, forte propriedade, consciência de produção, mentoria, mentalidade de automação e redução proativa de riscos.

Informações Adicionais

  • Trabalho 100% remoto de qualquer lugar do México.
  • Salário mensal competitivo após impostos.
  • Seguro Médico Principal e cobertura de saúde.
  • Suporte para home office e ergonomia, incluindo internet e eletricidade.
  • Oportunidades de desenvolvimento profissional, incluindo aulas de inglês.
  • Benefícios de bem-estar, como descontos em academias TotalPass.
  • Plano de poupança.
  • Folga remunerada, incluindo dias pessoais.
  • Ambiente colaborativo, internacional e voltado para o crescimento.
  • Oportunidade de trabalhar com tecnologias modernas de nuvem, automação, CI/CD, Kubernetes, confiabilidade, observabilidade e plataforma.
  • Cultura de engenharia colaborativa focada em automação, confiabilidade, excelência operacional e melhoria contínua.

Faixa salarial

Todas as suas informações serão mantidas confidenciais de acordo com as diretrizes de EEO.

$70,000—$90,000 MXN

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores