MedTrainer, Inc.

Ingénieur DevOps Senior, Fiabilité et Opérations Plateforme

PythonAWSGCPDockerKubernetesPHPTerraform
Traduction automatique. Consultez l’original.

Description de l'entreprise

MedTrainer est la seule plateforme de conformité tout-en-un conçue par des professionnels de la santé pour les organisations de santé. Depuis plus de 13 ans, nous aidons les équipes de santé à rester prêtes pour les audits et confiantes dans leur conformité réglementaire grâce à une innovation continue et une expertise approfondie du secteur.

Notre plateforme basée sur le cloud unifie la gestion de l'apprentissage, la gestion des certifications et la conformité en un seul système intelligent conçu pour simplifier les opérations complexes de soins de santé. Alimentée par l'automatisation et des flux de travail basés sur l'IA, MedTrainer permet aux organisations d'intégrer plus rapidement, de rationaliser les processus et de monter en puissance efficacement tout en maintenant les normes les plus élevées de conformité et de préparation de la main-d'œuvre.

Description du poste

Nous recherchons un Ingénieur DevOps Senior, Fiabilité et Opérations Plateforme pour améliorer la fiabilité, la stabilité opérationnelle, la posture de risque et l'efficacité de livraison de notre infrastructure cloud, des plateformes Kubernetes, des flux de travail CI/CD, des bases de données, des middlewares et des systèmes de production.

Dans ce rôle, vous travaillerez en étroite collaboration avec les Ingénieurs DevOps / Ingénieurs de Livraison Logicielle, l'Ingénierie Logicielle, la Sécurité, les fournisseurs de bases de données, le Support, le Produit et les équipes de direction pour réduire les risques de production, améliorer l'observabilité, renforcer les normes opérationnelles, automatiser le travail répétitif et permettre des chemins plus sûrs vers la production.

Vous fournirez des conseils en conception, un support technique avancé, de l'automatisation, des meilleures pratiques et des normes de fiabilité aux Ingénieurs DevOps / Ingénieurs de Livraison Logicielle, tandis que ces équipes conserveront la propriété de la préparation et de la mise en œuvre de la livraison des applications.

Il s'agit d'un rôle technique senior de contributeur individuel pour une personne possédant une forte propriété de production, une expérience approfondie de l'infrastructure et de la plateforme, de solides pratiques SRE et la capacité d'identifier de manière proactive les problèmes récurrents et de mettre en œuvre des améliorations permanentes.

Chez MedTrainer, chaque rôle contribue à la création de technologies qui soutiennent des organisations de santé plus sûres et plus efficaces. Nous valorisons la collaboration, la propriété et l'amélioration continue dans toutes les équipes.

Si vous êtes enthousiaste à l'idée de grandir, d'avoir un impact et de faire partie d'une entreprise axée sur sa mission, nous vous encourageons à postuler.

Responsabilités

  1. Améliorer les pratiques d'ingénierie de fiabilité sur les systèmes de production, y compris les SLI, SLO, budgets d'erreur, post-mortems, runbooks, indicateurs de santé des services et suivi des actions correctives.
  1. Mener les améliorations de fiabilité sur les plateformes cloud, les clusters AKS, les pipelines CI/CD, les environnements applicatifs, les bases de données et les middlewares de support.
  1. Opérer et améliorer les clusters AKS, y compris les mises à niveau, l'autoscaling, les pools de nœuds, le réseau, le stockage, l'identité, la sécurité, la fiabilité et les normes opérationnelles.
  1. Fournir des conseils, des meilleures pratiques et des normes pour les modèles de déploiement d'applications Kubernetes.
  1. Améliorer la fiabilité de livraison grâce à des flux de travail avancés GitHub Actions, à l'automatisation réutilisable, aux modèles de déploiement sécurisés, au support de rollback, et à l'optimisation des pipelines.
  1. Construire de l'automatisation, des capacités de libre-service, des modèles d'infrastructure réutilisables et des procédures opérationnelles pour réduire le travail répétitif (toil), le travail basé sur les tickets, les transferts manuels et la dérive de l'infrastructure.
  1. Définir, mettre en œuvre et maintenir les pratiques d'Infrastructure as Code et de gestion de configuration en utilisant les outils approuvés.
  1. Posséder et maintenir la gestion de configuration basée sur Ansible pour le système d'exploitation, les middlewares, les services de support applicatif et l'automatisation opérationnelle.
  1. Supporter et améliorer les environnements cloud Azure comme plateforme principale, avec une expérience AWS et GCP préférée.
  1. Mettre en œuvre et améliorer l'observabilité à travers les métriques, les logs, les traces, les tableaux de bord, l'alerte, l'APM, la planification de capacité, le réglage de performance et les tableaux de bord d'incidents.
  1. Supporter la réponse aux incidents pour les problèmes de fiabilité de production, de déploiement, d'infrastructure, de base de données, de middleware et d'application, y compris la recommandation de sévérité, la coordination du triage, la communication avec les parties prenantes, le support de mitigation, les post-mortems et les actions correctives.
  1. Opérer avec une conscience et une propriété de la production, en soutenant les améliorations de fiabilité et la réduction des risques de production.
  1. Recommander le blocage, le retard ou le rollback des versions lorsque des risques de fiabilité, de sécurité, opérationnels ou de continuité des activités sont identifiés.
  1. Comprendre suffisamment le comportement du monolithe PHP Symfony pour supporter la fiabilité de production et collaborer efficacement avec les équipes d'ingénierie logicielle.
  1. Opérer, régler, surveiller, sauvegarder, dépanner et supporter directement MySQL, ProxySQL et RabbitMQ, tout en coordonnant avec le fournisseur de base de données si nécessaire.
  1. Renforcer les pratiques de sécurité et de conformité à travers l'infrastructure, les pipelines CI/CD et les environnements d'exécution, y compris la gestion des secrets, le contrôle d'accès, l'analyse des dépendances et des images, la signature/provenance, les contrôles de sécurité CI/CD, la configuration de sécurité cloud et le support d'audit.
  1. Améliorer la sauvegarde, la restauration, la reprise après sinistre, la visibilité des coûts cloud, le contrôle des coûts et la résilience opérationnelle sur les systèmes critiques.
  1. Mentorer les Ingénieurs DevOps / Ingénieurs de Livraison Logicielle par le biais de conseils techniques, de revues de conception, de définition de normes, de partage de connaissances opérationnelles et de meilleures pratiques de fiabilité.
  1. Produire et maintenir des runbooks, des guides de dépannage, des procédures de déploiement, des normes de fiabilité, des notes d'architecture et des articles de base de connaissances.
  1. Proposer des initiatives techniques liées à la fiabilité, aux opérations de plateforme, à l'observabilité, à l'automatisation, à la réduction des incidents, à la maturité cloud et à la réduction des risques opérationnels.

Qualifications

  1. Diplôme de licence en informatique, ingénierie, technologies de l'information ou expérience professionnelle équivalente.
  1. 8+ années d'expérience en DevOps, Site Reliability Engineering, Platform Engineering, opérations cloud, automatisation de l'infrastructure, opérations de production ou rôles connexes
  1. Solides compétences en communication écrite et orale en anglais.
  1. Solide expérience dans l'exploitation de systèmes de production où la fiabilité, l'observabilité, la réponse aux incidents, l'automatisation et la réduction des risques opérationnels sont des responsabilités principales.
  1. Solide expérience pratique avec Azure et les environnements de production Kubernetes / AKS.
  1. Expérience dans la conception ou l'amélioration de pipelines CI/CD, d'Infrastructure as Code, de gestion de configuration, d'observabilité et d'automatisation de déploiement à grande échelle.
  1. Solides compétences en dépannage de production sur l'infrastructure cloud, Linux, conteneurs, Kubernetes, bases de données, middlewares, pipelines CI/CD et services de support applicatif.
  1. Capacité à comprendre le comportement des applications et à supporter la fiabilité de production des applications PHP Symfony.
  1. Expérience dans l'exploitation ou le support de MySQL, ProxySQL et RabbitMQ dans des environnements de production.
  1. Solide compréhension des pratiques de livraison sécurisée et de sécurité de l'infrastructure, y compris la gestion des secrets, le moindre privilège, les revues d'accès, la sécurité des pipelines CI/CD et le support d'audit.
  1. Expérience avec la sauvegarde, la restauration, la reprise après sinistre, la continuité des activités, la planification de capacité, le réglage de performance et l'optimisation des coûts.
  1. Capacité à mentorer des ingénieurs, à définir des normes techniques, à remettre en question les pratiques faibles de manière constructive et à diriger des initiatives techniques sans autorité formelle de gestion du personnel.
  1. Capacité de travail entièrement à distance, y compris une communication écrite disciplinée, l'autogestion, la collaboration asynchrone et la participation fiable aux flux de travail d'équipes distribuées.

Technologies et/ou compétences essentielles

  1. Plateformes cloud : Azure requis ; AWS et GCP préférés.
  1. Kubernetes : AKS, opérations de cluster, dépannage, mises à niveau, autoscaling, réseau, stockage, identité, sécurité et normes de plateforme.
  1. CI/CD : GitHub Actions, flux de travail réutilisables, actions composites, environnements, approbations, OIDC, runners auto-hébergés, flux de travail de rollback, artefacts, mise en cache et contrôles de sécurité des pipelines.
  1. Infrastructure as Code : Terraform ou Pulumi ; Pulumi avec Python préféré.
  1. Gestion de configuration : Ansible.
  1. Scripting et automatisation : Python requis ; Bash préféré.
  1. Conteneurs : Docker / OCI et hôtes Docker autonomes.
  1. Systèmes d'exploitation : administration et dépannage de Linux.
  1. Bases de données et middlewares : MySQL, ProxySQL, RabbitMQ.
  1. Observabilité : New Relic, Logz.io, métriques Azure, ClickStack préféré, métriques, logs, traces, tableaux de bord, APM, vérifications synthétiques et alertes basées sur les SLO.
  1. Ingénierie de fiabilité : SLI, SLO, budgets d'erreur, post-mortems, runbooks, réduction du travail répétitif, réponse aux incidents et actions correctives.
  1. Sécurité : HashiCorp Vault, 1Password, gestion des secrets, moindre privilège, revues d'accès, analyse des dépendances, analyse des images de conteneurs, signature/provenance et contrôles de sécurité des pipelines CI/CD.
  1. Fiabilité applicative : contexte de support de production pour les applications PHP Symfony.
  1. Résilience opérationnelle : sauvegarde, restauration, reprise après sinistre, continuité des activités, planification de capacité et réglage de performance.
  1. Documentation : runbooks, guides de dépannage, procédures opérationnelles, normes et articles de base de connaissances.
  1. Style de travail : résolution structurée de problèmes, forte propriété, conscience de la production, mentorat, état d'esprit d'automatisation et réduction proactive des risques.

Informations supplémentaires

  • Travail 100% à distance depuis n'importe où au Mexique.
  • Salaire mensuel compétitif après impôts.
  • Assurance médicale majeure et couverture santé.
  • Support pour le bureau à domicile et l'ergonomie, y compris Internet et l'électricité.
  • Opportunités de développement professionnel, y compris des cours d'anglais.
  • Avantages bien-être tels que des réductions sur les salles de sport TotalPass.
  • Plan d'épargne.
  • Congés payés, y compris des jours personnels.
  • Environnement collaboratif, international et axé sur la croissance.
  • Opportunité de travailler avec des technologies modernes de cloud, d'automatisation, CI/CD, Kubernetes, de fiabilité, d'observabilité et de plateforme.
  • Culture d'ingénierie collaborative axée sur l'automatisation, la fiabilité, l'excellence opérationnelle et l'amélioration continue.

Fourchette de salaire

Toutes vos informations seront traitées de manière confidentielle conformément aux directives EEO.

$70,000—$90,000 MXN

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter