MedTrainer, Inc.

Senior DevOps Engineer, Reliability & Platform Operations

PythonAWSGCPDockerKubernetesPHPTerraform
Automatische Übersetzung. Prüfe das Original.

Über uns

MedTrainer ist die einzige All-in-One-Compliance-Plattform, die von Gesundheitsexperten speziell für Organisationen im Gesundheitswesen entwickelt wurde. Seit über 13 Jahren helfen wir Gesundheitsteams, durch kontinuierliche Innovation und tiefgreifende Branchenkenntnisse auditbereit und zuversichtlich in ihrer regulatorischen Compliance zu bleiben.

Unsere cloudbasierte Plattform vereint Learning Management, Credentialing und Compliance in einem einzigen intelligenten System, das komplexe Abläufe im Gesundheitswesen vereinfachen soll. Angetrieben durch Automatisierung und KI-gestützte Workflows ermöglicht MedTrainer Organisationen, schneller Onboarding zu betreiben, Prozesse zu optimieren und effizient zu skalieren, während gleichzeitig die höchsten Standards für Compliance und Einsatzbereitschaft der Belegschaft aufrechterhalten werden.

Stellenbeschreibung

Wir suchen einen Senior DevOps Engineer, Reliability & Platform Operations, um die Zuverlässigkeit, operative Stabilität, Risikoposition und Liefereffektivität unserer Cloud-Infrastruktur, Kubernetes-Plattformen, CI/CD-Workflows, Datenbanken, Middleware und Produktionssysteme zu verbessern.

In dieser Rolle arbeiten Sie eng mit DevOps Engineers / Software Delivery Engineers, Software Engineering, Security, Datenbankanbietern, Support, Produkt- und Führungsteams zusammen, um Produktionsrisiken zu reduzieren, die Beobachtbarkeit zu verbessern, operative Standards zu stärken, repetitive Arbeiten zu automatisieren und sicherere Wege zur Produktion zu ermöglichen.

Sie stellen Designrichtlinien, erweiterten technischen Support, Automatisierung, Best Practices und Zuverlässigkeitsstandards für DevOps Engineers / Software Delivery Engineers bereit, während diese Teams die Verantwortung für die Bereitschaft und Implementierung der Anwendungsbereitstellung beibehalten.

Dies ist eine Senior-Position für einen technischen Einzelbeitragenden, der starke Produktionsverantwortung, tiefgreifende Infrastruktur- und Plattformerfahrung, solide SRE-Praktiken und die Fähigkeit besitzt, wiederkehrende Probleme proaktiv zu identifizieren und dauerhafte Verbesserungen voranzutreiben.

Bei MedTrainer trägt jede Rolle dazu bei, Technologie zu entwickeln, die sicherere und effizientere Organisationen im Gesundheitswesen unterstützt. Wir legen Wert auf Zusammenarbeit, Eigenverantwortung und kontinuierliche Verbesserung in allen Teams.

Wenn Sie begeistert sind, zu wachsen, etwas zu bewirken und Teil eines missionsgetriebenen Unternehmens zu sein, ermutigen wir Sie, sich zu bewerben.

Aufgaben

  1. Verbesserung der Praktiken im Bereich Reliability Engineering für Produktionssysteme, einschließlich SLIs, SLOs, Fehlerminimierung, Postmortems, Runbooks, Service-Health-Indikatoren und Nachverfolgung von Korrekturmaßnahmen.
  1. Leitung von Zuverlässigkeitsverbesserungen über Cloud-Plattformen, AKS, CI/CD-Pipelines, Anwendungsumgebungen, Datenbanken und unterstützende Middleware.
  1. Betrieb und Verbesserung von AKS-Clustern, einschließlich Upgrades, Autoskalierung, Node-Pools, Netzwerken, Speicher, Identität, Sicherheit, Zuverlässigkeit und operativen Standards.
  1. Bereitstellung von Anleitungen, Best Practices und Standards für Kubernetes-Anwendungsbereitstellungsmuster.
  1. Verbesserung der Bereitstellungszuverlässigkeit durch erweiterte GitHub Actions-Workflows, wiederverwendbare Automatisierung, sichere Bereitstellungsmuster, Rollback-Unterstützung und Pipeline-Optimierung.
  1. Erstellung von Automatisierung, Self-Service-Funktionen, wiederverwendbaren Infrastrukturmustern und operativen Verfahren zur Reduzierung von Toil, Ticket-gesteuerter Arbeit, manuellen Übergaben und Infrastruktur-Drift.
  1. Definition, Implementierung und Pflege von Infrastructure as Code und Konfigurationsmanagementpraktiken unter Verwendung genehmigter Tools.
  1. Verwaltung und Pflege von Ansible-basiertem Konfigurationsmanagement für Betriebssysteme, Middleware, anwendungsunterstützende Dienste und operative Automatisierung.
  1. Unterstützung und Verbesserung von Azure Cloud-Umgebungen als primäre Plattform, mit bevorzugter Erfahrung in AWS und GCP.
  1. Implementierung und Verbesserung der Beobachtbarkeit über Metriken, Protokolle, Traces, Dashboards, Alarmierung, APM, Kapazitätsplanung, Leistungsoptimierung und Incident-Dashboards.
  1. Unterstützung der Incident Response für Produktions-, Bereitstellungs-, Infrastruktur-, Datenbank-, Middleware- und Anwendungszuverlässigkeitsprobleme, einschließlich Schweregradempfehlung, Triage-Koordination, Stakeholder-Kommunikation, Eskalationsunterstützung, Postmortems und Korrekturmaßnahmen.
  1. Betrieb mit Produktionsbewusstsein und -verantwortung, Unterstützung von Zuverlässigkeitsverbesserungen und Reduzierung von Produktionsrisiken.
  1. Empfehlung von Blockierungen, Verzögerungen oder Rollbacks von Releases, wenn Zuverlässigkeits-, Sicherheits-, Betriebs- oder Geschäftsrisiken identifiziert werden.
  1. Ausreichendes Verständnis des Verhaltens von PHP Symfony Monolithen, um die Produktionszuverlässigkeit zu unterstützen und effektiv mit Softwareentwicklungsteams zusammenzuarbeiten.
  1. Betrieb, Optimierung, Überwachung, Sicherung, Fehlerbehebung und Unterstützung von MySQL, ProxySQL und RabbitMQ direkt, während die Koordination mit dem Datenbankanbieter nach Bedarf erfolgt.
  1. Stärkung von Sicherheits- und Compliance-Praktiken in Infrastruktur, CI/CD und Laufzeitumgebungen, einschließlich Geheimnisverwaltung, Zugriffskontrolle, Abhängigkeits- und Image-Scans, Signierung/Provenienz, CI/CD-Sicherheitskontrollen, Cloud-Sicherheitskonfiguration und Audit-Unterstützung.
  1. Verbesserung von Backups, Wiederherstellungen, Disaster Recovery, Transparenz der Cloud-Kosten, Kostenkontrolle und operativer Resilienz über kritische Systeme hinweg.
  1. Mentoring von DevOps Engineers / Software Delivery Engineers durch technische Anleitung, Designüberprüfung, Standarddefinition, Wissensaustausch im Betrieb und Best Practices für Zuverlässigkeit.
  1. Erstellung und Pflege von Runbooks, Fehlerbehebungsleitfäden, Bereitstellungsverfahren, Zuverlässigkeitsstandards, Architekturhinweisen und Wissensdatenbankartikeln.
  1. Vorschlag technischer Initiativen im Zusammenhang mit Zuverlässigkeit, Plattformbetrieb, Beobachtbarkeit, Automatisierung, Incident-Reduzierung, Cloud-Reife und Reduzierung operativer Risiken.

Qualifikationen

  1. Bachelor-Abschluss in Informatik, Ingenieurwesen, Informationstechnologie oder entsprechende Berufserfahrung.
  1. 8+ Jahre Erfahrung in DevOps, Site Reliability Engineering, Platform Engineering, Cloud Operations, Infrastrukturautomatisierung, Produktionsbetrieb oder verwandten Rollen.
  1. Gute schriftliche und mündliche Englischkenntnisse.
  1. Umfangreiche Erfahrung im Betrieb von Produktionssystemen, bei denen Zuverlässigkeit, Beobachtbarkeit, Incident Response, Automatisierung und Reduzierung operativer Risiken Kernaufgaben sind.
  1. Umfangreiche praktische Erfahrung mit Azure und produktiven Kubernetes / AKS-Umgebungen.
  1. Erfahrung in der Konzeption oder Verbesserung von CI/CD, Infrastructure as Code, Konfigurationsmanagement, Beobachtbarkeit und Bereitstellungsautomatisierung im großen Maßstab.
  1. Starke Fähigkeiten zur Fehlerbehebung in der Produktion über Cloud-Infrastruktur, Linux, Container, Kubernetes, Datenbanken, Middleware, CI/CD-Pipelines und anwendungsunterstützende Dienste hinweg.
  1. Fähigkeit, das Verhalten von Anwendungen zu verstehen und die Produktionszuverlässigkeit von PHP Symfony Anwendungen zu unterstützen.
  1. Erfahrung im Betrieb oder der Unterstützung von MySQL, ProxySQL und RabbitMQ in Produktionsumgebungen.
  1. Gutes Verständnis von sicheren Bereitstellungs- und Infrastruktursicherheitspraktiken, einschließlich Geheimnisverwaltung, geringste Rechte, Zugriffsüberprüfungen, CI/CD-Sicherheit und Audit-Unterstützung.
  1. Erfahrung mit Backup, Wiederherstellung, Disaster Recovery, Business Continuity, Kapazitätsplanung, Leistungsoptimierung und Kostenoptimierung.
  1. Fähigkeit, Ingenieure zu betreuen, technische Standards zu definieren, schwache Praktiken konstruktiv zu hinterfragen und technische Initiativen ohne formelle Personalverantwortung zu leiten.
  1. Vollständig remote Arbeitsfähigkeit, einschließlich disziplinierter schriftlicher Kommunikation, Selbstmanagement, asynchroner Zusammenarbeit und zuverlässiger Teilnahme an verteilten Team-Workflows.

Wesentliche Technologien und/oder Fähigkeiten

  1. Cloud-Plattformen: Azure erforderlich; AWS und GCP bevorzugt.
  1. Kubernetes: AKS, Clusterbetrieb, Fehlerbehebung, Upgrades, Autoskalierung, Netzwerke, Speicher, Identität, Sicherheit und Plattformstandards.
  1. CI/CD: GitHub Actions, wiederverwendbare Workflows, Composite Actions, Umgebungen, Genehmigungen, OIDC, Self-hosted Runner, Rollback-Workflows, Artefakte, Caching und Pipeline-Sicherheitskontrollen.
  1. Infrastructure as Code: Terraform oder Pulumi; Pulumi mit Python bevorzugt.
  1. Konfigurationsmanagement: Ansible.
  1. Skripting und Automatisierung: Python erforderlich; Bash bevorzugt.
  1. Container: Docker / OCI und eigenständige Docker Hosts.
  1. Betriebssysteme: Linux Administration und Fehlerbehebung.
  1. Datenbanken und Middleware: MySQL, ProxySQL, RabbitMQ.
  1. Beobachtbarkeit: New Relic, Logz.io, Azure Metrics, ClickStack bevorzugt, Metriken, Protokolle, Traces, Dashboards, APM, synthetische Checks und SLO-basierte Alarmierung.
  1. Reliability Engineering: SLIs, SLOs, Fehlerminimierung, Postmortems, Runbooks, Toil-Reduzierung, Incident Response und Korrekturmaßnahmen.
  1. Sicherheit: HashiCorp Vault, 1Password, Geheimnisverwaltung, geringste Rechte, Zugriffsüberprüfungen, Abhängigkeitsscans, Container-Image-Scans, Signierung/Provenienz und CI/CD-Sicherheitskontrollen.
  1. Anwendungszuverlässigkeit: PHP Symfony Anwendungen im Produktionsunterstützungskontext.
  1. Operative Resilienz: Backup, Wiederherstellung, Disaster Recovery, Business Continuity, Kapazitätsplanung und Leistungsoptimierung.
  1. Dokumentation: Runbooks, Fehlerbehebungsleitfäden, operative Verfahren, Standards und Wissensdatenbankartikel.
  1. Arbeitsweise: strukturiertes Problemlösen, starke Eigenverantwortung, Produktionsbewusstsein, Mentoring, Automatisierungsmentalität und proaktive Risikoreduzierung.

Zusätzliche Informationen

  • 100% Remote-Arbeit von überall in Mexiko möglich.
  • Wettbewerbsfähiges monatliches Gehalt nach Steuern.
  • Umfassende medizinische Versicherung und Gesundheitsversorgung.
  • Unterstützung für Homeoffice und Ergonomie, einschließlich Internet und Strom.
  • Möglichkeiten zur beruflichen Weiterentwicklung, einschließlich Englischunterricht.
  • Wellness-Leistungen wie TotalPass-Fitnessstudio-Rabatte.
  • Sparplan.
  • Bezahlte Freistellung, einschließlich persönlicher Tage.
  • Kollaboratives, internationales und wachstumsorientiertes Umfeld.
  • Möglichkeit, mit modernen Cloud-, Automatisierungs-, CI/CD-, Kubernetes-, Zuverlässigkeits-, Beobachtbarkeits- und Plattformtechnologien zu arbeiten.
  • Kollaborative Engineering-Kultur mit Fokus auf Automatisierung, Zuverlässigkeit, operative Exzellenz und kontinuierliche Verbesserung.

Gehaltsspanne

Alle Ihre Informationen werden gemäß den EEO-Richtlinien vertraulich behandelt.

$70,000—$90,000 MXN

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026