Banco Mercantil del Norte, S.A.
Modus Create
Site Reliability Engineer
GELEGENHEIT
SITE RELIABILITY ENGINEER
Wir suchen einen erfahrenen Site Reliability Engineer, um zuverlässige, beobachtbare Systeme zu entwickeln, die es den Kundenteams ermöglichen, mit Zuversicht und in großem Umfang zu arbeiten. Sie werden in funktionsübergreifenden Teams eingebettet sein – in Partnerschaft mit Entwicklern, Plattform-Ingenieuren und Betriebsteams –, um mühsame Arbeit zu reduzieren, die Systemzuverlässigkeit zu verbessern und Vorfälle zu verhindern, bevor sie die Benutzer beeinträchtigen.
Als Senior Site Reliability Engineer übernehmen Sie die Verantwortung für die Systemzuverlässigkeit über unseren gesamten backend-Stack – von AWS-Infrastruktur (ALB, ECS/Fargate, Aurora) bis hin zu Python-Diensten. Sie entwerfen und pflegen Beobachtbarkeitssysteme, definieren SLAs und Fehlerradien, bauen Prozesse für die Reaktion auf Vorfälle auf und treiben Verbesserungen bei Verfügbarkeit und Leistung voran. Sie werden an 24/7 P0 Bereitschaftsdiensten mit einem SLA von 10 Minuten für die Bestätigung teilnehmen, Vorfalluntersuchungen und Postmortems leiten und Teams dabei helfen, von reaktivem Brandbekämpfen zu proaktivem Zuverlässigkeits-Engineering überzugehen. Sie werden auch zusätzliche SRE-Ingenieure betreuen und einarbeiten, wie das Team in den kommenden Monaten von 4 auf 8-12 skaliert.
Der Site Reliability Engineer wird Schulter an Schulter mit funktionsübergreifenden Teams zusammenarbeiten, um sicherzustellen, dass Systeme in den Kundenumgebungen widerstandsfähig, skalierbar und beobachtbar bleiben. Sie werden auch Gelegenheiten haben, die Führung bei der Zuverlässigkeitsstrategie zu beraten und mitzugestalten, wie Organisationen operative Exzellenz angehen.
TEAMZUSAMMENARBEIT *
REMOTE, CONTRACT
- Verfügbarkeit für regelmäßige Arbeitssitzungen und Discovery-Workshops mit Kundenteams *
- Fähigkeit, unabhängig zu arbeiten und gleichzeitig mit Kunden- und Modus-Führungskräften zusammenzuarbeiten *
- Überschneidung mit den Geschäftszeiten des Kunden täglich wird erwartet *
- Zuverlässiges Hochgeschwindigkeitsinternet ist ein Muss *
- Dokumentation von Lösungen, Teilen von Erkenntnissen mit dem Team, Beitrag zu internen Wikis und Runbooks *
- Pair Programming und Zusammenarbeit bei komplexen Zuverlässigkeits- und Betriebsproblemen *
- Akzeptanz von Code- und Architektur-Reviews; Einholung von Feedback zu Zuverlässigkeitsdesigns *
- Fähigkeit zur Koordination mit Sicherheits-, Plattform- und Entwicklungsteams in Bezug auf Zuverlässigkeit und Betrieb
ÜBER UNS
Modus Create ist ein digitaler Beratungspartner, der ehrgeizige Organisationen dabei unterstützt, digitale Produkte, Plattformen und KI-gestützte Erlebnisse zu entwerfen, zu entwickeln und zu modernisieren. Wir arbeiten Schulter an Schulter mit den Kundenteams, um schnell und nachhaltig von der Idee zur Produktion zu gelangen, mit einem klaren Weg zur Skalierung.
Gegründet im 2011, ist Modus ein globales, vollständig remote arbeitendes Team von Weltklasse-Technologen, die in einer kollaborativen, innovativen Umgebung erfolgreich sind. Wir sind ein Partner für die Entwicklung digitaler Produkte für zukunftsorientierte Unternehmen. Unsere globalen Teams arbeiten Seite an Seite mit Kunden, um maßgeschneiderte Lösungen zu entwerfen, zu entwickeln und zu skalieren, die echte Ergebnisse und dauerhafte Veränderungen erzielen, und kooperieren mit Branchenführern wie AWS, GitHub und Atlassian.
Wir waren vollständig remote, bevor es cool war! Ausgezeichnet als eines der Inc. 5000 Fastest Growing Private Companies seit neun Jahren und ein Top-Unternehmen für Remote-Arbeit von FlexJobs, haben wir einigen der größten Marken der Welt geholfen, leistungsstarke digitale Erlebnisse zu liefern.
ANFORDERUNGEN *
- 6+ Jahre praktische Erfahrung in SRE, DevOps oder Platform Engineering im großen Maßstab *
- Starke Kenntnisse in einer Cloud-Plattform: Tiefgreifende AWS-Expertise (ALB, ECS/Fargate, RDS Aurora, Lambda, IAM) *
- Produktionserfahrung im Python backend Engineering; komfortabel beim Debuggen und Optimieren von Python-Diensten in Containern und Lambdas *
- Erfahrung im Aufbau oder der Inbetriebnahme von SRE-Programmen von Grund auf *
- Praktische Erfahrung mit Incident Response, Bereitschaftsdiensten, Postmortems und SLOs *
- Tiefgreifende Erfahrung im Entwurf und der Implementierung von Beobachtbarkeit (Metriken, Logging, Tracing, Alerting) *
- Solides Verständnis von Containerisierung (Kubernetes, Docker) und Deployment- Automatisierung *
- Erfahrung im Schreiben und Pflegen von Infrastructure-as-Code (Terraform, CloudFormation, Pulumi, etc.) *
- Praktische Erfahrung mit CI/CD-Pipelines und Deployment-Strategien *
- Fähigkeit zur Fehlerbehebung bei verteilten Systemen und Produktionsproblemen durch Debugging komplexer Fehler *
- Klare Kommunikationsfähigkeiten und die Fähigkeit, Zuverlässigkeits-Trade-offs für Stakeholder zu erklären *
- Skripting-Kenntnisse (Python, Bash, Go); Grundlagen der Linux/Unix- Administration *
- Versionskontrolle (Git), Kollaborations-Workflows und Muster zur Infrastruktur- Automatisierung
HAUPTVERANTWORTLICHKEITEN & ERGEBNISSE *
- Entwurf von Beobachtbarkeitssystemen (Metriken, Logging, Tracing) und Definition von SLOs, Fehlerradien und Überwachungsstrategien, die auf die Geschäftsanforderungen abgestimmt sind *
- Verantwortung für die 24/7 P0 Bereitschaftsrotation mit einem SLA von 10 Minuten für die Bestätigung; Validierung und Eskalation von KI-generierten Vorfallberichten an die Plattformteams *
- Festlegung von Zuverlässigkeitsstandards und SLA-Zielen für backend-Dienste *
- Betreuung und Einarbeitung zusätzlicher SRE-Ingenieure, während das Team auf 8-12 skaliert *
- Teilnahme an Incident Response, Fehlerbehebung, Ursachenanalyse und Postmortems *
- Implementierung von Zuverlässigkeitsverbesserungen, Kapazitätsplanung und Leistungsoptimierung *
- Entwicklung von Self-Healing-Automatisierung und Initiativen zur Reduzierung mühsamer Arbeit, um manuellen operativen Aufwand zu minimieren *
- Zusammenarbeit mit Teams zur Integration von Zuverlässigkeit und Beobachtbarkeit in die Lieferung *
- Unterstützung moderner Workloads, einschließlich KI-Anwendungen und -Dienste; Verständnis ihrer operativen und zuverlässigkeitsbezogenen Anforderungen *
- Erstellung von Runbooks, Architekturdokumentationen und Troubleshooting-Anleitungen zur Ermöglichung von Unabhängigkeit *
- Überprüfung von Infrastrukturänderungen und Beitrag zu Zuverlässigkeitsstandards und -konsistenz *
- Aktive Systemabstimmung für Latenz, Durchsatz und Ressourceneffizienz basierend auf Beobachtbarkeitsdaten
BONUS-FÄHIGKEITEN *
- Erfahrung im Entwurf oder Betrieb von internen Entwicklerplattformen *
- Vertrautheit mit Chaos Engineering, Resilienztests oder der Planung von Fehlerszenarien *
- Erfahrung mit Cloud-Sicherheit und Compliance (Auditbereitschaft, Sicherheitshärtung) *
- Erfahrung mit KI-Infrastruktur, LLM Serving oder dem Betrieb agentenbasierter Systeme *
- Mentoring von Junior-Ingenieuren oder Leitung technischer Designgespräche *
- Kostenoptimierung und Cloud FinOps-Praktiken *
- Erfahrung mit KI-generierten Vorfallberichten und Validierungs-Workflows *
- Python-Leistungsoptimierung und backend-Optimierung *
- Aufbau von SRE-Programmen in wachstumsstarken oder schnell skalierenden Umgebungen
DAS LIEBEN SIE *
- Aus jedem Vorfall lernen und Systeme kontinuierlich verbessern *
- Herausfordernde Zuverlässigkeits-, Beobachtbarkeits- und Betriebsprobleme lösen *
- Arbeiten mit modernen Cloud-Plattformen, Kubernetes, Infrastructure-as-Code und Beobachtbarkeit *
- Direkten Einfluss auf Systemverfügbarkeit, Leistung und operative Effizienz nehmen *
- Mit großartigen Teams zusammenarbeiten und zur Gestaltung von Unternehmenszuverlässigkeit und SRE-Best Practices beitragen *
- Teams bei der zuverlässigen und sicheren Skalierung von KI-Anwendungen und -Diensten unterstützen *
- Durch den Beitritt zu unserem Team werden Sie Teil eines Gewinnerteams, das die Stärken jedes Einzelnen nutzt und jedes Erfolgs gemeinsam feiert.
