Futurex

Senior Manager, Site Reliability Engineering – Cloud Infrastructure

AWSGCPGoTerraform
Automatische Übersetzung. Prüfe das Original.

Über Futurex

Futurex ist ein in Texas ansässiger Marktführer für Hardware Security Module (HSMs), Enterprise Key Management und Datenschutz, dem seit über vier Jahrzehnten globale Finanzinstitute, Zahlungsabwickler und Cloud-Anbieter vertrauen. Die Cloud Infrastructure von Futurex liefert sichere, hochverfügbare Dienste für Kunden auf der ganzen Welt.

Rollenübersicht

Der Senior Manager, Site Reliability Engineering – Cloud Infrastructure, ist verantwortlich für die Verfügbarkeit, Sicherheit und operative Exzellenz der Futurex Cloud Infrastructure weltweit. Sie leiten ein global verteiltes SRE-Team, das Produktionsinfrastrukturen über mehrere Regionen, Cloud-Anbieter und Rechenzentren hinweg betreibt.

Diese Rolle befindet sich an der Schnittstelle von Cloud-Betrieb, Sicherheit und Compliance. Unsere Kunden sind auf Dienste angewiesen, die nicht ausfallen dürfen, daher wird Zuverlässigkeit hier ebenso in Kundenvertrauen wie in Uptime gemessen.

Sie berichten an die Geschäftsleitung und arbeiten eng mit den Abteilungen Engineering, Produkt, Sicherheit, Compliance und Kundensupport zusammen.

Willkommene, familiäre Unternehmenskultur, die einzigartig auf schnelllebige, unternehmerische und motivierte Einzelpersonen zugeschnitten ist

Einer der „Best Places to Work“ in San Antonio seit neun Jahren in Folge

Hauptverantwortlichkeiten

Teamführung

  1. Führen, einstellen und entwickeln Sie ein globales SRE-Team über mehrere Zeitzonen hinweg mit klarer Zuständigkeit und Follow-the-Sun-Abdeckung.
  1. Verantworten Sie das globale On-Call-Programm, einschließlich Rotationsdesign, Standards für Reaktionszeiten, Eskalationspfade und Abdeckung in allen Regionen.
  1. Halten Sie das Team für die Reaktion auf Vorfälle, die Nachverfolgung von Korrekturmaßnahmen und die Einhaltung von Betriebsstandards verantwortlich.
  1. Legen Sie die SRE-Roadmap, den Personalplan und das Betrieb budget fest.

Zuverlässigkeit und Servicelevel

  1. Definieren und verantworten Sie SLIs, SLOs und Fehlerratenbudgets für Cloud-Infrastrukturdienste und nutzen Sie diese, um Stabilität gegen Release-Geschwindigkeit abzuwägen.
  1. Arbeiten Sie mit Vertrieb und Rechtsabteilung zusammen, damit Kunden-SLA-Verpflichtungen konsistent erfüllt werden.
  1. Verfolgen Sie die SLA-Konformität und den Verbrauch des Fehlerratenbudgets über alle Dienste hinweg.

Betriebsberichterstattung

  1. Liefern Sie regelmäßige Berichte an die Geschäftsleitung über Uptime, SLA-Leistung, Incident-Trends und On-Call-Metriken wie Reaktionszeiten und Eskalationsvolumen.
  1. Pflegen Sie Dashboards, die der Geschäftsleitung und den Stakeholdern Echtzeit-Einblick in die Servicegesundheit geben.
  1. Erstellen Sie kundenorientierte Incident-Berichte und Ursachenanalysen für signifikante Ereignisse.

Incident-Management

  1. Verantworten Sie den Incident-Response-Prozess, einschließlich Schweregraddefinitionen, Eskalationspfaden und Kundenkommunikation.
  1. Leiten Sie Postmortems und treiben Sie Korrekturmaßnahmen zur Schließung voran.
  1. Fungieren Sie als Senior-Eskalationspunkt während schwerwiegender Vorfälle.

Infrastruktur und Betrieb

  1. Überprüfen Sie Standards für Monitoring, Observability und Alerting.
  1. Pflegen und testen Sie regelmäßig Disaster-Recovery- und Business-Continuity-Pläne gegen definierte RTO- und RPO-Ziele.

Sicherheit und Compliance

  1. Arbeiten Sie innerhalb der Kontrollen, die von branchenspezifischen Sicherheits- und Compliance-Frameworks gefordert werden.
  1. Überwachen Sie sichere Betriebsabläufe, einschließlich Dual Control und Chain of Custody, wo erforderlich.
  1. Erzwingen Sie strikte Mandantenisolierung, Least-Privilege-Zugriff und Change Management.
  1. Unterstützen Sie interne und externe Audits mit genauen operativen Nachweisen.

Erforderliche Qualifikationen

  1. 10+ Jahre Erfahrung in SRE, DevOps oder Produktionsinfrastruktur-Rollen, davon 5+ Jahre in der Leitung von Ingenieurteams.
  1. Erfahrung in der Leitung geografisch verteilter Teams über mehrere Zeitzonen hinweg.
  1. Nachgewiesene Verantwortung für eine Produktions- SaaS oder Cloud-Plattform mit vertraglichen SLAs und 24x7 Betrieb.
  1. Praktische Erfahrung in mindestens einem großen Cloud-Anbieter (AWS, GCP oder Azure), mit Arbeitskenntnissen der anderen.
  1. Starker Hintergrund in Linux, Netzwerken, Infrastructure as Code (Terraform oder ähnlich) und CI/CD.
  1. Erfahrung im Betrieb unter Compliance-Frameworks wie PCI DSS, SOC 2 oder ISO 27001.
  1. Nachgewiesene Erfolgsbilanz beim Aufbau von Incident-Management-, Observability- und DR-Programmen.
  1. Klare schriftliche und mündliche Kommunikation mit Führungskräften, Kunden und Auditoren.
  1. Bachelor-Abschluss in Informatik, Ingenieurwesen oder gleichwertige Erfahrung.

Bevorzugte Qualifikationen

  1. Erfahrung im Betrieb sicherheitssensibler oder kryptografischer Infrastrukturen.
  1. Vertrautheit mit Sicherheitszertifizierungsstandards wie FIPS 140.
  1. Erfahrung im Betrieb hybrider Umgebungen, die Public Cloud mit physischer Rechenzentrumshardware kombinieren.
  1. Erfahrung in der Leitung von Rechenzentrumsmigrationen oder regionalen Erweiterungen.
  1. Hintergrund im Finanzdienstleistungssektor oder einer anderen stark regulierten Branche.
  • Kranken-, Zahn-, Augen-, Lebens- und kurz-/langfristige Invaliditätsversicherung
  • Bezahlter Urlaub, Feiertage und Krankheitstage
  • Wettbewerbsfähige Vergütung und Aufstiegsmöglichkeiten
  • Altersvorsorgeplan mit Arbeitgeberzuschuss

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026