CardWorks

Lead Site Reliability Engineer

AWSDockerKubernetesTerraform
Automatische Übersetzung. Prüfe das Original.

Über die Stelle

Werden Sie ein alltäglicher Champion – und bauen Sie eine Karriere auf, bei der Ihre Wirkung den finanziellen Fortschritt vorantreibt.

Was wir tun

CardWorks Financial Group ist eine diversifizierte Finanzdienstleistungsplattform, die ethische Lösungen für Kredite, Darlehen und den gesamten Kundenlebenszyklus entwickelt.

Durch unsere Unternehmensfamilie stellt sich CardWorks Financial Group den komplexen Herausforderungen, die größere Finanzinstitute hinterlassen. Wir sind als Kreditgeber, Dienstleister und Händlerakquisiteur im gesamten Kreditkarten-Ökosystem tätig.

Wer wir sind

  • Merrick Bank: Die Bank, die aufbaut
  • CardWorks Servicing: Ein Partner, Gesamtleistung
  • Carson Smithfield: Lösung mit Respekt

Mit fast 40 Jahren Betriebserfahrung ist unsere Erfolgsbilanz solide: diszipliniert in Abschwüngen und darauf ausgelegt, sich in der Erholung zu beschleunigen. Die Unternehmen der CardWorks Financial Group verfolgen einen präzisen Ansatz in komplexen Märkten, als einer der Top-Drei-Emittenten von Universal-Kreditkarten mit Fokus auf Non-Prime und als einer der Top-Fünfzehn-Händlerakquisiteure in den USA.

Unser Team stellt sich den komplexesten Kredit- und Zahlungsherausforderungen der Branche. Und wir glauben, dass exzellente Arbeit mit einem Team beginnt, das sich unterstützt, respektiert und befähigt fühlt, zu wachsen.

CardWorks Servicing, LLC bietet End-to-End-Betriebsdienstleistungen für Kreditkarten, gesicherte Karten und Ratenkredite an. Wir bedienen Konsumenten- und Kleinunternehmerkredite über das gesamte Kredit-Spektrum und bieten Backup-Servicing- und Due-Diligence-Dienstleistungen für Kapitalgeber und Treuhänder an.

Gegründet im Jahr 1997, ist die Merrick Bank ein FDIC®-versichertes Finanzinstitut mit Hauptsitz in South Jordan, Utah, und einem Vermögen von über 10 Milliarden US-Dollar. Als hundertprozentige Tochtergesellschaft der CardWorks Financial Group bedient die Merrick Bank rund fünf Millionen Karteninhaber und mehr als 100,000 Händlerkunden und bietet Kreditkarten, Freizeitkredite, Einlagenkonten, Händlerdienste und Bankensponsorships für Verbraucher und Unternehmen an.

Carson Smithfield, LLC bietet eine Vielzahl von Dienstleistungen zur Rückgewinnung von Forderungen nach Forderungsausfall an, darunter digitale Selbstbedienung, IVR, Live-Agenten und externes Agenturmanagement.

Wesentliche Funktionen

  1. Etablierung des SRE Betriebsmodells (Service-Onboarding, Engagement-Modell, Governance, Zuverlässigkeitsüberprüfungen, Produktionsbereitschaftsstandards und Quartalsplanung) und Sicherstellung seiner Übernahme durch die Teams.
  1. Identifizierung, Pilotierung und Operationalisierung von KI-gestützten Zuverlässigkeitsanwendungsfällen (z. B. Reduzierung von Alarmrauschen, Zusammenfassung von Vorfällen, Korrelation/Hypothesengenerierung für die Ursachenanalyse, Unterstützung bei Runbooks und automatische Behebung mit menschlicher Genehmigung) mit entsprechenden Schutzmaßnahmen.
  1. Definition, Implementierung und Operationalisierung von Zuverlässigkeitsmetriken durch Festlegung und Verwaltung von SLIs, SLOs und Fehlbudgets zur Quantifizierung und kontinuierlichen Verbesserung der Servicezuverlässigkeit, zur Unterstützung von Ingenieur- und Geschäftsentscheidungen.
  1. Übernahme des zentralisierten SRE Service-Engagement-Modells durch Definition von Servicestufen, Onboarding-Kriterien, Zuverlässigkeitsstandards und einem transparenten Aufnahme-/Priorisierungsprozess, der auf die Geschäftskritikalität abgestimmt ist.
  1. Definition und Durchsetzung von Fehlbudgetrichtlinien (einschließlich Eskalationspfaden und Entscheidungen über Release-Risiken) in Zusammenarbeit mit Produkt/Engineering, unter Verwendung der SLO-Erreichung zur Steuerung von Kompromissen zwischen Feature-Geschwindigkeit und Zuverlässigkeit.
  1. Einrichtung und Pflege zentralisierter „Paved Road“-Zuverlässigkeitsstandards und -Assets (Instrumentierungskonventionen, Goldene Signale, Alarmstandards, Runbook-Vorlagen, SLO-Dashboards), die Produktteams mit minimalem Aufwand übernehmen können.
  1. Entwurf des On-Call- und Eskalationsmodells für ein zentralisiertes SRE-Team (z. B. SRE-Overlay für größere Vorfälle, definierte Übergaben mit Servicebesitzern und klare Zuständigkeitsgrenzen), um die Reaktionsqualität zu verbessern, ohne eine Abhängigkeit von einem einzelnen Team zu schaffen.
  1. Entwurf und Entwicklung von Automatisierungs- und Beobachtbarkeitslösungen durch Entwicklung von Tools, Dashboards und Systemen zur Reduzierung von operativem Aufwand (Messen, Berichten und Reduzieren des Aufwands im Laufe der Zeit), zur Verbesserung der Systemsichtbarkeit und zur Beschleunigung der Bereitstellung.
  1. Teilnahme an Vorfall- und Problemmanagement durch Übernahme der Incident-Koordination für schwerwiegende Ereignisse, Steuerung funktionsübergreifender Reaktionen, Durchführung von „blameless“ Ursachenanalysen, Durchführung von Post-Incident-Reviews (Postmortems) mit klaren Verantwortlichen und Fälligkeitsterminen, Sicherstellung, dass Abhilfemaßnahmen die Zuverlässigkeitsverbesserungen vorantreiben.
  1. Überwachung der Produktionsbereitschaft und -leistung durch Kapazitätsplanung, Validierung der Notfallwiederherstellung, Durchführung von Produktionsbereitschaftsüberprüfungen und Sicherstellung, dass die Systeme die Erwartungen an Verfügbarkeit, Skalierbarkeit und Wiederherstellung erfüllen.
  1. Zusammenarbeit mit Sicherheits-, Risiko- und Compliance-Teams, um Zuverlässigkeitsziele mit Governance- und Compliance-Anforderungen abzustimmen und sichere, prüfbare und gut dokumentierte Praktiken zu gewährleisten.
  1. Zusammenarbeit organisationsübergreifend durch enge Zusammenarbeit mit Endbenutzern, Produktmanagement, Entwicklung, Architektur und IT-Betriebsteams, um Zuverlässigkeitsprinzipien im gesamten Softwareentwicklungszyklus zu verankern, einschließlich Service-Onboarding, Zuverlässigkeitsüberprüfungen und gemeinsamer SLO-Verantwortung.
  1. Förderung der Zuverlässigkeit als Kernproduktfunktion durch Förderung der Zuverlässigkeit in allen Entwicklungsphasen, Eintreten für kontinuierliche Verbesserung und Kommunikation wichtiger Kennzahlen und potenzieller Auswirkungen auf Kunden an Stakeholder.
  1. Schulung, Mentoring und Weiterbildung von Entwicklungsteams durch Coaching von Ingenieuren in SRE-Praktiken, Unterstützung von Junior-Teammitgliedern und Förderung einer Kultur der gemeinsamen Verantwortung und Rechenschaftspflicht für Zuverlässigkeit, einschließlich der Beeinflussung von Teams ohne direkte Autorität durch Standards, Daten und auf die Geschäftsleitung abgestimmte Prioritäten. Auf dem neuesten Stand der SRE-Trends und Best Practices bleiben, einschließlich Beobachtbarkeit, KI-gestützten Operationen (AIOps) und SLO-Management, und diese Methoden implementieren, um gewünschte Geschäftsergebnisse effektiv zu unterstützen. Bewertung von KI-Tools für Zuverlässigkeit mit Sicherheits-/Datenschutz-/Compliance-Schutzmaßnahmen (z. B. Datenverarbeitung, Prompt-/Inhaltskontrollen, Auditierbarkeit) und Messung der Auswirkungen.
  1. Teilnahme an Bereitschaftsdiensten und operative Unterstützung für SRE-unterstützte Systeme und Produkte.

Zusammenfassung der Qualifikationen

  1. Erfahrung in Site Reliability Engineering mit einer Erfolgsbilanz bei der Erzielung messbarer Verbesserungen in Bezug auf Verfügbarkeit, Skalierbarkeit, Release-Stabilität und allgemeine Zuverlässigkeit in komplexen Unternehmensumgebungen.
  1. Nachgewiesene Erfahrung im Aufbau oder der signifikanten Weiterentwicklung einer SRE-Praxis (Betriebsmodell, SRE/Service-Engagement, Produktionsbereitschaft, Vorfall-/Postmortem-Programm und Zuverlässigkeits-Roadmap).
  1. Praktische Erfahrung mit der Anwendung von KI/ML auf den Betrieb (AIOps) oder GenAI in Produktionssupport-Workflows, mit Fokus auf messbare Ergebnisse (MTTD/MTTR, Reduzierung von Alarmmüdigkeit, Änderungsfehlerrate) und verantwortungsvolle Nutzungskontrollen.
  1. Nachgewiesene Fähigkeit, Service Level Indicators (SLIs) und SLOs in Produktionsumgebungen zu etablieren, einschließlich praktischer Definition und Implementierung.
  1. Nachgewiesener Hintergrund in der Produktionsvorfallreaktion, Leitung von Lösungsbemühungen, Durchführung von „blameless“ Post-Incident-Reviews und Implementierung umsetzbarer Abhilfemaßnahmen.
  1. Starke Expertise in Beobachtbarkeit und Telemetrie bei der Gestaltung von Instrumentierung, dem Aufbau umsetzbarer Dashboards und Alarme sowie der Bereitstellung proaktiver Zuverlässigkeitserkenntnisse mithilfe von Metriken, Protokollen und Traces.
  1. Erfahrung im Infrastruktur-Engineering mit starken Infrastructure-as-Code-Kenntnissen unter Verwendung von Tools wie Terraform und Ansible.
  1. Umfassendes Verständnis und praktische Erfahrung im Design, der Optimierung und der Fehlerbehebung von CI/CD-Pipelines unter Verwendung moderner Tools und Plattformen wie Azure DevOps, GitHub Actions, Jenkins oder GitLab CI, mit Schwerpunkt auf Geschwindigkeit, Zuverlässigkeit und Sicherheit.
  1. Praktische Kenntnisse in Containerisierung und Plattformmodernisierung, einschließlich der Architektur und des Betriebs von containerisierten Workloads mit Docker, VMware und Kubernetes (oder vergleichbaren Orchestrierungsplattformen) zur Modernisierung von Legacy-Anwendungen und zur Verbesserung der Fehlertoleranz.
  1. Kenntnisse aufkommender Zuverlässigkeitspraktiken, einschließlich SLO-Automatisierungsplattformen, AIOps oder prädiktiver Operationen zur Förderung eines proaktiven Zuverlässigkeitsmanagements.

Ausbildung und Erfahrung

  1. Master-Abschluss in Informatik, Ingenieurwesen oder gleichwertige praktische Erfahrung in der Konzeption und dem Betrieb von Produktionssystemen im großen Maßstab.
  1. 7+ Jahre Erfahrung in Site Reliability Engineering.
  1. Bevorzugte Zertifizierungen umfassen AWS Professional, Terraform, Ansible, Azure DevOps, Octopus Deploy oder andere auf Automatisierung fokussierte Qualifikationen, die eine kontinuierliche technische Entwicklung belegen.

Idealerweise arbeitet der qualifizierte Kandidat an folgenden Standorten: Woodbury, NY; Pittsburgh, PA, Orlando, Fl, South Jordan, UT. Ein hybrides Arbeitsmodell oder ein vollständig remote Modell kann je nach Entscheidung des einstellenden Managers und den Prioritäten der Rolle in Betracht gezogen werden.

Die Gehaltsspanne für diese Position, wenn sie sich im Großraum NY/Bundesstaat NY befindet, beträgt $146,032 bis $162,257. Bitte beachten Sie jedoch, dass die Gehaltsspanne für andere geografische Gebiete variieren wird.

#INDHP

Wir sind stolz darauf, ein Arbeitgeber zu sein, der Chancengleichheit bietet. Alle qualifizierten Bewerber werden ohne Rücksicht auf Alter, Rasse, Hautfarbe, Geschlecht oder Geschlechtsidentität/-ausdruck (einschließlich Schwangerschaft, Geburt, Transgender-Status oder sexueller Orientierung), Religion oder Glauben, Herkunft, Staatsbürgerschaft, nationale Herkunft, Behinderung, Militär- oder Veteranenstatus, Familienstand, genetische Informationen oder andere gesetzlich geschützte Merkmale berücksichtigt.

Wir tolerieren keine Diskriminierung, Belästigung oder Vergeltungsmaßnahmen. Einstellungsentscheidungen basieren ausschließlich auf Qualifikationen, Verdiensten und Geschäftsanforderungen.

Jeder ist hier willkommen, und wir stellen basierend auf Ihrer Fähigkeit, die Arbeit zu erledigen, ein, nicht aufgrund geschützter Merkmale.

Wenn Sie Hilfe oder angemessene Vorkehrungen während des Bewerbungs- oder Einstellungsprozesses benötigen, informieren Sie bitte Ihren TA-Partner.

Unser Mitarbeiterwertversprechen

  • Wettbewerbsfähige Bezahlung, einschließlich eines Bonus-Ziels oder eines variablen Vergütungsprogramms
  • Leistungspaket – Kranken-, Zahn- und Sehkrankenversicherung (und vieles mehr)
  • 401(k) Plan mit Arbeitgeberzuschuss
  • Kurz- und langfristige Invaliditätsversicherung
  • Wellness-Programme
  • Gruppenlebens- und AD&D-Versicherung
  • Bezahlter Urlaub, Krankheitstage und gesetzliche Feiertage
  • Mitarbeiterengagement-Aktivitäten, einschließlich Mitarbeiterehrungstag, DEI-Mitarbeiterressourcengruppen, soziale Verantwortung des Unternehmens, Dienstjubiläen

Wir bieten ein Gesamtvergütungspaket, das sich aus einer wettbewerbsfähigen Grundvergütung, variablen Vergütungsprogrammen je nach Rolle und einer umfassenden Palette von Leistungen zusammensetzt. Die angebotenen Vergütungssätze werden auf der Grundlage von berufsbezogenem Wissen, relevanter Erfahrung, Fähigkeiten, Zertifizierungen und geografischem Standort ermittelt.

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026