Yuno

Site Reliability Engineer

PythonSQLPostgreSQLAWSDockerKubernetesGoTerraform
Automatische Übersetzung. Prüfe das Original.

Über die Stelle

Remote · Vollzeit · Einzelbeitragender · +7 Jahre Erfahrung

Haftungsausschluss

Wir können künstliche Intelligenz (KI)-Tools zur Unterstützung von Teilen des Einstellungsprozesses verwenden, wie z. B. die Prüfung von Bewerbungen, die Analyse von Lebensläufen oder die Bewertung von Antworten. Diese Tools unterstützen unser Rekrutierungsteam, ersetzen aber nicht das menschliche Urteilsvermögen. Die endgültigen Einstellungsentscheidungen werden letztendlich von Menschen getroffen. Wenn Sie weitere Informationen darüber wünschen, wie Ihre Daten verarbeitet werden, oder Ihre Datenschutzrechte ausüben möchten, kontaktieren Sie uns bitte unter [email protected].

Site Reliability Engineer

Über die Rolle

Yuno sucht einen Staff Site Reliability Engineer, um die technische Ausrichtung für die Zuverlässigkeit unserer Infrastruktur zu bestimmen – beginnend mit der Plattform, die KI-Agenten in großem Maßstab auf AWS bereitstellt, einsetzt und verwaltet, dem System, das Zahlungen in über 190 Ländern ermöglicht. Die Plattform ist produktiv und wächst, und wir brauchen die erfahrenste Stimme im Bereich Zuverlässigkeit, um die Architektur weiterzuentwickeln und sicherzustellen, dass sie zuverlässig, beobachtbar und bereit für Skalierung bleibt.

Dies ist keine Rolle, die nur das Bestehende wartet, und auch keine Rolle für ein einzelnes System. Sie werden die Zuverlässigkeitsstrategie verantworten – Architekturentscheidungen vorantreiben, ereignisgesteuerte Kommunikation entwerfen, definieren, wie wir Zuverlässigkeit messen und verteidigen, und die Standards festlegen, auf denen andere Ingenieurteams aufbauen.

Wie KI in dieser Rolle zum Einsatz kommt

Die Plattform, die Sie verantworten, ist die KI-Agenten-Infrastruktur von Yuno – Bereitstellung und Einsatz von KI-Agenten in großem Maßstab sowie die Agenten, die Zahlungen leiten und Betrug verhindern. Die Aufrechterhaltung der Zuverlässigkeit der KI-nativen Schicht ist der Kern der Rolle.

KI ist unsere Standard-Ausführungsschicht: Sie werden ermutigt, KI-gestützte Werkzeuge für Automatisierung, Runbooks, Vorfallanalyse und Ursachenermittlung zu nutzen und mitzuhelfen, wie die breitere Engineering-Organisation diese übernimmt. Uns ist wichtig, wie Sie sie nutzen, nicht ob Sie sie nutzen.

Was Erfolg ausmacht

Innerhalb Ihrer ersten 6–12 Monate haben Sie die Zuverlässigkeitsstrategie für die Plattform festgelegt, mindestens eine wichtige Architekturentwicklung (ereignisgesteuertes Messaging, Streaming-Zuverlässigkeit oder Observability) vorangetrieben und die Ingenieurteams haben das von Ihnen definierte SLO- und Error-Budget-Framework übernommen. Sie sind die Person, der Yuno bei den schwierigsten Zuverlässigkeitsentscheidungen vertraut.

Über uns

Yuno ist das KI-native Betriebssystem des globalen Handels und bildet die finanzielle Infrastruktur für Händler, Banken und Wallets von Großunternehmen. Über eine einzige API verbindet Yuno diese mit weltweiten Einzahlungen, Auszahlungen, Betrugsprävention, KYC/KYB und Stablecoins, damit sie überall operieren können. Agnostisch im Design und verbunden mit über 1,000 Zahlungsarten und mehr als 460 Integrationen in über 190 Ländern optimiert Yuno Akzeptanzraten, reduziert Kosten und stärkt die Sicherheit durch spezialisierte KI-Agenten, die aus jeder Transaktion lernen. Globale Marken wie McDonald's, NetEase Games, GoFundMe und Rappi wickeln ihre Zahlungen über Yuno ab.

Ihr Beitrag wird sein

  1. Zuverlässigkeitsstrategie und -standards – Definieren Sie die SLO-Kultur, die Error-Budget-Richtlinie und die Incident-Praktiken, die sich über alle Ingenieurteams skalieren lassen, und verwandeln Sie Zuverlässigkeit von der Brandbekämpfung in eine messbare, organisationsweite Disziplin.
  1. Plattformarchitektur und -entwicklung – Treiben Sie Architekturentscheidungen voran, während die Plattform reift; die entscheidende Stimme bei der Auswahl von Technologien, dem Entwurf von Systemen und der Weiterentwicklung der Infrastruktur.
  1. Messaging und ereignisgesteuerte Architektur – Entwerfen und verantworten Sie die Messaging-Schicht für die Inter-Service-Kommunikation und ersetzen Sie synchrone Muster durch dauerhaftes, zuverlässiges asynchrones Messaging.
  1. Infrastruktur und Bereitstellung – Verantworten Sie die Cloud-Infrastruktur, automatisieren Sie die Bereitstellung mit IaC und stellen Sie sicher, dass die Plattform mit wachsendem Transaktionsvolumen zuverlässig skaliert.
  1. Observability – Erstellen Sie die Überwachung, das Tracing und die Alarmierung, die die Plattform gesund halten; wenn um 3 Uhr etwas ausfällt, sollten Ihre Dashboards und Alarme erklären, warum, bevor jemand nachforschen muss.
  1. Incident-Führung und Mentoring – Agieren Sie als Senior-Eskalationspunkt für die schwierigsten Produktionsprobleme, führen Sie schuldlose Postmortems und Ursachenanalysen durch, die zu dauerhaften Lösungen führen, und heben Sie die Zuverlässigkeitsstandards durch Mentoring von Senior- und Mid-Level-Ingenieuren an.
  1. Chaos-Engineering-Mindset – Kontinuierliche Fault-Injection und Resilienzexperimente, die Schwachstellen aufdecken, bevor sie zu Incidents werden, sowie Identifizierung und Vorschlag von Resilienzmustern, um diese Ausfälle von der Produktion fernzuhalten.

Mindestanforderungen

Benötigte Fähigkeiten

Mindestanforderungen

  1. Ereignisgesteuerte Architektur und Messaging-Systeme – Sie haben Systeme rund um Message Queues (Kafka, NATS, RabbitMQ) entworfen und verantwortet und verstehen At-Least-Once-Delivery, Consumer Groups, Dead Letters und Backpressure; Sie haben ein System von synchron auf asynchron migriert.
  1. Tiefgreifende Kenntnisse von AWS – EC2, VPC, IAM, S3 und RDS – mit starken Netzwerk-Grundlagen, da die Inter-Service-Kommunikation über die interne VPC läuft.
  1. Infrastructure as Code – Terraform oder Pulumi, überprüft in PRs statt per Klick in Konsolen.
  1. Kubernetes und Docker in der Produktion – Container-Lebenszyklus, Ressourcenlimits, Health Checks und Orchestrierung im großen Maßstab.
  1. Observability und SLOs – Datadog-Kenntnisse oder Äquivalent (Dashboards, Monitore, APM, Distributed Tracing) und eine nachgewiesene Erfolgsbilanz bei der Definition und Anwendung von SLOs, SLIs und Error Budgets über verschiedene Dienste hinweg.
  1. Chaos Engineering und Resilienztests – Praktische Erfahrung mit Fault Injection, Game Days oder Chaos-Experimenten (Gremlin, Chaos Mesh, AWS FIS oder Ähnliches) zur Härtung von Produktionssystemen.
  1. Debugging von verteilten Systemen – Sie haben asynchrone Abläufe und kaskadierende Ausfälle in der Produktion diagnostiziert und können erklären, was schiefgelaufen ist und wie Sie es behoben haben; komfortabel im Programmieren für Automatisierung und Tooling (Go, Python oder Ähnliches).
  1. Datenbanken – Solide Kenntnisse von SQL (PostgreSQL) und NoSQL (MongoDB, Redis): wann welche zu verwenden ist, Indizierung, Replikation und Leistungsoptimierung.
  1. Nachgewiesene technische Führung – Sie haben Zuverlässigkeitsstandards festgelegt, die Architektur teamübergreifend beeinflusst und Ingenieure betreut, nicht nur Ihren eigenen Bereich verantwortet.
  1. Englisch – Fortgeschrittene Kenntnisse in Wort und Schrift.

Bevorzugte Qualifikationen

  1. KI / MLOps-Infrastruktur – Betrieb von KI-Workloads in der Produktion (Modell-Serving, LLM-Inferenz, GPU/Ressourcenmanagement und Tools zur Bewertung/Observability von Agenten wie LangFuse, LangSmith, Braintrust oder MLflow).
  1. Multi-Tenant-Container-Plattformen – Betrieb von Kunden- oder Benutzer-Workloads in Containern (Replit, Railway, Fly.io oder interne PaaS).
  1. Datenpipelines und Orchestrierung – Airflow, Prefect oder Ähnliches; Data Warehouses wie Databricks, Snowflake oder BigQuery von Vorteil.
  1. Incident-Management und On-Call-Tools – PagerDuty, Opsgenie oder incident.io.
  1. Erfahrung in der Zahlungsbranche.

Gut zu haben

  1. ECS-Erfahrung.
  1. s6-Overlay zur Überwachung von Containerprozessen.
  1. Erfahrung mit KI-Agenten-Framework-Ökosystemen.
  1. Spanischkenntnisse.

Was wir bei Yuno bieten

  • Wettbewerbsfähige Vergütung.
  • Remote-Arbeit – Sie können von überall arbeiten.
  • Home-Office-Bonus – eine einmalige Zulage zur Einrichtung Ihres idealen Home-Office.
  • Arbeitsausstattung.
  • Aktienoptionen.
  • Gesundheitsplan, wo immer Sie sind.
  • Flexible Urlaubstage.
  • Kurse für Sprach-, Berufs- und persönliche Weiterentwicklung.

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026