Yuno

Site Reliability Engineer

PythonSQLPostgreSQLAWSDockerKubernetesGoTerraform
Traduction automatique. Consultez l’original.

À propos du poste

À distance · Temps plein · Contributeur individuel · +7 ans d'expérience

Avis de non-responsabilité

Nous pouvons utiliser des outils d'intelligence artificielle (IA) pour soutenir certaines parties du processus d'embauche, telles que l'examen des candidatures, l'analyse des CV ou l'évaluation des réponses. Ces outils aident notre équipe de recrutement mais ne remplacent pas le jugement humain. Les décisions finales d'embauche sont finalement prises par des humains. Si vous souhaitez plus d'informations sur la manière dont vos données sont traitées ou si vous souhaitez exercer vos droits en matière de protection des données, veuillez nous contacter à l'adresse [email protected].

Ingénieur SRE

À propos du rôle

Yuno recherche un Ingénieur SRE Staff pour définir la direction technique de la fiabilité de notre infrastructure — en commençant par la plateforme qui provisionne, déploie et gère les agents IA à grande échelle sur AWS, le système qui gère les paiements dans plus de 190 pays. La plateforme est en production et en croissance, et nous avons besoin de la voix la plus expérimentée en matière de fiabilité pour faire évoluer l'architecture et nous assurer qu'elle reste fiable, observable et prête à monter en charge.

Ce n'est pas un rôle de « maintenance de l'existant », ni un rôle centré sur un seul système. Vous serez responsable de la stratégie de fiabilité — en pilotant les décisions architecturales, en concevant la communication événementielle, en définissant comment nous mesurons et défendons la fiabilité, et en établissant les normes sur lesquelles les autres équipes d'ingénierie s'appuieront.

Comment l'IA intervient dans ce rôle

La plateforme que vous gérez est l'infrastructure d'agents IA de Yuno — provisionnement et déploiement d'agents IA à grande échelle, ainsi que les agents qui acheminent les paiements et préviennent la fraude. Maintenir la fiabilité de la couche native IA est au cœur du rôle.

L'IA est notre couche d'exécution par défaut : vous êtes encouragé à utiliser des outils assistés par IA pour l'automatisation, les runbooks, l'analyse d'incidents et les investigations de cause racine, et à contribuer à définir comment l'organisation d'ingénierie plus large l'adopte. Nous nous intéressons à la manière dont vous l'utilisez, pas au fait que vous l'utilisiez.

À quoi ressemble le succès

Dans vos 6 à 12 premiers mois, vous aurez défini la stratégie de fiabilité de la plateforme, piloté au moins une évolution architecturale majeure (messagerie événementielle, fiabilité du streaming ou observabilité), et les équipes d'ingénierie auront adopté le cadre SLO et budget d'erreurs que vous avez défini. Vous serez la personne à qui Yuno fait confiance pour les décisions les plus difficiles en matière de fiabilité.

Qui sommes-nous

Yuno est le système d'exploitation natif de l'IA du commerce mondial, alimentant l'infrastructure financière des commerçants, banques et portefeuilles d'entreprise. Via une seule API, Yuno les connecte aux paiements, aux virements, à la prévention de la fraude, au KYC/KYB et aux stablecoins à l'échelle mondiale, leur permettant d'opérer partout. Agnostique par conception et connecté à plus de 1,000 méthodes de paiement et plus de 460 intégrations dans plus de 190 pays, Yuno optimise les taux d'acceptation, réduit les coûts et renforce la sécurité grâce à des agents IA spécialisés qui apprennent de chaque transaction. Des marques mondiales comme McDonald's, NetEase Games, GoFundMe et Rappi utilisent Yuno pour leurs paiements.

Votre contribution sera

  1. Stratégie et normes de fiabilité — définir la culture des SLO, la politique de budget d'erreurs et les pratiques d'incident qui s'étendent aux équipes d'ingénierie, transformant la fiabilité d'une activité de lutte contre les incendies en une discipline mesurable à l'échelle de l'organisation.
  1. Architecture et évolution de la plateforme — piloter les décisions architecturales à mesure que la plateforme mûrit ; être la voix décisive dans le choix des technologies, la conception des systèmes et l'évolution de l'infrastructure.
  1. Architecture de messagerie et événementielle — concevoir et gérer la couche de messagerie pour la communication inter-services, en remplaçant les modèles synchrones par une messagerie asynchrone durable et fiable.
  1. Infrastructure et déploiement — gérer l'infrastructure cloud, automatiser le provisionnement avec l'IaC, et assurer la mise à l'échelle fiable de la plateforme à mesure que le volume des transactions augmente.
  1. Observabilité — construire la surveillance, le traçage et l'alerte qui maintiennent la plateforme en bonne santé ; lorsqu'un problème survient à 3h du matin, vos tableaux de bord et alertes doivent expliquer pourquoi avant que quiconque ait à creuser.
  1. Leadership en cas d'incident et mentorat — agir comme point d'escalade senior pour les problèmes de production les plus difficiles, mener des post-mortems sans blâme et des analyses de cause racine qui mènent à des correctifs permanents, et élever le niveau de fiabilité en encadrant des ingénieurs seniors et intermédiaires.
  1. Esprit de chaos engineering — injection de fautes continue et expériences de résilience qui révèlent les faiblesses avant qu'elles ne se transforment en incidents, ainsi qu'identifier et proposer des modèles de résilience pour empêcher ces défaillances d'atteindre la production.

Qualifications minimales

Compétences requises

Qualifications minimales

  1. Architecture événementielle et systèmes de messagerie — vous avez conçu et géré des systèmes autour de files d'attente de messages (Kafka, NATS, RabbitMQ) et comprenez la livraison au moins une fois, les groupes de consommateurs, les lettres mortes et le backpressure ; vous avez migré un système de synchrone à asynchrone.
  1. Maîtrise approfondie de AWS — EC2, VPC, IAM, S3, et RDS — avec de solides bases en réseau, car la communication inter-services passe par le VPC interne.
  1. Infrastructure as Code — Terraform ou Pulumi, revu en PR plutôt que cliqué dans les consoles.
  1. Kubernetes et Docker en production — cycle de vie des conteneurs, limites de ressources, contrôles d'état et orchestration à grande échelle.
  1. Observabilité et SLO — maîtrise de Datadog ou équivalent (tableaux de bord, moniteurs, APM, traçage distribué), et une expérience avérée dans la définition et l'exploitation de SLO, SLI et budgets d'erreurs entre services.
  1. Chaos engineering et tests de résilience — expérience pratique de l'injection de fautes, des game days ou des expériences de chaos (Gremlin, Chaos Mesh, AWS FIS, ou similaire) pour renforcer les systèmes de production.
  1. Débogage de systèmes distribués — vous avez diagnostiqué des flux asynchrones et des défaillances en cascade en production et pouvez expliquer ce qui s'est cassé et comment vous l'avez réparé ; à l'aise avec le codage pour l'automatisation et les outils (Go, Python, ou similaire).
  1. Bases de données — solides connaissances en SQL (PostgreSQL) et NoSQL (MongoDB, Redis) : quand utiliser chacune, indexation, réplication et optimisation des performances.
  1. Leadership technique avéré — vous avez défini des normes de fiabilité, influencé l'architecture au-delà des équipes et encadré des ingénieurs, sans vous limiter à votre propre périmètre.
  1. Anglais — maîtrise avancée, à l'écrit et à l'oral.

Qualifications souhaitées

  1. Infrastructure IA / MLOps — exécution de charges de travail IA en production (serving de modèles, inférence LLM, gestion GPU/ressources, et outils d'évaluation/observabilité d'agents comme LangFuse, LangSmith, Braintrust, ou MLflow).
  1. Plateformes de conteneurs multi-locataires — exécution de charges de travail clients ou utilisateurs dans des conteneurs (Replit, Railway, Fly.io, ou PaaS interne).
  1. Pipelines de données et orchestration — Airflow, Prefect, ou similaire ; entrepôts de données comme Databricks, Snowflake, ou BigQuery un plus.
  1. Gestion des incidents et outils d'astreinte — PagerDuty, Opsgenie, ou incident.io.
  1. Expérience dans l'industrie des paiements.

Atouts supplémentaires

  1. Expérience avec ECS.
  1. Overlay s6 pour la supervision des processus conteneurisés.
  1. Expérience avec les écosystèmes de frameworks d'agents IA.
  1. Maîtrise de l'espagnol.

Ce que nous offrons chez Yuno

  • Rémunération compétitive
  • Travail à distance — vous pouvez travailler de n'importe où.
  • Prime pour le bureau à domicile — une allocation unique pour aménager votre bureau à domicile idéal.
  • Équipement de travail
  • Options d'achat d'actions
  • Plan de santé où que vous soyez
  • Jours de congé flexibles
  • Cours de langue, de développement professionnel et personnel.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter