O'Reilly Auto Parts

Ingénieur(e) Senior en Fiabilité de Site (Poste sur site)

PythonJavaReactAWSGCPDockerKubernetesRubyTerraform
Traduction automatique. Consultez l’original.

À propos du poste

Les ingénieurs en fiabilité de site sont responsables de garantir la disponibilité, la fiabilité, la scalabilité et la performance des microservices les plus critiques de l'entreprise orientés client qui alimentent tous les canaux de commerce électronique. Ce rôle applique les principes SRE inspirés de Google pour équilibrer la vélocité des fonctionnalités et la fiabilité du système en utilisant des Objectifs de Niveau de Service (SLO), des Indicateurs de Niveau de Service (SLI) et des budgets d'erreur.

Le rôle combine l'ingénierie logicielle, l'ingénierie cloud, l'automatisation et les opérations de production, avec un fort accent sur la construction de systèmes observables, résilients et exploitables par défaut.

Il s'agit d'un poste sur site situé à Springfield, MO. Le travail à distance n'est pas une option pour ce poste.

O’Reilly Auto Parts est un employeur garantissant l'égalité des chances. La Société ne fait aucune discrimination fondée sur la race, la religion, la couleur, l'origine nationale ou l'ascendance (y compris le statut d'immigration ou la citoyenneté), le sexe, l'orientation sexuelle, l'identité de genre, la grossesse (y compris l'accouchement, l'allaitement et les conditions médicales connexes), l'âge (40 et plus), le statut d'ancien combattant, le statut de membre des forces armées, un handicap physique ou mental, des informations génétiques (y compris les tests ou caractéristiques) ou tout autre statut protégé tel que défini par la loi locale, étatique ou fédérale, le cas échéant.

Les personnes qualifiées en situation de handicap peuvent avoir droit à un aménagement raisonnable en vertu de l'Americans with Disabilities Act. Si vous avez besoin d'un aménagement raisonnable pendant le processus de candidature ou d'emploi, veuillez envoyer un e-mail à : [email protected] [[email protected]] ou appeler le (800) 471-7431 option , et fournir l'aménagement demandé et les détails du poste.

RESPONSABILITÉS PRINCIPALES

  1. Définir, implémenter et posséder les SLI, SLO et budgets d'erreur pour les microservices critiques en collaboration avec les équipes produit et ingénierie.
  1. Utiliser les budgets d'erreur pour influencer les décisions de publication, prioriser les initiatives de fiabilité et gérer le risque opérationnel.
  1. Concevoir et maintenir des plateformes d'observabilité, y compris les métriques, les logs, les traces et la télémétrie en temps réel.
  1. Suivre, gérer et réduire le travail opérationnel répétitif en convertissant les tâches opérationnelles répétitives en histoires et épopées Jira avec une propriété claire et des résultats mesurables.
  1. Concevoir, implémenter et valider des mécanismes de résilience tels que la dégradation gracieuse, la redondance, le basculement automatique et la reprise après sinistre.
  1. Diriger les efforts de réponse aux incidents, agir comme point d'escalade pour les incidents de haute gravité et mener des post-mortems sans blâme.
  1. Capturer les éléments d'action des incidents et les améliorations de fiabilité dans Jira, en assurant la responsabilité, la clôture et l'amélioration continue.
  1. Collaborer avec les équipes Scrum pour améliorer la fiabilité grâce aux revues de préparation au lancement, à la validation des changements de production et aux stratégies de test.
  1. Effectuer une analyse approfondie des causes profondes, du débogage et de l'optimisation des performances sur les systèmes distribués.
  1. Promouvoir les pratiques de fiabilité « shift-left » en intégrant l'opérabilité, la surveillance et les tests de défaillance tôt dans le cycle de vie du développement logiciel (SDLC).
  1. Piloter l'amélioration continue grâce à l'automatisation, aux systèmes auto-réparateurs, à l'ingénierie du chaos et à la planification de la capacité.
  1. Maintenir les runbooks, playbooks et référentiels de connaissances, en liant la documentation aux tâches Jira pour réduire le MTTR.
  1. Fournir un leadership technique et du mentorat aux SRE et ingénieurs juniors.
  1. Collaborer avec des équipes mondiales et distribuées, en tirant parti de Jira pour une planification transparente, le suivi des dépendances et l'exécution.
  1. Mener des revues de préparation à la production et s'assurer que les services répondent aux normes d'excellence opérationnelle avant le déploiement.
  1. Suivre et améliorer les KPI opérationnels tels que la disponibilité, le MTTR, le MTTD, le taux de succès des déploiements et la récurrence des incidents.
  1. Collaborer avec les équipes de sécurité et de plateforme pour garantir que les meilleures pratiques en matière de fiabilité, de conformité et de sécurité opérationnelle sont intégrées aux systèmes et aux pipelines de déploiement.
  1. Explorer les opportunités d'exploiter l'observabilité pilotée par l'IA, la détection d'anomalies et l'automatisation opérationnelle pour améliorer la fiabilité du système et réduire l'effort manuel.

COMPÉTENCES CLÉS ET QUALIFICATIONS

  1. 4+ années d'expérience en SRE, ingénierie logicielle ou opérations de production supportant des plateformes de commerce électronique à grande échelle.
  1. Expérience pratique avec les systèmes distribués basés sur Java/J2EE ; l'expérience React est un plus.
  1. Capacité avérée à concevoir et exploiter des systèmes utilisant des modèles de fiabilité pilotés par les SLO.
  1. Expérience dans la définition et la mesure des SLI, y compris la disponibilité, la latence, les taux d'erreur, le débit et la saturation.
  1. Bonne compréhension des technologies NoSQL et des concepts RDBMS, avec la capacité d'écrire et de dépanner des requêtes de base de données.
  1. Expérience dans le déploiement et l'exploitation de services sur des plateformes cloud telles que AWS, Azure, ou Google Cloud Platform (GCP).
  1. Expertise avec les outils d'observabilité, APM et de mise en cache tels que Dynatrace, Splunk, ELK, Akamai, Quantum Metric et Tealeaf.
  1. Solide expérience dans l'utilisation de Jira pour la gestion du backlog, le suivi des incidents, les initiatives de réduction du travail répétitif et la coordination inter-équipes.
  1. Capacité à posséder de manière autonome des services et à piloter des initiatives de fiabilité de bout en bout.
  1. Solides compétences en communication avec la capacité d'influencer les équipes d'ingénierie et de produit.
  1. Expérience dans la participation à des rotations de garde et la gestion d'incidents critiques/de haute gravité.

COMPÉTENCES SOUHAITABLES

  1. Expérience dans la construction et l'exploitation d'architectures de microservices utilisant Spring Boot, Groovy, React, ou des technologies similaires.
  1. Solide compréhension des pipelines CI/CD, de l'automatisation des lancements et des pratiques de déploiement progressif.
  1. Expérience de travail dans des domaines de commerce électronique tels que le catalogue, les données clients et la gestion des commandes.
  1. Familiarité avec les plateformes de recherche, y compris Endeca, Solr, Lucene et Elasticsearch.
  1. Maîtrise du scripting et de l'automatisation en utilisant Python, Bash, Ruby, Perl ou PowerShell.
  1. Expérience avec les outils ITSM intégrés aux flux de travail Jira.
  1. Exposition à la planification de la capacité, aux tests de charge et aux pratiques d'ingénierie du chaos.
  1. Expérience avec les technologies de conteneurisation et d'orchestration telles que Docker et Kubernetes (EKS, AKS ou GKE).
  1. Familiarité avec les outils d'Infrastructure as Code (IaC) tels que Terraform, CloudFormation ou Ansible.
  1. Compréhension des KPI opérationnels, y compris la disponibilité, le MTTR, le MTTD, le taux de succès des déploiements et les métriques de récurrence des incidents.
  1. Expérience dans la conduite de revues de préparation à la production et la mise en œuvre de processus de gouvernance opérationnelle.
  1. Capacité à collaborer avec les équipes de sécurité et d'ingénierie de plateforme pour garantir les meilleures pratiques en matière de fiabilité, de conformité et de sécurité opérationnelle.
  1. Exposition aux opérations assistées par l'IA, à la détection d'anomalies, à l'alerte intelligente et aux solutions de remédiation automatisée.
  1. Expérience dans la conception de plateformes évolutives et auto-réparatrices, ainsi que de cadres d'automatisation pour les environnements cloud natifs.

O’Reilly Auto Parts a fait ses preuves en matière de croissance et de stabilité. O’Reilly regorge d'histoires de carrière réussies et croit en une forte philosophie de promotion interne, vous encourageant à développer votre carrière parallèlement à l'organisation.

Ensemble de rémunération totale

  • Salaires compétitifs et congés payés
  • Plan d'achat d'actions et 401k avec contributions de l'employeur dès le premier jour
  • Assurance médicale, dentaire et vision avec compte d'épargne libre-choix (FSA) facultatif
  • Programmes de santé/bien-être pour les membres de l'équipe
  • Programmes d'aide à l'éducation et aux frais de scolarité
  • Opportunités de croissance professionnelle

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter