SONDA
Sporty Group
Site Reliability Engineer
JavaScriptPythonJavaNode.jsPostgreSQLAWSDockerKubernetesRustTerraform
Traduction automatique. Consultez l’original.
Vos missions *
- Collaborer avec une équipe de professionnels DevOps et DBA *
- Améliorer l'infrastructure et les processus existants dans les pays où nous sommes déployés, tout en rationalisant les processus pour nous déployer dans de nouveaux pays à l'avenir *
- Améliorer continuellement la stabilité et l'efficacité de la plateforme Kubernetes, en mettant l'accent sur l'optimisation de l'utilisation des ressources, la réduction des coûts et la rationalisation du provisionnement des environnements grâce à des pratiques GitOps-first *
- Surveiller et maintenir l'infrastructure cloud via l'autoscaling, les pipelines d'alertes et les tableaux de bord Grafana couvrant les métriques, les logs, les traces et la surveillance des utilisateurs réels (RUM) *
- Assurer les opérations de garde en semaine, trier et répondre aux incidents de production, effectuer des analyses de cause profonde et piloter les revues post-incident *
- Concevoir et gérer des pipelines d'alertes pour garantir la qualité des signaux exploitables, en veillant à prévenir la fatigue des alertes, les alertes en cascade et le déluge de notifications *
- Définir et maintenir des SLI et des SLO pour les services critiques, et les utiliser pour piloter les améliorations de fiabilité et la priorisation des gardes *
- Prendre en charge et assumer la responsabilité de nos activités d'exploitation cloud *
- Assurer la liaison avec les agences de sécurité externes pour les audits annuels ainsi que réaliser nos propres analyses de sécurité internes *
- Aider à reconfigurer l'architecture existante pour permettre des déploiements rapides dans de nouveaux pays *
- Mentorer les membres d'équipe moins expérimentés
Votre profil *
- 3+ années d'expérience en DevOps / SRE / ingénierie de plateforme *
- Doit être basé en Europe *
- Expérience dans la direction indépendante de la planification et du déploiement d'un projet *
- Expérience avec les plateformes cloud, en particulier AWS, y compris une solide connaissance de la manière d'utiliser les ressources cloud pour répondre à la demande des autres équipes et de la production *
- Solide compréhension de Kubernetes et de l'orchestration de conteneurs, avec une expérience dans EKS et les outils GitOps tels qu'ArgoCD et Helm étant très appréciée *
- Expérience avec l'Infrastructure-as-Code, en particulier Terraform *
- Maîtrise du scripting et de l'automatisation avec Bash, Python, ou Golang ; l'expérience avec Rust est un plus *
- Expérience pratique des piles d'observabilité couvrant les métriques, les logs, les traces distribuées et le profiling, par exemple Prometheus, Loki, Tempo, Pyroscope et OpenTelemetry *
- Expérience avec la surveillance des utilisateurs réels (RUM), avec une familiarité dans l'instrumentation SDK de Grafana Faro ou OpenTelemetry étant un plus *
- Expérience avérée en garde et en réponse aux incidents, à l'aise pour trier les problèmes de production sous pression, diriger les post-mortems et piloter les actions de suivi *
- Capacité à concevoir et maintenir des frameworks d'alertes qui minimisent le bruit, préviennent la fatigue des alertes et évitent les modèles d'alertes en cascade *
- Expérience dans la définition de SLI et SLO et leur utilisation pour éclairer le travail de fiabilité *
- La familiarité avec les concepts de service mesh est un plus, car nous évaluons activement le service mesh basé sur Cilium dans des environnements non-production *
- Solides connaissances en réseau, en particulier la pile TCP/IP et le protocole HTTP *
- Expérience dans la gestion de volumes élevés de requêtes HTTP et la conception de systèmes pour une haute disponibilité et des environnements à fort trafic *
- Une solide compréhension du cache, y compris CDN, cache HTTP, Redis / Memcached *
- Excellentes compétences en dépannage, y compris le diagnostic des problèmes de système d'exploitation Linux et l'optimisation des paramètres du système d'exploitation, l'optimisation JVM serait très avantageuse
Notre stack *
- Langages : Java / Spring Boot, Node.js, Python, JavaScript *
- Base de données : Aurora MySQL & PostgreSQL, MongoDB, MySQL Community *
- Cache : ElastiCache, Redis, Valkey *
- Messagerie : Apache RocketMQ, AutoMQ, Kafka *
- Réseau & Proxy : Nginx, Kong, Cilium, eBPF *
- Orchestration & GitOps : Docker, Kubernetes (EKS), ArgoCD, Helm *
- Calcul & Stockage : AWS EC2, VPC, AWS Lambda, EBS, S3 *
- CI/CD : Jenkins, GitHub Actions *
- Métriques : Prometheus, Mimir, Grafana, Alertmanager *
- Logs : Loki, Vector *
- Traces : Tempo, OpenTelemetry, Alloy *
- Profiling : Pyroscope *
- RUM : Grafana Faro, OpenTelemetry SDK *
- Infrastructure as Code : Terraform *
- CDN & Edge : Cloudflare, AWS CloudFront *
- AWS CloudWatch
Processus d'entretien *
- Entretien vidéo à distance avec notre équipe d'acquisition de talents *
- Évaluation en ligne via Hackerrank *
- Entretien vidéo à distance avec 3 x membres de l'équipe (45 minutes chacun, pas des jours séparés)
Si vous êtes intéressé, nous vous encourageons à postuler ! Chaque candidature est examinée par un membre de notre équipe (l'IA n'est pas utilisée dans notre processus de recrutement), et nous visons à répondre dans les 48 heures.
Ce que nous offrons *
- Sporty est une entreprise remote-first axée sur la durabilité *
- Un salaire compétitif + des primes individuelles basées sur la performance chaque trimestre *
- 28 jours de congés payés annuels *
- Nos plages horaires de travail principales sont de 10h00 à 15h00 dans votre fuseau horaire local, avec de la flexibilité en dehors de ces créneaux *
- Primes de parrainage et primes ponctuelles *
- Équipement de pointe *
- Retraites annuelles de l'entreprise pour offrir d'excellentes opportunités de réseautage interne
