GFT Technologies SE
AgileEngine
Cloud Platform Technical Lead ID92209
POURQUOI NOUS REJOINDRE
AgileEngine est une société du groupe Inc. 5000 qui crée des logiciels primés pour des marques Fortune 500 et des startups pionnières dans plus de 17 industries. Nous nous classons parmi les leaders dans des domaines tels que le développement d'applications et l'IA/ML, et notre culture axée sur les personnes nous a valu de multiples récompenses « Meilleur lieu de travail ».
Si vous cherchez un endroit pour grandir, avoir un impact et travailler avec des personnes attentionnées, nous serions ravis de vous rencontrer !
À PROPOS DU POSTE
Nous recherchons un Cloud Platform Technical Lead pour assurer la fiabilité et l'orchestration d'une plateforme de données d'entreprise dans un environnement de soins de santé réglementé.
COMPÉTENCES REQUISES
- Plus de 6 ans d'expérience professionnelle en Cloud Engineering, Platform Engineering, DevOps ou Site Reliability Engineering
- Expertise pratique approfondie des environnements de production AWS, y compris l'architecture cloud, la sécurité, les fondamentaux réseau, la gestion des accès, la surveillance, la capacité et le dépannage opérationnel.
- Expérience avancée avec Kubernetes et Amazon EKS, y compris le déploiement de charges de travail, le dépannage de clusters et d'applications, l'observabilité, la mise à l'échelle, les mises à niveau, l'accès et la fiabilité.
- Expérience pratique de l'exploitation d'Argo Workflows ou d'une plateforme d'orchestration comparable prenant en charge les charges de travail de données en production.
- Solide expérience avec l'Infrastructure as Code, de préférence Terraform, et avec la configuration sous contrôle de code source, CI/CD, l'automatisation des releases et les pratiques de rollback.
- Solide expérience dans la conception et l'exploitation de solutions d'observabilité, de journalisation, de surveillance, d'alerte et de routage d'incidents pour les plateformes de production distribuées.
- Capacité démontrée à gérer les incidents majeurs et le dépannage interfonctionnel entre l'infrastructure, les applications, les pipelines de données et les couches d'analyse.
- Expérience de l'exploitation de plateformes de production avec des niveaux de service définis, des voies d'escalade, des runbooks, des contrôles de changement, des processus de release et des responsabilités d'astreinte.
- Solide connaissance pratique des plateformes de données modernes, y compris Snowflake, les data lakes basés sur S3, SQL, dbt, les outils d'ingestion gérés tels que Fivetran ou HVR, et les pipelines de données personnalisés.
- Compréhension de la qualité des données, de leur fraîcheur, de leur lignage, de l'évolution des schémas, des dépendances des pipelines, des backfills et des procédures de récupération.
- Maîtrise de Python, Shell, Bash ou des langages comparables pour l'automatisation et les outils opérationnels.
- Capacité à prendre des décisions d'architecture et opérationnelles bien raisonnées, à communiquer les compromis, à estimer le travail, à identifier les risques et à guider les équipes à travers le changement.
- Expérience avérée dans le mentorat d'ingénieurs, la revue du travail technique, la délégation de responsabilités et l'amélioration des processus d'ingénierie au sein d'une équipe distribuée.
- Solides compétences en gestion des parties prenantes et en communication, y compris la capacité à recueillir les exigences, à expliquer les risques techniques et à présenter des recommandations aux dirigeants clients.
- Solides compétences en communication écrite et orale en anglais.
- Disponibilité pour travailler dans la fenêtre de service LatAm d'environ 9h00 à 18h00, heure de l'Est, et participer à une rotation d'escalade senior et d'astreinte convenue.
ATOUTS
- Expérience avec les plateformes d'observabilité de données telles que SYNQ et les outils opérationnels tels que Splunk, PagerDuty, Opsgenie ou des solutions comparables.
- Expérience dans la mise en œuvre d'alertes dépendantes des dépendances, d'auto-rémédiation sélective, d'analyse d'impact ou d'autres pratiques de fiabilité avancées.
- Expérience dans la direction d'un service géré, d'une équipe d'opérations de plateforme, d'une fonction Site Reliability Engineering ou d'un modèle de support « follow-the-sun ».
- Expérience dans les soins de santé, les services financiers ou un autre environnement réglementé.
VOTRE MISSION
- Assurer la direction technique et la fiabilité de bout en bout de la Data Platform gérée à travers AWS, Amazon EKS, Kubernetes, Argo Workflows, Snowflake, S3, les pipelines d'ingestion personnalisés et Fivetran, et les dépendances Tableau.
- Diriger la transition technique vers les services gérés, y compris la découverte de la plateforme, la cartographie des dépendances, l'identification des risques, le transfert de connaissances, le shadowing, le reverse shadowing et la validation de la préparation par tour de plateforme.
- Établir et faire évoluer les principes d'architecture cloud, les normes d'Infrastructure as Code, les pratiques de CI/CD et de release, les modèles d'observabilité, les contrôles opérationnels et les priorités d'ingénierie de plateforme.
- Fournir un leadership technique pour l'infrastructure AWS, les opérations Kubernetes et EKS, Argo Workflows, l'automatisation des déploiements, la gestion des secrets et des accès, la capacité de la plateforme et la fiabilité de la production.
- Traduire les besoins métier, de service, de sécurité et de plateforme en exigences techniques exploitables, en plans de mise en œuvre et en un backlog d'amélioration continue priorisé.
- Guider les décisions inter-plateformes impliquant Snowflake, dbt, Fivetran, l'ingestion personnalisée, les opérations de data lake S3, l'orchestration des workflows, la qualité des données et les dépendances d'analyse en aval.
- Diriger le dépannage inter-plateformes complexe et l'escalade L3, en coordonnant les ingénieurs lorsque les incidents couvrent l'infrastructure, l'ingestion, l'orchestration, Snowflake et Tableau.
- Diriger la réponse technique lors d'incidents majeurs, y compris l'évaluation de l'impact, la communication avec les parties prenantes, la stratégie de récupération, l'analyse des causes profondes, l'examen post-incident et les actions préventives.
- S'assurer que les changements et les releases incluent une revue technique appropriée, une analyse des dépendances, une validation, une planification de rollback, une traçabilité et une coordination entre les composants de plateforme affectés.
- Définir et surveiller les indicateurs de fiabilité tels que la disponibilité, le succès de l'ingestion, la fraîcheur des données, la fiabilité des workflows, les résultats des déploiements, la qualité des alertes, le temps moyen de rétablissement du service et les modèles d'incidents récurrents.
- Diriger les améliorations en matière d'automatisation, d'observabilité, d'auto-rémédiation, de résilience de la plateforme, de sécurité des déploiements, de performance, de sécurité, de gestion de la capacité et d'efficacité des coûts cloud.
- Collaborer avec les équipes Sécurité, Gouvernance, Analyse, IT et les parties prenantes de la plateforme pour garantir un accès au moindre privilège, la gestion des secrets, l'auditabilité, les changements contrôlés et la manipulation appropriée des données réglementées.
- Examiner les conceptions techniques et les changements à fort impact, remettre en question les hypothèses, documenter les compromis et s'assurer que les solutions restent sécurisées, évolutives et supportables dans le modèle opérationnel de service géré.
- Mentorer les ingénieurs seniors et intermédiaires, déléguer efficacement les responsabilités, améliorer les pratiques de l'équipe et développer des capacités techniques cohérentes au sein de l'équipe distribuée.
- Maintenir l'alignement entre les fenêtres de couverture LatAm et Inde grâce à une propriété claire, des voies d'escalade, des procédures opérationnelles et des passations structurées.
- Participer au modèle d'escalade senior et d'astreinte pour les incidents critiques en dehors des heures de service normales.
AVANTAGES ET BIENFAITS
- Croissance professionnelle : Mentorat, TechTalks et feuilles de route de croissance personnalisées.
- Rémunération compétitive : Paiement basé sur les USD avec des budgets pour l'éducation, le fitness et les activités d'équipe.
- Projets passionnants : Solutions modernes avec des entreprises Fortune 500 et des entreprises de produits de premier plan.
- Flextime : Horaire flexible avec options de travail à distance et au bureau.
