Aviso Wealth
Metrolinx
Manager principal, Ingénierie de la fiabilité des sites et Opérations TI&I
À propos du poste
Metrolinx relie les communautés de la région métropolitaine du Grand Toronto. Metrolinx exploite GO Transit et UP Express, ainsi que le système de paiement PRESTO. Nous construisons également de nouveaux réseaux de transport en commun rapides et améliorés, y compris l'expansion de GO, des lignes de tramway et des expansions majeures du métro de Toronto, pour amener les gens là où ils doivent aller, mieux, plus vite et plus facilement. Metrolinx est une agence du gouvernement de l'Ontario.
Chez Metrolinx, l'équité, la diversité et l'inclusion sont essentielles pour vivre nos valeurs de servir avec passion, de penser à l'avenir et de jouer en équipe.
TI&I UNIQUEMENT : Le groupe Innovation et Technologies de l'information de Metrolinx soutient les membres féminins de l'équipe via « Go Tech Women », un groupe d'affinité pour les femmes en technologies de l'information, dirigé par notre Directeur des technologies de l'information.
Si vous aimez la technologie et l'innovation, valorisez la diversité, appréciez l'équilibre travail/vie personnelle et recherchez une opportunité de rendre le monde meilleur par le service public, Metrolinx aimerait avoir de vos nouvelles !
L'ingénierie de la fiabilité des sites (SRE) et les Opérations intègrent la résilience, la récupérabilité et l'excellence opérationnelle dans tous les services TI&I de Metrolinx. Grâce à la livraison continue, à l'infrastructure en tant que code, à l'observabilité proactive et à des capacités de reprise après sinistre testées, la fonction réduit les risques opérationnels et permet une récupération rapide après des pannes majeures, des incidents cybernétiques et des perturbations.
Qu'est-ce que je ferai ?
- Diriger le leadership en matière de SRE et d'Opérations : Diriger, encadrer et superviser les équipes d'ingénierie responsables des opérations d'infrastructure quotidiennes, de la fiabilité de la plateforme, de la gestion des centres de données et de la reprise après sinistre.
- Rôle de leadership pratique : Agir en tant que leader technique pratique qui reste activement engagé dans l'architecture, les décisions d'ingénierie, la résolution de problèmes opérationnels, la réponse aux incidents et l'exécution de la livraison tout en dirigeant et en développant l'équipe.
- Établir des modèles opérationnels et des normes : Construire et gouverner le modèle opérationnel SRE de l'organisation, les priorités et les normes de fiabilité cloud couvrant la disponibilité, la scalabilité, la récupérabilité et le support opérationnel dans les environnements cloud publics et hybrides.
- Gouverner la fiabilité du cloud et de l'infrastructure : Définir les critères de préparation à la production et les garde-fous d'acceptation opérationnelle pour les services nouveaux ou modifiés de manière significative, en s'assurant que l'architecture, la surveillance, la journalisation, l'alerte, les contrôles de sécurité et l'automatisation de la récupération sont entièrement validés avant la mise en production.
- Gérer la santé des services : Définir des indicateurs de niveau de service (SLI) et des objectifs de niveau de service (SLO) pour les services critiques afin d'équilibrer la vitesse de déploiement avec la stabilité de la plateforme.
- Diriger la réponse aux incidents et l'apprentissage post-incident : Diriger les efforts de réponse aux incidents majeurs pour rétablir rapidement les services perturbés et faciliter les revues post-incident pour s'assurer que les causes racines sont corrigées et suivies dans les backlogs d'ingénierie.
- Opérations quotidiennes : Superviser la gestion opérationnelle quotidienne des centres de données, y compris HPE Synergy, Hyper-V, VMware, la configuration du stockage SAN/NAS, F5, NetScaler, les serveurs de fichiers, l'activation des bases de données (Oracle Data Guard, SQL Always On, Oracle ExaCC), la sauvegarde des données, l'intégration réseau (Cisco ACI et Firepower, Palo Alto Firewalls) et l'optimisation de l'infrastructure physique.
- Gérer proactivement les risques liés à l'infrastructure : Diriger les évaluations des risques de fiabilité, les prévisions de capacité et les tests de résilience contrôlés, y compris, mais sans s'y limiter, les scénarios de défaillance multi-régions, de zones de disponibilité, de réseau et d'identité, afin d'éliminer les points uniques de défaillance.
- Gérer les budgets : Soutenir la gouvernance et l'allocation d'un budget annuel d'investissement, en gérant les budgets opérationnels et d'investissement pour atteindre les objectifs de la feuille de route produit dans les contraintes financières.
- Gérer les relations avec les fournisseurs : Diriger les livrables des fournisseurs, évaluer les propositions technologiques, participer aux négociations de contrats et établir des accords de niveau de service (SLA) et des accords de niveau opérationnel (OLA) avec des partenaires stratégiques.
- Bâtir une culture d'innovation et d'excellence : Développer les capacités d'une équipe performante en matière d'opérations automatisées, d'infrastructure en tant que code et de disciplines SRE.
- Horaires flexibles : Préparation à travailler occasionnellement en dehors des heures normales de bureau, y compris les soirs et les week-ends, lors d'incidents majeurs d'urgence ou de déploiements technologiques urgents.
Quelles compétences et qualifications dois-je posséder ?
Formation : Diplôme en informatique, systèmes d'information, administration des affaires, ingénierie ou une discipline connexe.
Expérience professionnelle et maîtrise technique
- Leadership progressif : Expérience démontrée et progressive dans les opérations d'infrastructure, l'ingénierie de plateformes, l'ingénierie cloud ou le SRE au sein d'un environnement de prestation de services à grande échelle, y compris le leadership d'équipes techniques et de programmes opérationnels complexes.
- Migration cloud Azure à grande échelle : Expérience pratique dans la direction de migrations cloud à grande échelle depuis des environnements sur site vers Microsoft Azure, y compris la planification de la migration, l'architecture, l'exécution, la gestion des risques, le basculement et la transition opérationnelle.
- Pratique SRE et Cloud : Connaissance approfondie des cadres d'ingénierie de fiabilité des sites, de la gestion dynamique des ressources, des quotas de service, de l'autoscaling, de l'infrastructure en tant que code (IaC), de la politique en tant que code et de l'optimisation des coûts cloud.
- Gestion des relations : Compétences exceptionnelles en communication, facilitation et négociation pour informer la direction exécutive, influencer les parties prenantes internes, gérer les contrats fournisseurs et introduire des méthodologies modernes (DevOps, Lean, Agile).
Technologies clés (y compris, mais sans s'y limiter)
- Plateformes Cloud : Microsoft Azure, Copilot, Exchange Online, Teams, SharePoint, etc.
- Infrastructure DC : VMware, Hyper-V, serveurs et stockage HPE, et SAN Brocade.
- Réseau et prestation d'applications : Pare-feu Palo Alto, F5, Citrix NetScaler, Fortinet SD-WAN et Infoblox.
- Identité et sécurité : Microsoft Active Directory, Zscaler, Microsoft Entra ID, Okta, Microsoft Defender et CyberArk Privilege Cloud.
- Opérations Cloud, Automatisation et Observabilité : Grafana, ServiceNow, Terraform, Ansible et GitHub.
- Systèmes d'exploitation et plateformes de gestion : Red Hat Enterprise Linux, Windows Server, SCVMM, SCCM et Red Hat Satellite.
- Solutions de reprise après sinistre : Expérience pratique dans la mise en œuvre de technologies de récupération d'entreprise, y compris Azure Cloud DR, Cisco ACI multisite, Zerto, Hyper-V, Oracle Data Guard, SQL Always On, passerelle de prestation d'applications F5 et solutions de réplication associées.
- Maîtrise des processus : Compréhension des pratiques de gestion de projet, des cadres ITIL, de l'analyse des risques et de l'impact sur les activités (BIA), etc.
Certifications
- Microsoft Certified Azure Solutions Expert, Azure DevOps Engineer, ou équivalent est un atout.
- Cisco Certified Network Professional (CCNP) est un atout.
- Certified Information System Security Professional est un atout.
- Certified Kubernetes Administrator est un atout.
- Information Technology Infrastructure Library (ITIL) Foundations est un atout.
- Certification Agile (Agile Certified Professional, Certified Scrum Product Owner) est un atout.
- Project Management Professional (PMP) ou PRINCE2 est un atout.
Vous ne répondez pas à toutes les exigences ? Si vous êtes enthousiasmé par l'idée de travailler avec Metrolinx mais que votre expérience passée ne correspond pas tout à fait à toutes les qualifications de cette offre, nous vous encourageons à postuler. Vous pourriez être le bon candidat pour ce rôle ou d'autres. Nous sommes toujours à la recherche de talents exceptionnels pour rejoindre notre équipe.
Nous invitons toutes les personnes intéressées à postuler et encourageons les candidatures des membres des communautés en quête d'équité, y compris ceux qui s'identifient comme autochtones, noirs, racisés, femmes, personnes handicapées et personnes ayant des identités, expressions et orientations sexuelles diverses.
Accommodation : Metrolinx est un employeur souscrivant au principe de l'égalité d'accès à l'emploi et s'engage à maintenir une main-d'œuvre diversifiée et inclusive. Nous nous engageons également à offrir des aménagements raisonnables aux candidats conformément à la législation applicable. Si vous avez besoin d'aide ou d'un aménagement à tout point du processus d'embauche, veuillez nous contacter au : 416-202-5601 ou par courriel à [email protected].
Processus de candidature : Tous les candidats doivent être légalement autorisés à travailler au Canada. Metrolinx utilisera le courriel pour communiquer avec vous pour tous les concours d'emploi. Il est de votre responsabilité d'inclure une adresse courriel mise à jour qui est consultée quotidiennement et qui accepte les courriels des expéditeurs inconnus. Comme nous envoyons des correspondances sensibles au temps, nous vous recommandons de vérifier régulièrement votre courriel. Si aucune réponse n'est reçue, nous supposerons que vous n'êtes plus intéressé à poursuivre l'opportunité. Veuillez noter qu'une vérification du casier judiciaire peut être requise pour le candidat retenu.
Pour les candidats internes, avec la mise en œuvre récente de la politique de mobilité interne, le processus de recrutement interne a changé pour les postes non syndiqués. Les candidats doivent être dans leur poste actuel depuis 12 mois avant de postuler à un autre poste et chaque candidat doit être en règle (ne pas participer à un plan d'amélioration du rendement). Veuillez examiner toutes les dispositions de la politique avant de soumettre votre candidature.
S'il est déterminé que des informations de fond fournies sont trompeuses, inexactes ou incorrectes, Metrolinx se réserve le droit d'interrompre l'examen de votre candidature.
Nous remercions tous les candidats de leur intérêt, cependant, seuls ceux sélectionnés pour une considération plus approfondie seront contactés.
NOUS SOMMES UN EMPLOYEUR ÉQUITABLE ET INCLUSIF.
