Dolby Laboratories, Inc.

Ingénieur support opérationnel Senior Staff

KubernetesTerraform
Traduction automatique. Consultez l’original.

À propos du poste

Rejoignez le leader de l'innovation dans le divertissement et aidez-nous à concevoir le futur.

Chez Dolby, la science rencontre l'art, et la haute technologie signifie bien plus que du simple code informatique. En tant que membre de l'équipe Dolby, vous verrez et entendrez les résultats de votre travail partout, des salles de cinéma aux smartphones. Nous continuons à révolutionner la manière dont les gens créent, diffusent et profitent du divertissement dans le monde entier. Pour y parvenir, nous avons besoin des meilleurs talents. Nous sommes assez grands pour vous offrir toutes les ressources nécessaires, et assez agiles pour que vous puissiez faire une réelle différence et être reconnu pour votre travail. Nous proposons une culture collégiale, des projets stimulants, ainsi qu'une rémunération et des avantages sociaux excellents, sans oublier une approche Flex Work qui est véritablement flexible pour soutenir où, quand et comment vous effectuez votre meilleur travail.

L'organisation Dolby Cloud Solutions développe des technologies et des innovations qui s'intègrent facilement dans l'infrastructure des fournisseurs de services pour rendre les expériences de contenu plus efficaces, significatives et engageantes pour les consommateurs.

Dolby OptiView construit une organisation de support opérationnel de classe mondiale responsable de la stabilité, de la disponibilité et de la maturité opérationnelle de nos plateformes de streaming vidéo en direct, de publicités, de lecteurs et de diffusion en temps réel 24/7.

En tant qu'Ingénieur Support Opérationnel Senior, vous assurez un leadership technique et opérationnel pour les scénarios de production les plus complexes et à fort impact. Vous agissez en tant que point d'escalade au-delà du L2, dirigez la réponse aux incidents critiques pour les clients de niveau 1 et les événements en direct majeurs, et pilotez des améliorations systémiques en matière de fiabilité, d'automatisation et de préparation opérationnelle.

Ce rôle va au-delà de la résolution d'incidents. Vous façonnez notre manière d'opérer à grande échelle, influencez la conception des plateformes grâce à des retours opérationnels, et collaborez étroitement avec l'ingénierie, le DevOps, les équipes Produit et la direction du Support pour élever continuellement le niveau de fiabilité d'OptiView.

Responsabilités clés

Leadership en cas d'incident et escalades

  1. Agir en tant que point d'escalade opérationnel final pour les incidents graves, complexes ou prolongés ayant un impact sur les clients
  1. Diriger la résolution d'incidents multi-systèmes et multi-équipes couvrant les pipelines de streaming, les plateformes de lecture, l'insertion publicitaire, les DRM, les CDN et les services en temps réel
  1. Assumer le commandement des incidents lors d'événements en direct majeurs, y compris la prise de décision sous pression et les arbitrages basés sur les risques
  1. Piloter des communications d'incident de haute qualité destinées aux cadres et aux clients lors de situations critiques
  1. Coacher et soutenir les ingénieurs L2 lors d'incidents en direct, en fournissant des conseils et une supervision sans pour autant leur retirer inutilement la responsabilité

Opérations de production avancées et IaC

  1. Opérer avec confiance et indépendance sur les environnements de production avec une conscience étendue au niveau du système
  1. Concevoir, examiner et approuver des changements de production complexes en utilisant l'Infrastructure as Code comme mécanisme par défaut
  1. Expertise approfondie dans les domaines suivants :
  1. Terraform
  1. Helm et manifestes Kubernetes
  1. Workflows GitOps
  1. CI/CD et pipelines de déploiement

Collaborer avec l'ingénierie et le DevOps pour :

  1. Améliorer la sécurité des déploiements et les stratégies de retour arrière (rollback)
  1. Définir des garde-fous opérationnels et des contrôles de rayon d'impact
  1. Influencer l'architecture des plateformes avec une approche axée sur l'opérabilité et la résilience

Opérations pilotées par l'IA, automatisation et outils

  1. Diriger l'adoption d'opérations augmentées par l'IA au sein de l'organisation de support
  1. Définir et faire évoluer :
  1. Le triage et la priorisation des incidents assistés par l'IA
  1. Les runbooks automatisés et semi-automatisés
  1. La corrélation intelligente des alertes et la réduction du bruit
  1. Utiliser l'IA et l'automatisation pour :
  1. Réduire le temps moyen de détection (MTTD) et de résolution (MTTR)
  1. Identifier les modèles systémiques à travers les incidents et les clients
  1. Améliorer la qualité et la cohérence des communications d'incident
  1. Promouvoir un état d'esprit axé sur l'automatisation, en identifiant les opportunités où le travail opérationnel manuel devrait être totalement éliminé

Préparation opérationnelle et excellence des événements en direct

  1. Assurer la préparation opérationnelle pour les événements clients à haut risque et à forte visibilité
  1. Diriger la planification et la validation pré-événement, incluant :
  1. Les revues d'architecture et de risques
  1. La validation des runbooks et des chemins d'escalade
  1. L'évaluation de la surveillance, des alertes et de la couverture SLO
  1. Concevoir et répéter des stratégies de réponse aux incidents pour les pires scénarios
  1. Agir en tant que conseiller opérationnel de confiance auprès des clients stratégiques avant, pendant et après les événements majeurs

Astreinte et opérations 24/7

  1. Participer à une rotation d'astreinte 24/7, incluant les nuits, les week-ends et les jours fériés, dans le cadre d'un modèle de support mondial
  1. Assurer des transitions fluides entre les quarts de travail et les régions
  1. Répondre aux alertes critiques dans le respect des SLA définis pour la santé des flux, les erreurs de lecture et l'infrastructure de diffusion

Analyse des causes racines et amélioration continue

  1. Effectuer ou contribuer à l'analyse des causes racines (RCA) pour les incidents de production
  1. Documenter les conclusions, les actions correctives et les mesures préventives
  1. Identifier les problèmes récurrents et travailler avec les équipes d'ingénierie et de produit pour les éliminer définitivement
  1. Contribuer à l'amélioration des runbooks, des playbooks opérationnels et des bases de connaissances pour tous les produits OptiView (lecteur, publicités, streaming en direct et en temps réel)

Collaboration et boucle de rétroaction avec l'ingénierie

  1. Travailler en étroite collaboration avec les équipes d'ingénierie pour escalader les défauts, valider les correctifs et soutenir les déploiements en production
  1. Fournir des retours sur l'observabilité du système, les lacunes en matière d'outillage et les risques opérationnels
  1. Agir en tant que voix opérationnelle lors des revues post-incident

Compétences et expérience requises

Compétences techniques

  1. 8+ années d'expérience pertinente dans des rôles opérationnels, de support ou similaires en contact avec la clientèle
  1. Capacité démontrée à prendre en charge des problèmes complexes de bout en bout et à travailler avec un haut degré d'autonomie
  1. Expérience dans l'influence des décisions et des résultats au-delà de la contribution individuelle
  1. Expérience approfondie dans l'exploitation et le support de plateformes de streaming vidéo de production à grande échelle
  1. Solides compétences en dépannage sur des systèmes distribués (APIs, microservices, infrastructure cloud)
  1. Compréhension experte des architectures HLS, DASH, CMAF, WebRTC, DRM et CDN
  1. Expérience avancée de travail avec la surveillance, les alertes et les journaux pour diagnostiquer les incidents en direct (Grafana, Kibana/ELK, Prometheus, Loki)
  1. Corréler les métriques de backend streaming, la télémétrie des lecteurs et les signaux CDN pour diagnostiquer les problèmes clients en direct de bout en bout.
  1. Capacité démontrée à exécuter en toute sécurité des changements de production complexes sous pression

Leadership et état d'esprit opérationnel

  1. Leadership démontré lors d'incidents à haute gravité ayant un impact sur les clients
  1. Fort sens des responsabilités et de la redevabilité vis-à-vis des résultats clients
  1. Excellentes compétences en communication écrite et orale, y compris la communication avec les clients lors d'incidents

#LI-GW1

Votre recruteur pourra vous en dire plus sur la fourchette salariale spécifique, les avantages et les bénéfices pour votre lieu de travail au cours du processus de recrutement.

Dolby examinera les candidats qualifiés ayant des antécédents criminels d'une manière conforme aux exigences du Code de police de San Francisco, Article 49, et du Code administratif, Article 12.

Égalité des chances en matière d'emploi :

Dolby est fier d'être un employeur offrant l'égalité des chances. Notre succès dépend des compétences et des talents combinés de tous nos employés. Nous nous engageons à prendre des décisions d'embauche sans égard à la race, aux convictions religieuses, à la couleur, à l'âge, au sexe, à l'orientation sexuelle, à l'identité de genre, à l'origine nationale, à la religion, à l'état civil, à la situation familiale, à l'état de santé, au handicap, au service militaire, à la grossesse, à l'accouchement et aux conditions médicales connexes, ou à toute autre classification protégée par les lois et ordonnances fédérales, étatiques et locales.

La fourchette de salaire de base dans la région d'Atlanta pour ce poste à temps plein est de $152,200 - $209,200, ce qui peut varier si le poste est situé en dehors de cette zone, plus bonus, avantages sociaux, et certains rôles peuvent également inclure des actions.

Nos fourchettes salariales sont déterminées par le rôle, le niveau et le lieu. Au sein de cette fourchette, la rémunération individuelle est déterminée par le lieu de travail et des facteurs supplémentaires, notamment les compétences liées au poste, les aptitudes, l'expérience, les demandes du marché, la parité interne et l'éducation ou la formation pertinente.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter