Dolby Laboratories, Inc.

Staff Operational Support Engineer

KubernetesTerraform
Traducción automática. Consulta el original.

Sobre la oportunidad

Únete al líder en innovación del entretenimiento y ayúdanos a diseñar el futuro.

En Dolby, la ciencia se une al arte y la alta tecnología significa más que código informático. Como miembro del equipo de Dolby, verás y oirás los resultados de tu trabajo en todas partes, desde salas de cine hasta teléfonos inteligentes. Continuamos revolucionando la forma en que las personas crean, entregan y disfrutan el entretenimiento en todo el mundo. Para ello, necesitamos el mejor talento. Somos lo suficientemente grandes como para brindarte todos los recursos que necesitas y lo suficientemente pequeños como para que puedas marcar una diferencia real y obtener reconocimiento por tu trabajo. Ofrecemos una cultura colegiada, proyectos desafiantes y una excelente compensación y beneficios, sin mencionar un enfoque de Trabajo Flexible que es verdaderamente flexible para apoyar dónde, cuándo y cómo haces tu mejor trabajo.

La organización Dolby Cloud Solutions crea tecnologías e innovaciones que se integran fácilmente en la infraestructura de los proveedores de servicios para hacer que las experiencias de contenido sean más efectivas, significativas y atractivas para los consumidores.

Dolby OptiView está formando un equipo dedicado de Soporte Operacional (L2) responsable de la estabilidad, disponibilidad y excelencia operativa de nuestras plataformas de streaming de vídeo en directo, publicidad, reproductor y entrega en tiempo real (24/7).

Como Ingeniero/a de Soporte Operacional (L2), asumes la propiedad de extremo a extremo de los incidentes de producción que afectan a los clientes una vez que son clasificados por el soporte de Nivel 1. Operas directamente en sistemas de producción, lideras la resolución de incidentes en directo y actúas como puente operativo entre Soporte, Ingeniería, DevOps y los clientes, especialmente durante eventos en directo de alto impacto.

Este es un puesto práctico y de cara al cliente centrado en la propiedad de incidentes, operaciones de producción, automatización y escalabilidad operativa, no solo en la resolución reactiva de problemas.

Responsabilidades Clave

Soporte Operacional y de Incidentes

  1. Asumir la propiedad de los problemas escalados de los clientes desde el Soporte de Nivel 1 y llevarlos a la resolución.
  1. Solucionar y resolver incidentes de producción complejos y de alto impacto que afecten a transmisiones en directo, reproducción VOD, inserción de anuncios, DRM y servicios WebRTC en tiempo real.
  1. Operar directamente en entornos de producción, incluyendo cambios de configuración, ajustes de CDN y acciones correctivas, siguiendo procedimientos operativos establecidos, incluyendo la ejecución de mitigaciones y cambios de emergencia durante incidentes en directo cuando el impacto en el cliente requiera acción inmediata.
  1. Liderar o contribuir activamente a puentes de incidentes en directo que involucren a clientes, equipos internos y socios.
  1. Proporcionar comunicación clara y oportuna durante los incidentes, incluyendo actualizaciones de estado y explicaciones dirigidas al cliente.

Infraestructura como Código y Operaciones de Producción

  1. Trabajar con fluidez con Infraestructura como Código (IaC) para comprender, solucionar problemas y modificar de forma segura los entornos de producción.
  1. Utilizar herramientas y frameworks como: * Terraform * Helm * Manifiestos de Kubernetes * Flujos de trabajo GitOps * Pipelines de CI/CD y despliegue
  1. Utilizar IaC como el mecanismo principal para cambios operativos seguros, auditables y repetibles.
  1. Colaborar con Ingeniería y DevOps para mejorar la fiabilidad de los despliegues y la seguridad operativa.
  1. Validar y ejecutar cambios de infraestructura o configuración a través de flujos de trabajo codificados.

Operaciones impulsadas por IA y Automatización.

  1. Utilizar herramientas de IA y automatización para mejorar la eficiencia operativa y la respuesta a incidentes.

Contribuir y utilizar:

  1. Clasificación y triaje de incidentes asistido por IA
  1. Ejecución automatizada de runbooks
  1. Detección de patrones basada en IA en incidentes
  1. Correlación inteligente de alertas y reducción de ruido.

Utilizar IA para:

  1. Generar o mejorar comunicaciones de incidentes.
  1. Acelerar flujos de trabajo de resolución de problemas.
  1. Identificar patrones recurrentes y problemas sistémicos.
  1. Impulsar la adopción de prácticas operativas de "automatización primero" y aumentadas por IA.

Planificación Pre-Evento y Preparación Operacional

  1. Participar en la planificación de preparación previa a eventos para eventos críticos de clientes.

Validar la preparación del sistema a través de:

  1. Comprobaciones de runbooks.
  1. Validación de la cobertura de monitorización.
  1. Identificación de riesgos y planificación de mitigación.
  1. Definir y ensayar estrategias de respuesta a incidentes para escenarios de alto riesgo.
  1. Colaborar con clientes y equipos internos para garantizar la ejecución fluida de eventos.

Guardias y Operaciones 24/7

  1. Participar en una rotación de guardias 24/7, incluyendo noches, fines de semana y festivos, como parte de un modelo de soporte global.
  1. Asegurar traspasos fluidos entre turnos y regiones.
  1. Responder a alertas críticas dentro de los SLAs definidos para el estado de la transmisión, errores del reproductor e infraestructura de entrega.

Análisis de Causa Raíz y Mejora Continua

  1. Realizar o contribuir al análisis de causa raíz (RCA) de incidentes de producción.
  1. Documentar hallazgos, acciones correctivas y medidas preventivas.
  1. Identificar problemas recurrentes y trabajar con los equipos de Ingeniería y Producto para eliminarlos permanentemente.
  1. Contribuir y mejorar runbooks, playbooks operativos y bases de conocimiento para todos los productos OptiView (Reproductor, anuncios, streaming en directo y en tiempo real).

Bucle de Retroalimentación de Colaboración e Ingeniería

  1. Trabajar estrechamente con los equipos de Ingeniería para escalar defectos, validar correcciones y dar soporte a despliegues de producción.
  1. Proporcionar retroalimentación sobre la observabilidad del sistema, lagunas en las herramientas y riesgos operativos.
  1. Actuar como la voz operativa durante las revisiones posteriores a incidentes.

Habilidades y Experiencia Requeridas

Habilidades Técnicas

  1. 5+ años de experiencia relevante en roles operativos, de soporte o similares de cara al cliente.
  1. Capacidad demostrada para asumir problemas complejos de principio a fin y operar con un alto grado de autonomía.
  1. Sólida experiencia en el soporte de plataformas de streaming de vídeo en producción, servicios OTT, sistemas en directo.
  1. Sólidas habilidades de resolución de problemas en sistemas distribuidos (APIs, microservicios, infraestructura en la nube).
  1. Familiaridad con HLS, DASH, CMAF, WebRTC, DRM y arquitecturas CDN.
  1. Experiencia trabajando con monitorización, alertas y logs para diagnosticar incidentes en directo (Grafana, Kibana/ELK, Prometheus, Loki).
  1. Correlacionar métricas de streaming backend, telemetría del reproductor y señales CDN para diagnosticar problemas de clientes en directo de extremo a extremo.
  1. Comodidad realizando cambios controlados en entornos de producción.
  1. Conocimiento práctico de la gestión de incidentes y operaciones de guardia.

Mentalidad Operacional

  1. Capacidad demostrada para mantener la calma, la estructura y la decisión durante incidentes de alta presión.
  1. Fuerte sentido de propiedad y responsabilidad por los resultados del cliente.
  1. Excelentes habilidades de comunicación escrita y verbal, incluyendo la comunicación de cara al cliente durante incidentes.

#LI-GW!

Dolby considerará a los solicitantes calificados con antecedentes penales de acuerdo con los requisitos del Código de Policía de San Francisco, Artículo 49, y el Código Administrativo, Artículo 12.

Igualdad de Oportunidades de Empleo: Dolby se enorgullece de ser un empleador que ofrece igualdad de oportunidades. Nuestro éxito depende de las habilidades y talentos combinados de todos nuestros empleados. Estamos comprometidos a tomar decisiones de empleo sin distinción de raza, credo religioso, color, edad, sexo, orientación sexual, identidad de género, origen nacional, religión, estado civil, estado familiar, condición médica, discapacidad, servicio militar, embarazo, parto y condiciones médicas relacionadas o cualquier otra clasificación protegida por las leyes federales, estatales y locales, y ordenanzas.

El rango salarial base para esta posición a tiempo completo en el área de Atlanta es $136,500-$187,400, que puede variar si está fuera de esta ubicación, además de bonificación, beneficios y algunos roles también pueden incluir acciones. Nuestros rangos salariales se determinan por rol, nivel y ubicación. Dentro del rango, el pago individual se determina por la ubicación de trabajo y factores adicionales, incluyendo habilidades, competencias, experiencia relacionadas con el trabajo, demandas del mercado, paridad interna y educación o formación relevante. Su reclutador puede compartir más sobre el rango salarial específico y los beneficios para su ubicación durante el proceso de contratación.

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores