O'Reilly Auto Parts

Ingeniero Senior de Fiabilidad de Sitios (Puesto Presencial)

PythonJavaReactAWSGCPDockerKubernetesRubyTerraform
Traducción automática. Consulta el original.

Sobre la oportunidad

Los Site Reliability Engineers son responsables de garantizar la disponibilidad, la fiabilidad, la escalabilidad y el rendimiento de los microservicios más críticos de la empresa orientados al cliente que impulsan todos los canales de comercio electrónico. Este puesto aplica principios de SRE inspirados en Google para equilibrar la velocidad de las funcionalidades y la fiabilidad del sistema mediante el uso de Objetivos de Nivel de Servicio (SLOs), Indicadores de Nivel de Servicio (SLIs) y presupuestos de errores.

El puesto combina ingeniería de software, ingeniería en la nube, automatización y operaciones de producción, con un fuerte énfasis en la creación de sistemas que sean observables, resilientes y operables por defecto.

Este es un puesto presencial ubicado en Springfield, MO. El trabajo remoto no es una opción para este puesto.

O’Reilly Auto Parts es un empleador que ofrece igualdad de oportunidades. La Compañía no discrimina por motivos de raza, religión, color, origen nacional o ascendencia (incluyendo estatus de inmigración o ciudadanía), sexo, orientación sexual, identidad de género, embarazo (incluyendo parto, lactancia y condiciones médicas relacionadas), edad (40 y mayores), condición de veterano, condición de miembro del servicio uniformado, discapacidad física o mental, información genética (incluyendo pruebas o características) o cualquier otra condición protegida según lo definido por la ley local, estatal o federal, según corresponda.

Las personas cualificadas con una discapacidad pueden tener derecho a una adaptación razonable según la Ley de Estadounidenses con Discapacidades. Si requiere una adaptación razonable durante el proceso de solicitud o empleo, envíe un correo electrónico a: [email protected] [[email protected]] o llame al (800) 471-7431 opción , y proporcione la adaptación solicitada y los detalles del puesto.

RESPONSABILIDADES PRINCIPALES

  1. Definir, implementar y poseer SLIs, SLOs y presupuestos de errores para microservicios críticos en colaboración con los equipos de producto e ingeniería.
  1. Utilizar presupuestos de errores para influir en las decisiones de lanzamiento, priorizar iniciativas de fiabilidad y gestionar el riesgo operativo.
  1. Diseñar y mantener plataformas de observabilidad, incluyendo métricas, logs, trazas y telemetría en tiempo real.
  1. Rastrear, gestionar y reducir el trabajo operativo repetitivo convirtiendo tareas operativas repetitivas en historias y épicas de Jira con propiedad clara y resultados medibles.
  1. Diseñar, implementar y validar mecanismos de resiliencia como degradación elegante, redundancia, failover automatizado y recuperación ante desastres.
  1. Liderar esfuerzos de respuesta a incidentes, actuar como punto de escalada para incidentes de alta gravedad y dirigir análisis post-mortem sin culpa.
  1. Capturar elementos de acción de incidentes y mejoras de fiabilidad en Jira, asegurando la rendición de cuentas, el cierre y la mejora continua.
  1. Colaborar con equipos de Scrum para mejorar la fiabilidad a través de revisiones de preparación para lanzamientos, validación de cambios en producción y estrategias de prueba.
  1. Realizar análisis profundos de causa raíz, depuración y ajuste de rendimiento en sistemas distribuidos.
  1. Promover prácticas de fiabilidad de "shift-left" integrando la operabilidad, el monitoreo y las pruebas de fallos al principio del SDLC.
  1. Impulsar la mejora continua a través de la automatización, sistemas de autocuración, ingeniería del caos y planificación de capacidad.
  1. Mantener runbooks, playbooks y repositorios de conocimiento, vinculando la documentación a tareas de Jira para reducir el MTTR.
  1. Proporcionar liderazgo técnico y mentoría a SREs e ingenieros junior.
  1. Colaborar con equipos globales y distribuidos, aprovechando Jira para una planificación transparente, seguimiento de dependencias y ejecución.
  1. Realizar revisiones de preparación para producción y asegurar que los servicios cumplan los estándares de excelencia operativa antes del despliegue.
  1. Rastrear y mejorar KPIs operativos como disponibilidad, MTTR, MTTD, tasa de éxito de despliegue y recurrencia de incidentes.
  1. Colaborar con los equipos de seguridad y plataforma para garantizar que las mejores prácticas de fiabilidad, cumplimiento y seguridad operativa estén integradas en los sistemas y pipelines de despliegue.
  1. Explorar oportunidades para aprovechar la observabilidad impulsada por IA, la detección de anomalías y la automatización operativa para mejorar la fiabilidad del sistema y reducir el esfuerzo manual.

COMPETENCIAS BÁSICAS Y CUALIFICACIONES

  1. 4+ años de experiencia en SRE, ingeniería de software u operaciones de producción apoyando plataformas de comercio electrónico a gran escala.
  1. Experiencia práctica con sistemas distribuidos basados en Java/J2EE; la experiencia en React es una ventaja.
  1. Capacidad demostrada para diseñar y operar sistemas utilizando modelos de fiabilidad basados en SLO.
  1. Experiencia definiendo y midiendo SLIs, incluyendo disponibilidad, latencia, tasas de error, rendimiento y saturación.
  1. Buen entendimiento de tecnologías NoSQL y conceptos de RDBMS, con la capacidad de escribir y depurar consultas de bases de datos.
  1. Experiencia desplegando y operando servicios en plataformas en la nube como AWS, Azure, o Google Cloud Platform (GCP).
  1. Experiencia en observabilidad, APM y herramientas de caché como Dynatrace, Splunk, ELK, Akamai, Quantum Metric y Tealeaf.
  1. Sólida experiencia utilizando Jira para la gestión de backlog, seguimiento de incidentes, iniciativas de reducción de toil y coordinación inter-equipos.
  1. Capacidad para poseer servicios de forma independiente e impulsar iniciativas de fiabilidad de principio a fin.
  1. Sólidas habilidades de comunicación con la capacidad de influir en los equipos de ingeniería y producto.
  1. Experiencia participando en rotaciones de guardia y manejando incidentes críticos/de alta gravedad.

HABILIDADES DESEADAS

  1. Experiencia construyendo y operando arquitecturas de microservicios utilizando Spring Boot, Groovy, React, o tecnologías similares.
  1. Sólido entendimiento de pipelines de CI/CD, automatización de lanzamientos y prácticas de entrega progresiva.
  1. Experiencia trabajando en dominios de comercio electrónico como Catálogo, Datos de Clientes y Gestión de Pedidos.
  1. Familiaridad con plataformas de búsqueda incluyendo Endeca, Solr, Lucene y Elasticsearch.
  1. Dominio de scripting y automatización utilizando Python, Bash, Ruby, Perl o PowerShell.
  1. Experiencia con herramientas ITSM integradas con flujos de trabajo de Jira.
  1. Exposición a planificación de capacidad, pruebas de carga e ingeniería del caos.
  1. Experiencia con tecnologías de contenedorización y orquestación como Docker y Kubernetes (EKS, AKS o GKE).
  1. Familiaridad con herramientas de Infraestructura como Código (IaC) como Terraform, CloudFormation o Ansible.
  1. Entendimiento de KPIs operativos incluyendo disponibilidad, MTTR, MTTD, tasa de éxito de despliegue y métricas de recurrencia de incidentes.
  1. Experiencia realizando revisiones de preparación para producción e implementando procesos de gobernanza operativa.
  1. Capacidad para colaborar con equipos de ingeniería de seguridad y plataforma para asegurar las mejores prácticas de fiabilidad, cumplimiento y seguridad operativa.
  1. Exposición a operaciones asistidas por IA, detección de anomalías, alertas inteligentes y soluciones de remediación automatizada.
  1. Experiencia diseñando plataformas escalables y de autocuración y marcos de automatización para entornos cloud-native.

O’Reilly Auto Parts tiene un historial probado de crecimiento y estabilidad. O’Reilly está lleno de historias de éxito profesional y cree en una fuerte filosofía de "promoción interna", animándote a hacer crecer tu carrera junto con la organización.

Paquete Total de Compensación

  • Salarios Competitivos y Tiempo Libre Remunerado
  • Plan de Compra de Acciones y 401k con Contribuciones del Empleador desde el Primer Día
  • Seguro Médico, Dental y de Visión con Cuenta de Gastos Flexible (FSA) Opcional
  • Programas de Salud/Bienestar para Miembros del Equipo
  • Programas de Asistencia Educativa para Matrícula
  • Oportunidades de Crecimiento Profesional

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores