TensorWave

Senior Staff Infrastructure Engineer – Kubernetes Platform

Kubernetes
Traducción automática. Consulta el original.

Acerca de nosotros

TensorWave

Nuestra misión es simple: ofrecer computación de IA fluida, segura, fiable y resiliente a escala. Hemos creado una plataforma en la nube versátil que elimina las barreras de infraestructura, permitiendo a los desarrolladores centrarse en la innovación en lugar de luchar contra su stack. Porque la IA revolucionaria debe avanzar a la velocidad de las ideas, no de la infraestructura.

Acerca del

Puesto Buscamos un Ingeniero Staff de Infraestructura de Plataforma Kubernetes para unirse a nuestro equipo durante una emocionante fase de crecimiento. En este puesto, serás responsable de la propiedad del diseño, la evolución y la fiabilidad operativa de nuestra arquitectura de plano de control Kubernetes, trabajando en estrecha colaboración con socios multifuncionales para apoyar los objetivos de negocio, al tiempo que mantenemos nuestros estándares de excelencia, colaboración e impacto.

Qué harás

Arquitectura y Estrategia de Plataforma

  1. Diseñar y evolucionar la arquitectura del plano de control Kubernetes en todas las regiones
  1. Definir e implementar modelos de clústeres multi-inquilino, incluyendo planos de control compartidos y enfoques de clústeres virtuales (por ejemplo, vcluster, Kamaji)
  1. Impulsar la transición de clústeres independientes a modelos de plataforma gestionados regionalmente
  1. Definir estándares para límites de aislamiento, segmentación de recursos y aplicación de políticas

Propiedad y Operaciones de Plataforma

  1. Ser propietario de la fiabilidad y el comportamiento de las plataformas Kubernetes en producción
  1. Participar en la rotación de guardias y liderar la respuesta a incidentes
  1. Diagnosticar y resolver la inestabilidad del plano de control, la saturación del servidor API, la programación y los problemas de contención de recursos
  1. Garantizar la gestión coherente del ciclo de vida en todos los clústeres: aprovisionamiento, actualizaciones, escalado

Escalado Multi-Región

  1. Diseñar e implementar estrategias para el escalado regional y despliegues de clústeres en múltiples centros de datos
  1. Garantizar un comportamiento y una fiabilidad coherentes en todos los entornos
  1. Definir la topología de clústeres y las estrategias de dominios de fallo

Integración de Redes y Plano de Datos

  1. Diseñar arquitecturas de entrada y salida a nivel de clúster y a nivel regional
  1. Solucionar problemas y optimizar la red de pod a pod, los flujos de tráfico norte-sur, el comportamiento de CNI (se prefiere Cilium)
  1. Colaborar con ingeniería de redes en la integración de redes de alto rendimiento

Observabilidad y Fiabilidad

  1. Mejorar la observabilidad en los componentes del plano de control, la salud y el rendimiento del clúster
  1. Definir e implementar estrategias de resiliencia alineadas con los objetivos de la plataforma
  1. Liderar el análisis de causa raíz de incidentes en producción

Colaboración Interdepartamental

  1. Trabajar en estrecha colaboración con ingenieros de DevOps (automatización y CI/CD) y equipos de Infraestructura (cómputo, almacenamiento, redes)
  1. Alinear el diseño de la plataforma Kubernetes con las capacidades de la infraestructura subyacente

Quién eres

Cualificaciones Requeridas

  1. Más de 7 años de experiencia en ingeniería de infraestructura, plataformas o sistemas distribuidos
  1. Experiencia profunda operando Kubernetes a escala en entornos de producción
  1. Se prefiere encarecidamente experiencia en CSP, hiperescala o entornos de gran escala equivalentes
  1. Experiencia demostrada escalando Kubernetes en:
  1. Múltiples clústeres
  1. Múltiples regiones o centros de datos
  1. Sólida comprensión de los componentes internos de Kubernetes:
  1. Servidor API
  1. Planificador
  1. Gestor de controladores
  1. etcd
  1. Experiencia diseñando o evolucionando:
  1. Arquitecturas de plano de control
  1. Modelos de clústeres multi-inquilino

Profundidad Técnica

  1. Sólida experiencia en sistemas Linux
  1. Profunda capacidad de resolución de problemas en:
  1. Kubernetes
  1. Runtime de contenedores
  1. Stack de redes
  1. Experiencia con plugins CNI (se prefiere Cilium)
  1. Sólida comprensión de:
  1. Patrones de red y tráfico
  1. Aislamiento de recursos y programación

Cualificaciones Preferidas

  1. Experiencia con tecnologías de clústeres virtuales (vcluster, Kamaji o similar)
  1. Experiencia dando soporte a cargas de trabajo de GPU en Kubernetes
  1. Familiaridad con:
  1. Programación consciente de NUMA
  1. Cargas de trabajo conscientes de la topología
  1. Conocimiento de entornos de red RDMA y de alto rendimiento
  1. Experiencia con plataformas de observabilidad (Prometheus, Grafana, etc.)

Qué ofrecemos

  • Opciones sobre acciones
  • Seguro médico, dental y de visión pagado al 100% para empleados
  • Contribuciones de la empresa a la Cuenta de Ahorros para la Salud
  • Seguro de Incapacidad a Corto y Largo Plazo pagado al 100% para empleados
  • Opciones de seguro de vida y suplementario voluntario
  • Otras opciones de seguro, como seguro para mascotas y legal
  • Varios beneficios suplementarios de salud, como citas de telemedicina con descuento y apoyo para enfermedades graves
  • Cuenta de Gasto Flexible
  • 401(k)
  • Programa de Asistencia al Empleado
  • PTO flexible
  • Días festivos pagados
  • Permiso parental
  • Otras ventajas en la oficina

Igualdad de Oportunidades de Empleo

TensorWave es un Empleador con Igualdad de Oportunidades. Celebramos la diversidad y estamos comprometidos a crear un entorno inclusivo para todos los empleados. No discriminamos por ningún motivo protegido según la ley aplicable.

Adaptaciones Razonables

TensorWave proporciona adaptaciones razonables de acuerdo con las leyes aplicables. Si necesita una adaptación durante el proceso de contratación, póngase en contacto con [email protected].

Elegibilidad de Empleo

Todas las ofertas de empleo están sujetas a la verificación de identidad y autorización para trabajar en los Estados Unidos, según lo exija la ley.

Verificación de Antecedentes

Donde lo permita la ley, el empleo puede estar sujeto a la finalización satisfactoria de una verificación de antecedentes relacionada con el puesto.

Aviso de Privacidad de Datos

Al enviar una solicitud, usted reconoce que TensorWave puede recopilar, utilizar y retener su información personal para fines de reclutamiento y empleo de acuerdo con las leyes de privacidad de datos aplicables.

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores