Lightning AI

Ingeniero/a Sénior de Operaciones de Infraestructura

PythonKubernetesGo
Traducción automática. Consulta el original.

QUIÉNES SOMOS

Lightning AI es la empresa detrás de PyTorch Lightning. Fundada en 2019, creamos una plataforma integral para desarrollar, entrenar y desplegar sistemas de IA, diseñada para llevar las ideas desde la investigación a la producción con menos fricción.

A través de nuestra fusión con Voltage Park, una fábrica de IA y neocloud, Lightning AI combina software centrado en el desarrollador con computación a gran escala y eficiente en costes. Los equipos obtienen las herramientas que necesitan para experimentación, entrenamiento e inferencia en producción, con seguridad, observabilidad y control integrados.

Servimos a investigadores individuales, startups y grandes empresas. Lightning AI opera a nivel mundial con oficinas en Nueva York, San Francisco, Seattle y Londres, y cuenta con el respaldo de Coatue, Index Ventures, Bain Capital Ventures y Firstminute.

LA FORMA EN QUE TRABAJAMOS

Las personas que prosperan aquí son constructores que se mueven rápido, se comunican abiertamente, asumen responsabilidades y se mejoran continuamente a sí mismos, a sus equipos y a nuestra empresa. Esto es lo que implica en la práctica: *

  1. Actuar con Urgencia: Nos movemos rápido, tomamos decisiones meditadas y mantenemos el impulso. Valoramos la acción sobre la perfección y aprendemos publicando. *
  1. Asumir Responsabilidades: Somos responsables de los resultados, no solo de nuestro trabajo individual. Tomamos decisiones que impulsan la empresa hacia delante y las llevamos a cabo. *
  1. Comunicarse Abiertamente: Nos comunicamos directamente, buscamos comprender y aportamos claridad a los demás. Las conversaciones honestas nos ayudan a avanzar más rápido juntos. *
  1. Construir Grandes Equipos: Lideramos con el ejemplo, empoderamos a otros y creamos equipos saludables donde las personas pueden hacer su mejor trabajo. *
  1. Elevar el Nivel: Siempre nos estamos mejorando a nosotros mismos. Aprendemos de la retroalimentación, nos desafiamos constantemente a crecer y nos centramos en el trabajo que más importa. *
  1. Pensar a Largo Plazo: Diseñamos para el futuro. Creamos sistemas escalables, simplificamos la complejidad y utilizamos la IA y la automatización para amplificar nuestro impacto.

LO QUE BUSCAMOS

Lightning AI busca un/a Ingeniero/a Sénior de Operaciones de Infraestructura experimentado/a para ayudar a operar y escalar la infraestructura detrás de una de las flotas de GPU más grandes del mundo.

Nuestro equipo de Operaciones de Infraestructura se encuentra en el centro de la fiabilidad de producción para la infraestructura de IA de Lightning. El equipo trabaja con Linux, servidores bare-metal, GPUs, redes, almacenamiento, aprovisionamiento y orquestación de clústeres, sirviendo como un punto de escalada técnica crítico cuando surgen problemas complejos de infraestructura.

Este no es un puesto tradicional de administración de sistemas o de operaciones basado en tickets. Solucionarás problemas en toda la pila de infraestructura, serás responsable de los problemas hasta su resolución e identificarás oportunidades para automatizar el trabajo recurrente. También contribuirás a proyectos de ingeniería a más largo plazo que mejoren la fiabilidad, estandaricen las operaciones y permitan que nuestra infraestructura escale de manera eficiente.

Buscamos un/a generalista de infraestructura que se sienta cómodo/a profundizando cuando algo falla, pero que también dé un paso atrás y pregunte cómo podemos evitar que el mismo problema vuelva a ocurrir.

Este puesto puede ser completamente remoto dentro de EE. UU., o híbrido desde uno de nuestros centros de oficinas en EE. UU. (Nueva York, San Francisco o Seattle) con ocasionales reuniones de equipo y de empresa. No podemos proporcionar patrocinio de visa para este puesto en este momento.

QUÉ HARÁS *

  1. Operar y solucionar problemas de infraestructura GPU y bare-metal a gran escala en Linux, computación, redes, almacenamiento y orquestación de clústeres. *
  1. Servir como punto de escalada técnica para problemas complejos de infraestructura, dirigiendo los problemas desde la investigación inicial hasta la resolución y el análisis de causa raíz. *
  1. Ser responsable de los flujos de trabajo operativos en todo el ciclo de vida de la infraestructura, incluido el aprovisionamiento, la configuración, la validación, el mantenimiento, la remediación y la desmantelación. *
  1. Crear automatización y herramientas internas que eliminen el trabajo operativo repetitivo y permitan que la flota de infraestructura escale de manera eficiente. *
  1. Identificar modos de fallo recurrentes y colaborar con Ingeniería de Infraestructura para construir sistemas más fiables, repetibles y automatizados. *
  1. Mejorar los procesos de aprovisionamiento, monitorización, diagnóstico y operaciones en una huella de infraestructura en rápido crecimiento. *
  1. Colaborar estrechamente con Ingeniería de Infraestructura, Ingeniería de Redes, Operaciones de Centros de Datos, Experiencia del Cliente e Ingeniería de Plataforma para resolver problemas que cruzan límites de equipos o sistemas. *
  1. Participar en una rotación de guardia primaria/secundaria distribuida dando soporte a la infraestructura de producción.

QUÉ NECESITARÁS

CALIFICACIONES REQUERIDAS *

  1. Sólida experiencia operando y solucionando problemas de infraestructura de producción basada en Linux a escala. *
  1. Experiencia en la solución de problemas de infraestructura complejos en computación, redes, almacenamiento y sistemas operativos. *
  1. Sólidas habilidades de automatización y scripting utilizando Python, Go, Bash, Ansible, o herramientas similares. *
  1. Experiencia con Kubernetes, Slurm u otros sistemas de orquestación de clústeres y cargas de trabajo. *
  1. Experiencia utilizando sistemas de monitorización, observabilidad y telemetría para diagnosticar y solucionar problemas de infraestructura de producción. *
  1. Sólidos fundamentos de sistemas y redes, con un historial de ser responsable de problemas de producción hasta su resolución. *
  1. Comodidad trabajando en entornos ambiguos y colaborando con equipos de ingeniería, operaciones y atención al cliente.

DESEABLE *

  1. Experiencia en la solución de problemas, aprovisionamiento u operación de infraestructura de servidores bare-metal. *
  1. Experiencia operando o solucionando problemas de GPU, HPC u otra infraestructura de computación de alto rendimiento. *
  1. Familiaridad con GPUs NVIDIA, DCGM, InfiniBand, RoCE/RDMA, NVLink o redes de centros de datos de alta velocidad. *
  1. Experiencia con tecnologías de gestión y aprovisionamiento de hardware como PXE, BMC, IPMI, Redfish o iDRAC. *
  1. Experiencia con sistemas de almacenamiento distribuidos o de alto rendimiento como VAST, Ceph, GPFS o WEKA. *
  1. Experiencia con flujos de trabajo de infraestructura como código, gestión de configuración o GitOps.

COMPENSACIÓN

Estamos comprometidos a ofrecer una compensación competitiva que refleje el valor que cada miembro del equipo aporta a nuestra misión. Las ofertas finales se basan en factores como la experiencia, las habilidades, la ubicación geográfica y las expectativas del puesto. Además del salario base, nuestro paquete total de recompensas para los puestos elegibles incluye un bono discrecional, un componente de acciones significativo y beneficios integrales.

El rango salarial base anual previsto para este puesto es: $175,000—$200,000 USD

En Lightning AI, estamos comprometidos a fomentar un lugar de trabajo inclusivo y diverso. Creemos que los equipos diversos impulsan la innovación y crean mejores productos. Ofrecemos igualdad de oportunidades de empleo a todos los empleados y candidatos sin distinción de raza, color, religión, género, orientación sexual, identidad de género, origen nacional, edad, discapacidad, estado de veterano o cualquier otra característica protegida. Estamos dedicados a construir una cultura donde todos puedan prosperar y contribuir a su máximo potencial.

BENEFICIOS Y VENTAJAS

Ofrecemos un paquete de beneficios integral y competitivo diseñado para apoyar la salud, el bienestar y el éxito a largo plazo de nuestros empleados: *

  • Cobertura Sanitaria Integral: Cobertura médica, dental y de visión para empleados y dependientes elegibles. *
  • Acciones Significativas: RSUs que otorgan a los empleados una participación en el éxito a largo plazo de la empresa. *
  • Ahorro para la Jubilación: Cobertura de 401(k) (EE. UU.) y contribuciones a planes de pensiones (Reino Unido). *
  • Tiempo Libre Flexible: PTO ilimitado, días festivos de la empresa y días festivos flexibles para apoyar el equilibrio entre la vida laboral y personal. *
  • Vacaciones de Invierno para Toda la Empresa: Dos semanas de cierre de la empresa cada invierno para desconectar y recargar. *
  • Permiso Parental y Familiar Pagado: Permiso pagado para apoyarte a ti y a tu familia en los momentos importantes de la vida. *
  • Desarrollo Profesional: Asignación anual de aprendizaje y desarrollo para apoyar tu crecimiento profesional. *
  • Beneficios de Bienestar: Subsidios de bienestar y para el trabajo desde casa para apoyar tu bienestar físico y mental. *
  • Programa de Sabático: Cuatro semanas de permiso sabático pagado después de cuatro años de servicio. *
  • Trabajo Flexible: Horarios flexibles y un modelo de trabajo híbrido para nuestros equipos basados en oficina. *
  • Comidas en la Oficina: Comidas gratuitas en nuestros centros de oficina.

Los beneficios pueden variar según la ubicación, el equipo y el puesto.

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores