Lightning AI

Ingeniero/a de Infraestructura (GPU y Cómputo)

Python
Traducción automática. Consulta el original.

QUIÉNES SOMOS

Lightning AI es la empresa detrás de PyTorch Lightning. Fundada en 2019, construimos una plataforma integral para desarrollar, entrenar y desplegar sistemas de IA, diseñada para llevar las ideas desde la investigación a la producción con menos fricción.

A través de nuestra fusión con Voltage Park, una neocloud y Fábrica de IA, Lightning AI combina software centrado en el desarrollador con cómputo eficiente y a gran escala. Los equipos obtienen las herramientas que necesitan para la experimentación, el entrenamiento y la inferencia en producción, con seguridad, observabilidad y control integrados.

Servimos a investigadores individuales, startups y grandes empresas. Lightning AI opera a nivel mundial con oficinas en Nueva York, San Francisco, Seattle y Londres, y cuenta con el respaldo de Coatue, Index Ventures, Bain Capital Ventures y Firstminute.

LA FORMA EN QUE TRABAJAMOS

Las personas que prosperan aquí son constructoras que se mueven rápido, se comunican abiertamente, asumen responsabilidades y se mejoran continuamente a sí mismas, a sus equipos y a nuestra empresa. Esto es lo que implica en la práctica:

  1. Muévete con Urgencia: Nos movemos rápido, tomamos decisiones meditadas y mantenemos el impulso. Valoramos la acción sobre la perfección y aprendemos lanzando.
  1. Asume Responsabilidad: Somos responsables de los resultados, no solo de nuestro trabajo individual. Tomamos decisiones que impulsan la empresa hacia adelante y las llevamos a cabo.
  1. Comunícate Abiertamente: Nos comunicamos directamente, buscamos comprender y creamos claridad para los demás. Las conversaciones honestas nos ayudan a avanzar más rápido juntos.
  1. Construye Grandes Equipos: Lideramos con el ejemplo, empoderamos a otros y creamos equipos saludables donde las personas pueden hacer su mejor trabajo.
  1. Eleva el Nivel: Siempre nos estamos mejorando a nosotros mismos. Aprendemos de la retroalimentación, nos desafiamos constantemente a crecer y nos centramos en el trabajo que más importa.
  1. Piensa a Largo Plazo: Diseñamos para lo que sigue. Creamos sistemas escalables, simplificamos la complejidad y utilizamos IA y automatización para amplificar nuestro impacto.

LO QUE BUSCAMOS

Lightning AI busca un/a Ingeniero/a Senior de Infraestructura GPU y Cómputo con experiencia para unirse a nuestro equipo de Ingeniería de Infraestructura.

QUÉ HARÁS

En este puesto, ayudarás a poner en marcha, validar y operar infraestructura de cómputo bare-metal a gran escala, con un enfoque particular en sistemas habilitados para GPU. Trabajarás en la intersección de hardware, sistemas y software, encargándote del diagnóstico y validación de sistemas, desarrollando automatización, mejorando la fiabilidad y asegurando que los clústeres estén listos para soportar cargas de trabajo exigentes de IA/ML y HPC.

Desempeñarás un papel clave en la cualificación de GPU y a nivel de sistema, ejecutando entornos de validación y clústeres de prueba, y mejorando las herramientas y flujos de trabajo que soportan la puesta en marcha de la infraestructura a escala. Esto incluye la gestión y evolución de nuestro pipeline de imágenes junto con los sistemas de aprovisionamiento y validación para garantizar que nuestra infraestructura sea consistente, de alto rendimiento y fiable desde el primer día.

GESTIÓN Y VALIDACIÓN DE SISTEMAS

  1. Gestionar y evolucionar sistemas para la gestión de imágenes, el despliegue y la validación en infraestructura bare-metal.
  1. Ejecutar y mantener clústeres de prueba utilizados para la validación de sistemas, diagnóstico y puesta en marcha.
  1. Validar firmware, drivers e imágenes del sistema operativo en sistemas de cómputo y habilitados para GPU.
  1. Dar soporte a los esfuerzos de cualificación de hardware para plataformas de próxima generación.

DIAGNÓSTICO Y RENDIMIENTO DE GPU

  1. Gestionar flujos de trabajo de diagnóstico y validación de GPU en infraestructura a gran escala.
  1. Diagnosticar y resolver problemas complejos en capas de GPU, drivers, SO y hardware.
  1. Analizar el rendimiento del sistema y de la GPU utilizando herramientas como NVIDIA DCGM.
  1. Identificar patrones de fallo e impulsar mejoras en la estabilidad del sistema y la cobertura de validación.

AUTOMATIZACIÓN Y HERRAMIENTAS

  1. Construir y mantener automatización para el aprovisionamiento, la validación y la puesta en marcha de sistemas.
  1. Desarrollar herramientas y flujos de trabajo basados en Python o similares para mejorar la eficiencia y reducir la carga operativa manual.
  1. Mejorar la fiabilidad, repetibilidad y escalabilidad de los pipelines de imágenes y los sistemas de validación.

SISTEMAS Y OPERACIONES

  1. Gestionar y operar sistemas basados en Linux en entornos de producción y validación.
  1. Gestionar tecnología de virtualización.
  1. Dar soporte a flujos de trabajo de aprovisionamiento bare-metal, incluyendo sistemas basados en PXE e imágenes.
  1. Interactuar con sistemas de gestión de hardware (p. ej., IPMI, Redfish) para monitorización y depuración.

COLABORACIÓN INTERFUNCIONAL

  1. Colaborar con los equipos de Infraestructura, Hardware y Centro de Datos en la puesta en marcha y validación de sistemas.
  1. Colaborar con los equipos de plataforma y ML para asegurar que los sistemas cumplen los requisitos de las cargas de trabajo.
  1. Contribuir a las mejores prácticas para el aprovisionamiento, diagnóstico y gestión del ciclo de vida de la infraestructura.

COMPENSACIÓN

Este puesto puede ser completamente remoto dentro de EE. UU., o híbrido desde uno de nuestros centros de oficinas (NYC, SF, Seattle o Londres), con ocasionales reuniones de equipo y de empresa. No podemos ofrecer patrocinio de visado para este puesto en este momento.

Estamos comprometidos a ofrecer una compensación competitiva que refleje el valor que cada miembro del equipo aporta a nuestra misión. Las ofertas finales se basan en factores como la experiencia, las habilidades, la ubicación geográfica y las expectativas del puesto. Además del salario base, nuestro paquete de compensación total para los puestos elegibles incluye un bono discrecional, un componente de acciones significativo y beneficios integrales.

El rango salarial base anual previsto para este puesto es: $180,000—$220,000 USD

En Lightning AI, estamos comprometidos a fomentar un lugar de trabajo inclusivo y diverso. Creemos que los equipos diversos impulsan la innovación y crean mejores productos. Ofrecemos igualdad de oportunidades de empleo a todos los empleados y solicitantes sin distinción de raza, color, religión, género, orientación sexual, identidad de género, origen nacional, edad, discapacidad, condición de veterano o cualquier otra característica protegida. Estamos dedicados a construir una cultura donde todos puedan prosperar y contribuir a su máximo potencial.

QUÉ NECESITARÁS

CUALIFICACIONES REQUERIDAS

  1. Más de 5 años de experiencia en ingeniería de infraestructura, ingeniería de sistemas o roles relacionados.
  1. Sólida experiencia en sistemas Linux en entornos de producción.
  1. Experiencia práctica con sistemas habilitados para GPU y herramientas como NVIDIA DCGM.
  1. Familiaridad con el aprovisionamiento bare-metal y los flujos de trabajo de puesta en marcha de sistemas.
  1. Dominio de Python u otros lenguajes de scripting/programación similares para la automatización.
  1. Capacidad para depurar problemas complejos en hardware, SO, GPU y software del sistema.

EXPERIENCIA IDEAL

  1. Experiencia con interconexiones de alto rendimiento (p. ej., InfiniBand, NVLink).
  1. Experiencia con entornos de arranque PXE, sistemas LiveCD o flujos de trabajo de aprovisionamiento basados en imágenes.
  1. Experiencia con interfaces de gestión de hardware como iDRAC, IPMI o Redfish.
  1. Experiencia en operaciones de centros de datos, incluyendo el trabajo con hardware físico.
  1. Experiencia en el soporte de cargas de trabajo de IA/ML o HPC a escala.
  1. Experiencia con frameworks de validación de GPU o procesos de cualificación de hardware a gran escala.

BENEFICIOS Y VENTAJAS

Ofrecemos un paquete de beneficios integral y competitivo diseñado para apoyar la salud, el bienestar y el éxito a largo plazo de nuestros empleados:

  • Cobertura Sanitaria Integral: Cobertura médica, dental y de visión para empleados y dependientes elegibles.
  • Acciones Significativas: RSUs que otorgan a los empleados una participación en el éxito a largo plazo de la empresa.
  • Ahorro para la Jubilación: Contribución de 401(k) (EE. UU.) y contribuciones a planes de pensiones (Reino Unido).
  • Tiempo Libre Flexible: PTO ilimitado, días festivos de la empresa y días festivos flexibles para apoyar el equilibrio entre la vida laboral y personal.
  • Vacaciones de Invierno para Toda la Empresa: Dos semanas de cierre de la empresa cada invierno para desconectar y recargar.
  • Permiso Parental y Familiar Pagado: Permiso pagado para apoyar a usted y a su familia en los momentos importantes de la vida.
  • Desarrollo Profesional: Asignación anual de aprendizaje y desarrollo para apoyar su crecimiento profesional.
  • Beneficios de Bienestar: Subsidios de bienestar y para trabajar desde casa para apoyar su bienestar físico y mental.
  • Programa de Sabático: Cuatro semanas de permiso sabático pagado después de cuatro años de servicio.
  • Trabajo Flexible: Horarios flexibles y un modelo de trabajo híbrido para nuestros equipos basados en oficina.
  • Comidas en la Oficina: Comidas gratuitas en nuestros centros de oficinas.

Los beneficios pueden variar según la ubicación, el equipo y el puesto.

Más oportunidades con un solo perfil

¿Quieres optar a más puestos sin repetir todo el proceso? Crea tu perfil para que te encuentren las empresas que usan Nort.

Crear mi perfil

Tu próximo empleoya está buscándote.

Nort

Plataforma de reclutamiento inverso para programadores