Arqiva
Lightning AI
Ingeniero/a de Infraestructura (GPU y Cómputo)
QUIÉNES SOMOS
Lightning AI es la empresa detrás de PyTorch Lightning. Fundada en 2019, construimos una plataforma integral para desarrollar, entrenar y desplegar sistemas de IA, diseñada para llevar las ideas desde la investigación a la producción con menos fricción.
A través de nuestra fusión con Voltage Park, una neocloud y Fábrica de IA, Lightning AI combina software centrado en el desarrollador con cómputo eficiente y a gran escala. Los equipos obtienen las herramientas que necesitan para la experimentación, el entrenamiento y la inferencia en producción, con seguridad, observabilidad y control integrados.
Servimos a investigadores individuales, startups y grandes empresas. Lightning AI opera a nivel mundial con oficinas en Nueva York, San Francisco, Seattle y Londres, y cuenta con el respaldo de Coatue, Index Ventures, Bain Capital Ventures y Firstminute.
LA FORMA EN QUE TRABAJAMOS
Las personas que prosperan aquí son constructoras que se mueven rápido, se comunican abiertamente, asumen responsabilidades y se mejoran continuamente a sí mismas, a sus equipos y a nuestra empresa. Esto es lo que implica en la práctica:
- Muévete con Urgencia: Nos movemos rápido, tomamos decisiones meditadas y mantenemos el impulso. Valoramos la acción sobre la perfección y aprendemos lanzando.
- Asume Responsabilidad: Somos responsables de los resultados, no solo de nuestro trabajo individual. Tomamos decisiones que impulsan la empresa hacia adelante y las llevamos a cabo.
- Comunícate Abiertamente: Nos comunicamos directamente, buscamos comprender y creamos claridad para los demás. Las conversaciones honestas nos ayudan a avanzar más rápido juntos.
- Construye Grandes Equipos: Lideramos con el ejemplo, empoderamos a otros y creamos equipos saludables donde las personas pueden hacer su mejor trabajo.
- Eleva el Nivel: Siempre nos estamos mejorando a nosotros mismos. Aprendemos de la retroalimentación, nos desafiamos constantemente a crecer y nos centramos en el trabajo que más importa.
- Piensa a Largo Plazo: Diseñamos para lo que sigue. Creamos sistemas escalables, simplificamos la complejidad y utilizamos IA y automatización para amplificar nuestro impacto.
LO QUE BUSCAMOS
Lightning AI busca un/a Ingeniero/a Senior de Infraestructura GPU y Cómputo con experiencia para unirse a nuestro equipo de Ingeniería de Infraestructura.
QUÉ HARÁS
En este puesto, ayudarás a poner en marcha, validar y operar infraestructura de cómputo bare-metal a gran escala, con un enfoque particular en sistemas habilitados para GPU. Trabajarás en la intersección de hardware, sistemas y software, encargándote del diagnóstico y validación de sistemas, desarrollando automatización, mejorando la fiabilidad y asegurando que los clústeres estén listos para soportar cargas de trabajo exigentes de IA/ML y HPC.
Desempeñarás un papel clave en la cualificación de GPU y a nivel de sistema, ejecutando entornos de validación y clústeres de prueba, y mejorando las herramientas y flujos de trabajo que soportan la puesta en marcha de la infraestructura a escala. Esto incluye la gestión y evolución de nuestro pipeline de imágenes junto con los sistemas de aprovisionamiento y validación para garantizar que nuestra infraestructura sea consistente, de alto rendimiento y fiable desde el primer día.
GESTIÓN Y VALIDACIÓN DE SISTEMAS
- Gestionar y evolucionar sistemas para la gestión de imágenes, el despliegue y la validación en infraestructura bare-metal.
- Ejecutar y mantener clústeres de prueba utilizados para la validación de sistemas, diagnóstico y puesta en marcha.
- Validar firmware, drivers e imágenes del sistema operativo en sistemas de cómputo y habilitados para GPU.
- Dar soporte a los esfuerzos de cualificación de hardware para plataformas de próxima generación.
DIAGNÓSTICO Y RENDIMIENTO DE GPU
- Gestionar flujos de trabajo de diagnóstico y validación de GPU en infraestructura a gran escala.
- Diagnosticar y resolver problemas complejos en capas de GPU, drivers, SO y hardware.
- Analizar el rendimiento del sistema y de la GPU utilizando herramientas como NVIDIA DCGM.
- Identificar patrones de fallo e impulsar mejoras en la estabilidad del sistema y la cobertura de validación.
AUTOMATIZACIÓN Y HERRAMIENTAS
- Construir y mantener automatización para el aprovisionamiento, la validación y la puesta en marcha de sistemas.
- Desarrollar herramientas y flujos de trabajo basados en Python o similares para mejorar la eficiencia y reducir la carga operativa manual.
- Mejorar la fiabilidad, repetibilidad y escalabilidad de los pipelines de imágenes y los sistemas de validación.
SISTEMAS Y OPERACIONES
- Gestionar y operar sistemas basados en Linux en entornos de producción y validación.
- Gestionar tecnología de virtualización.
- Dar soporte a flujos de trabajo de aprovisionamiento bare-metal, incluyendo sistemas basados en PXE e imágenes.
- Interactuar con sistemas de gestión de hardware (p. ej., IPMI, Redfish) para monitorización y depuración.
COLABORACIÓN INTERFUNCIONAL
- Colaborar con los equipos de Infraestructura, Hardware y Centro de Datos en la puesta en marcha y validación de sistemas.
- Colaborar con los equipos de plataforma y ML para asegurar que los sistemas cumplen los requisitos de las cargas de trabajo.
- Contribuir a las mejores prácticas para el aprovisionamiento, diagnóstico y gestión del ciclo de vida de la infraestructura.
COMPENSACIÓN
Este puesto puede ser completamente remoto dentro de EE. UU., o híbrido desde uno de nuestros centros de oficinas (NYC, SF, Seattle o Londres), con ocasionales reuniones de equipo y de empresa. No podemos ofrecer patrocinio de visado para este puesto en este momento.
Estamos comprometidos a ofrecer una compensación competitiva que refleje el valor que cada miembro del equipo aporta a nuestra misión. Las ofertas finales se basan en factores como la experiencia, las habilidades, la ubicación geográfica y las expectativas del puesto. Además del salario base, nuestro paquete de compensación total para los puestos elegibles incluye un bono discrecional, un componente de acciones significativo y beneficios integrales.
El rango salarial base anual previsto para este puesto es: $180,000—$220,000 USD
En Lightning AI, estamos comprometidos a fomentar un lugar de trabajo inclusivo y diverso. Creemos que los equipos diversos impulsan la innovación y crean mejores productos. Ofrecemos igualdad de oportunidades de empleo a todos los empleados y solicitantes sin distinción de raza, color, religión, género, orientación sexual, identidad de género, origen nacional, edad, discapacidad, condición de veterano o cualquier otra característica protegida. Estamos dedicados a construir una cultura donde todos puedan prosperar y contribuir a su máximo potencial.
QUÉ NECESITARÁS
CUALIFICACIONES REQUERIDAS
- Más de 5 años de experiencia en ingeniería de infraestructura, ingeniería de sistemas o roles relacionados.
- Sólida experiencia en sistemas Linux en entornos de producción.
- Experiencia práctica con sistemas habilitados para GPU y herramientas como NVIDIA DCGM.
- Familiaridad con el aprovisionamiento bare-metal y los flujos de trabajo de puesta en marcha de sistemas.
- Dominio de Python u otros lenguajes de scripting/programación similares para la automatización.
- Capacidad para depurar problemas complejos en hardware, SO, GPU y software del sistema.
EXPERIENCIA IDEAL
- Experiencia con interconexiones de alto rendimiento (p. ej., InfiniBand, NVLink).
- Experiencia con entornos de arranque PXE, sistemas LiveCD o flujos de trabajo de aprovisionamiento basados en imágenes.
- Experiencia con interfaces de gestión de hardware como iDRAC, IPMI o Redfish.
- Experiencia en operaciones de centros de datos, incluyendo el trabajo con hardware físico.
- Experiencia en el soporte de cargas de trabajo de IA/ML o HPC a escala.
- Experiencia con frameworks de validación de GPU o procesos de cualificación de hardware a gran escala.
BENEFICIOS Y VENTAJAS
Ofrecemos un paquete de beneficios integral y competitivo diseñado para apoyar la salud, el bienestar y el éxito a largo plazo de nuestros empleados:
- Cobertura Sanitaria Integral: Cobertura médica, dental y de visión para empleados y dependientes elegibles.
- Acciones Significativas: RSUs que otorgan a los empleados una participación en el éxito a largo plazo de la empresa.
- Ahorro para la Jubilación: Contribución de 401(k) (EE. UU.) y contribuciones a planes de pensiones (Reino Unido).
- Tiempo Libre Flexible: PTO ilimitado, días festivos de la empresa y días festivos flexibles para apoyar el equilibrio entre la vida laboral y personal.
- Vacaciones de Invierno para Toda la Empresa: Dos semanas de cierre de la empresa cada invierno para desconectar y recargar.
- Permiso Parental y Familiar Pagado: Permiso pagado para apoyar a usted y a su familia en los momentos importantes de la vida.
- Desarrollo Profesional: Asignación anual de aprendizaje y desarrollo para apoyar su crecimiento profesional.
- Beneficios de Bienestar: Subsidios de bienestar y para trabajar desde casa para apoyar su bienestar físico y mental.
- Programa de Sabático: Cuatro semanas de permiso sabático pagado después de cuatro años de servicio.
- Trabajo Flexible: Horarios flexibles y un modelo de trabajo híbrido para nuestros equipos basados en oficina.
- Comidas en la Oficina: Comidas gratuitas en nuestros centros de oficinas.
Los beneficios pueden variar según la ubicación, el equipo y el puesto.
