Tripadvisor
Lightning AI
Ingénieur Infrastructure (Stockage)
QUI SOMMES-NOUS
Lightning AI est la société derrière PyTorch Lightning. Fondée en 2019, nous construisons une plateforme de bout en bout pour le développement, l'entraînement et le déploiement de systèmes d'IA, conçue pour transformer les idées de la recherche à la production avec moins de friction. Grâce à notre fusion avec Voltage Park, un neocloud et une usine d'IA, Lightning AI combine un logiciel axé sur les développeurs avec une puissance de calcul à grande échelle et économique. Les équipes disposent des outils nécessaires pour l'expérimentation, l'entraînement et l'inférence en production, avec sécurité, observabilité et contrôle intégrés. Nous servons des chercheurs indépendants, des startups et de grandes entreprises. Lightning AI opère à l'échelle mondiale avec des bureaux à New York, San Francisco, Seattle et Londres, et est soutenu par Coatue, Index Ventures, Bain Capital Ventures et Firstminute.
NOTRE FAÇON DE TRAVAILLER
Les personnes qui réussissent ici sont des bâtisseurs qui agissent vite, communiquent ouvertement, prennent des responsabilités et s'améliorent continuellement eux-mêmes, leurs équipes et notre entreprise. Voici ce que cela implique concrètement :
- Agir avec Urgence : Nous avançons rapidement, prenons des décisions réfléchies et maintenons l'élan. Nous privilégions l'action à la perfection et apprenons en livrant.
- Prendre des Responsabilités : Nous sommes responsables des résultats, pas seulement de notre travail individuel. Nous prenons des décisions qui font avancer l'entreprise et nous assurons qu'elles sont suivies d'effet.
- Communiquer Ouvertement : Nous communiquons directement, cherchons à comprendre et apportons de la clarté aux autres. Des conversations honnêtes nous aident à avancer plus vite ensemble.
- Construire de Grandes Équipes : Nous donnons l'exemple, responsabilisons les autres et créons des équipes saines où les gens peuvent donner le meilleur d'eux-mêmes.
- Relever la Barre : Nous nous améliorons constamment. Nous apprenons des retours, nous nous mettons continuellement au défi de grandir et nous nous concentrons sur le travail qui compte le plus.
- Penser à Long Terme : Nous concevons pour l'avenir. Nous créons des systèmes évolutifs, simplifions la complexité et utilisons l'IA et l'automatisation pour amplifier notre impact.
CE QUE NOUS RECHERCHONS
Lightning AI recherche un Ingénieur Infrastructure Stockage pour rejoindre notre équipe d'Ingénierie Infrastructure.
CE QUE VOUS FEREZ
Dans ce rôle, vous vous concentrerez sur la construction et l'exploitation des systèmes de stockage qui alimentent les charges de travail d'entraînement, d'inférence et de HPC à grande échelle en IA/ML. Vous travaillerez à l'intersection du logiciel, du matériel et des opérations, en développant l'automatisation, en améliorant la fiabilité et en faisant évoluer les systèmes de stockage distribués sur notre infrastructure bare-metal.
Vous contribuerez à la gestion du plan de données de notre infrastructure de stockage, en supportant un accès aux données à haut débit et à faible latence pour certaines des charges de travail d'IA les plus exigeantes. Vous jouerez un rôle clé dans la gestion et l'évolution de notre pile de stockage (y compris VAST et les systèmes compatibles S3 comme Ceph), en garantissant la performance, la fiabilité et l'efficacité à grande échelle.
SYSTÈMES DE STOCKAGE ET INFRASTRUCTURE
- Exploiter et faire évoluer les systèmes de stockage distribués, y compris VAST et le stockage objet compatible S3 (par exemple, Ceph)
- Améliorer la performance, la fiabilité et l'efficacité des systèmes de stockage supportant les charges de travail IA/ML à grande échelle
- Dépanner des problèmes complexes de stockage et de chemin de données à travers les couches matérielles et logicielles
- Optimiser la performance du stockage pour supporter les charges de travail d'entraînement et d'inférence IA à haut débit et faible latence
AUTOMATISATION ET OUTILLAGE
- Construire et maintenir l'automatisation pour le provisionnement, la gestion et la surveillance de l'infrastructure de stockage
- Développer des outils et des flux de travail basés sur Python pour réduire la charge opérationnelle manuelle
- Améliorer la gestion du cycle de vie des clusters de stockage, du déploiement à la maintenance et à la mise à l'échelle
SYSTÈMES ET OPÉRATIONS
- Gérer et exploiter les systèmes basés sur Linux en production, y compris les environnements bare-metal
- Collaborer avec les équipes d'infrastructure et de data center pour la mise en service, les mises à niveau et la résolution des problèmes matériels
- Soutenir la planification de la capacité, le suivi de l'utilisation et la prévision pour les systèmes de stockage
- Utiliser la surveillance et la télémétrie pour diagnostiquer les problèmes et améliorer la performance et la fiabilité du système
COLLABORATION INTERFONCTIONNELLE
- Travailler en étroite collaboration avec les équipes d'Ingénierie Infrastructure, d'Ingénierie Réseau et de Plateforme pour intégrer le stockage dans la plateforme globale
- Contribuer aux discussions de conception concernant les nouveaux déploiements d'infrastructure et les stratégies de mise à l'échelle
- Aider à définir les meilleures pratiques pour l'exploitation des systèmes de stockage dans les environnements de calcul haute performance
Ce poste peut être entièrement à distance aux États-Unis, ou en mode hybride depuis l'un de nos hubs (NYC, SF, Seattle ou Londres), avec des déplacements occasionnels pour des séminaires d'équipe et d'entreprise. Nous ne sommes pas en mesure de fournir de parrainage de visa pour ce poste actuellement.
Chez Lightning AI, nous nous engageons à favoriser un environnement de travail inclusif et diversifié. Nous croyons que les équipes diversifiées stimulent l'innovation et créent de meilleurs produits. Nous offrons des opportunités d'emploi égales à tous les employés et candidats, sans distinction de race, de couleur, de religion, de sexe, d'orientation sexuelle, d'identité de genre, d'origine nationale, d'âge, de handicap, de statut d'ancien combattant ou de toute autre caractéristique protégée. Nous nous engageons à bâtir une culture où chacun peut s'épanouir et contribuer pleinement.
CE DONT VOUS AVEZ BESOIN
QUALIFICATIONS REQUISES
- 5+ années d'expérience en ingénierie d'infrastructure, ingénierie système ou rôles similaires
- Expérience pratique de l'exploitation de systèmes de stockage distribués (par exemple, VAST, Ceph ou similaires)
- Solide expérience des systèmes Linux en environnements de production
- Maîtrise de Python ou de langages de script/programmation similaires pour l'automatisation
- Expérience de travail avec l'infrastructure bare-metal et les systèmes orientés matériel
- Capacité à déboguer des problèmes complexes à travers les frontières du système (stockage, OS, matériel, réseau)
- Expérience des protocoles de réseau de stockage (par exemple, NFS ou similaire)
- Expérience de la planification de la capacité, de la surveillance et de l'optimisation des performances
EXPÉRIENCE IDÉALE
- Expérience des systèmes de stockage VAST en environnements de production
- Expérience de l'exploitation du stockage objet compatible S3 à grande échelle
- Expérience des opérations de centre de données, y compris le travail avec du matériel physique
- Connaissance des charges de travail IA/ML ou HPC et de leurs exigences en matière de stockage
- Expérience dans les systèmes distribués haute performance ou à faible latence
- Connaissance des technologies de transfert de données haute performance (par exemple, RDMA, GPU Direct Storage)
- Expérience du support des charges de travail basées sur GPU ou des clusters de calcul à grande échelle
RÉMUNÉRATION
Nous nous engageons à offrir une rémunération compétitive qui reflète la valeur que chaque membre de l'équipe apporte à notre mission. Les offres finales sont basées sur des facteurs tels que l'expérience, les compétences, la situation géographique et les attentes du poste. En plus du salaire de base, notre programme de rémunération totale pour les postes éligibles comprend une prime discrétionnaire, une participation au capital significative et des avantages complets.
La fourchette de salaire annuel de base anticipée pour ce poste est : $180,000 — $220,000 USD
AVANTAGES ET ATOUTS
Nous offrons un ensemble complet et compétitif d'avantages conçu pour soutenir la santé, le bien-être et le succès à long terme de nos employés :
- Couverture Santé Complète : Couverture médicale, dentaire et visuelle pour les employés et les personnes à charge éligibles.
- Participation au capital significative : RSU (Restricted Stock Units) qui donnent aux employés une participation au succès à long terme de l'entreprise.
- Épargne Retraite : Correspondance 401(k) (États-Unis) et cotisations de retraite (Royaume-Uni).
- Congés Payés Flexibles : Congés payés illimités, jours fériés de l'entreprise et jours fériés flottants pour soutenir l'équilibre vie professionnelle-vie privée.
- Pause Hivernale d'Entreprise : Deux semaines de fermeture de l'entreprise chaque hiver pour se déconnecter et se ressourcer.
- Congés Parentaux et Familiaux Payés : Congés payés pour vous soutenir, vous et votre famille, dans les moments importants de la vie.
- Développement Professionnel : Allocation annuelle d'apprentissage et de développement pour soutenir votre croissance professionnelle.
- Avantages Bien-être : Primes de bien-être et de télétravail pour soutenir votre bien-être physique et mental.
- Programme de Sabbatical : Quatre semaines de congé sabbatique payé après quatre ans de service.
- Travail Flexible : Horaires flexibles et modèle de travail hybride pour nos équipes basées au bureau.
- Repas sur Site : Repas gratuits dans nos hubs de bureau.
Les avantages peuvent varier selon le lieu, l'équipe et le poste.
