Esri
Lightning AI
Ingénieur support plateforme IA (États-Unis)
QUI SOMMES-NOUS
Lightning AI est l'entreprise derrière PyTorch Lightning. Fondée en 2019, nous construisons une plateforme complète pour le développement, l'entraînement et le déploiement de systèmes d'IA, conçue pour faire passer les idées de la recherche à la production avec moins de frictions. Grâce à notre fusion avec Voltage Park, un neocloud et usine d'IA, Lightning AI combine des logiciels axés sur les développeurs avec une puissance de calcul à grande échelle et rentable. Les équipes disposent des outils nécessaires pour l'expérimentation, l'entraînement et l'inférence en production, avec une sécurité, une observabilité et un contrôle intégrés. Nous servons des chercheurs indépendants, des startups et de grandes entreprises. Lightning AI opère à l'échelle mondiale avec des bureaux à New York, San Francisco, Seattle et Londres, et est soutenu par Coatue, Index Ventures, Bain Capital Ventures et Firstminute.
NOTRE FAÇON DE TRAVAILLER
Les personnes qui s'épanouissent ici sont des bâtisseurs qui agissent rapidement, communiquent ouvertement, prennent des responsabilités et s'améliorent continuellement, ainsi que leurs équipes et notre entreprise. Voici ce que cela signifie en pratique :
- Agir avec urgence : Nous avançons rapidement, prenons des décisions réfléchies et maintenons notre élan. Nous privilégions l'action à la perfection et apprenons en livrant.
- Prendre des responsabilités : Nous sommes responsables des résultats, pas seulement de notre travail individuel. Nous prenons des décisions qui font avancer l'entreprise et nous allons jusqu'au bout.
- Communiquer ouvertement : Nous communiquons directement, cherchons à comprendre et apportons de la clarté aux autres. Des conversations honnêtes nous aident à avancer plus vite ensemble.
- Bâtir de grandes équipes : Nous montrons l'exemple, responsabilisons les autres et créons des équipes saines où chacun peut donner le meilleur de lui-même.
- Placer la barre plus haut : Nous nous améliorons constamment. Nous apprenons des retours, nous nous mettons au défi de grandir et nous nous concentrons sur le travail qui compte le plus.
- Penser à long terme : Nous concevons pour l'avenir. Nous créons des systèmes évolutifs, simplifions la complexité et utilisons l'IA et l'automatisation pour amplifier notre impact.
CE QUE NOUS RECHERCHONS
Lightning AI cherche à recruter un Ingénieur Support Plateforme IA pour rejoindre notre équipe Expérience Client aux États-Unis, afin d'accompagner les ingénieurs ML exécutant des charges de travail d'entraînement et d'inférence à grande échelle sur des infrastructures cloud, Kubernetes et des plateformes GPU dans des environnements de production.
Ce rôle se situe à l'intersection des systèmes ML, de l'infrastructure cloud, de Kubernetes et des clients. Vous soutiendrez les ingénieurs dans l'entraînement de modèles, le déploiement de systèmes d'inférence et la mise à l'échelle de charges de travail GPU en production. Vous n'êtes pas un routeur de tickets ou un ingénieur support traditionnel. Vous êtes un partenaire technique pour les équipes ML, aidant à diagnostiquer les défaillances, à améliorer la fiabilité et à guider les clients à travers des problèmes complexes de systèmes distribués. Les problèmes vont de la planification Kubernetes et l'orchestration GPU aux défaillances distribuées PyTorch, la latence d'inférence, les goulots d'étranglement réseau, les performances de stockage et la fiabilité de la plateforme. Vous serez exposé à une grande variété de charges de travail d'IA réelles dans divers secteurs et aiderez à façonner l'infrastructure alimentant la prochaine génération d'applications ML.
Ce poste est hybride et basé dans nos bureaux de Seattle, San Francisco ou New York, avec une exigence de présence sur site d'au moins 2 jours par semaine et des déplacements occasionnels pour des réunions d'équipe ou d'entreprise. Le poste suit un horaire du lundi au vendredi, de 8h00 à 17h00 PST. Nous ne sommes pas en mesure de fournir un parrainage de visa pour ce poste pour le moment.
Nous nous engageons à offrir une rémunération compétitive qui reflète la valeur que chaque membre de l'équipe apporte à notre mission. Les offres finales sont basées sur des facteurs tels que l'expérience, les compétences, la situation géographique et les attentes liées au rôle. En plus du salaire de base, notre package de récompenses totales pour les rôles éligibles comprend une prime discrétionnaire, une composante significative en actions (equity) et des avantages sociaux complets. La fourchette de salaire de base annuel prévue pour ce rôle est :
115,000—140,000 USD
Chez Lightning AI, nous nous engageons à favoriser un lieu de travail inclusif et diversifié. Nous pensons que des équipes diversifiées stimulent l'innovation et créent de meilleurs produits. Nous offrons des opportunités d'emploi égales à tous les employés et candidats sans distinction de race, couleur, religion, sexe, orientation sexuelle, identité de genre, origine nationale, âge, handicap, statut d'ancien combattant ou toute autre caractéristique protégée. Nous nous consacrons à bâtir une culture où chacun peut s'épanouir et contribuer à son plein potentiel.
VOS MISSIONS
Travailler directement avec les ingénieurs ML
- Collaborer directement avec les équipes d'ingénierie client exécutant des charges de travail d'entraînement et d'inférence en production
- Aider les clients à diagnostiquer et résoudre des problèmes complexes de systèmes distribués et d'infrastructure ML
- Agir en tant que conseiller technique lors d'incidents à fort impact et d'événements de dégradation de la plateforme
- Traduire les problèmes d'infrastructure en conseils exploitables pour les ingénieurs ML
- Établir la crédibilité auprès des clients grâce à un raisonnement technique solide et une communication claire
Déboguer l'infrastructure ML et les charges de travail distribuées
- Enquêter sur les défaillances impliquant l'entraînement distribué, l'orchestration Kubernetes, l'allocation GPU, le réseau et les systèmes de stockage
- Dépanner les problèmes liés à PyTorch, CUDA, NCCL et au service d'inférence
- Analyser les journaux, les métriques, les traces et le comportement du système pour isoler les causes profondes
- Déboguer les charges de travail conteneurisées s'exécutant sur Kubernetes et des environnements GPU bare metal
- Soutenir les clients dans la mise à l'échelle des charges de travail sur des systèmes GPU multi-nœuds
- Diagnostiquer les goulots d'étranglement de performance impliquant le calcul, la mémoire, le réseau ou le stockage
Améliorer la fiabilité et les opérations de la plateforme
- Identifier les modèles récurrents dans les problèmes clients et piloter des améliorations de fiabilité à long terme
- Contribuer aux revues post-incident et aux améliorations opérationnelles
- Construire des outils internes, de l'automatisation, de la documentation et des runbooks
- Travailler en étroite collaboration avec les équipes d'infrastructure, de réseau et d'ingénierie plateforme
- Aider à améliorer l'observabilité, la visibilité opérationnelle et les flux de travail de dépannage
- Améliorer l'expérience client grâce à de meilleurs processus et conseils techniques
Ce que ce rôle n'est pas
Pour définir des attentes claires :
- Ce n'est pas un rôle de support traditionnel de type help desk ou routage de tickets
- Ce n'est pas purement du succès client ou de la gestion de compte
- Ce n'est pas un rôle d'ingénierie backend
- Ce n'est pas un poste d'escalade passif
Ce rôle est destiné aux ingénieurs qui aiment résoudre des problèmes techniques difficiles tout en travaillant en étroite collaboration avec d'autres ingénieurs.
CE DONT VOUS AUREZ BESOIN
QUALIFICATIONS REQUISES
INFRASTRUCTURE ET SYSTÈMES
- Solide expérience en ingénierie logicielle et en dépannage de systèmes
- Expérience avec Kubernetes et les environnements conteneurisés
- Connaissance des systèmes Linux, incluant le réseau, le stockage, la gestion des processus et l'optimisation des performances
- Expérience avec l'infrastructure cloud et les systèmes distribués
- Expérience avec les outils d'observabilité et de débogage tels que Prometheus, Grafana ou OpenTelemetry
EXPÉRIENCE EN INFRASTRUCTURE ML
- Expérience pratique de l'exploitation de charges de travail machine learning en production ou dans des environnements de recherche
- Expérience avec les systèmes ML distribués et les outils tels que PyTorch, CUDA ou NCCL
- Familiarité avec l'infrastructure GPU et l'orchestration
- Expérience dans le dépannage des problèmes de performance, de fiabilité ou de mise à l'échelle dans l'infrastructure ML
- Compréhension des défis opérationnels liés à l'exécution de systèmes ML à grande échelle
COLLABORATION
- Solides compétences en communication et capacité à travailler directement avec des clients hautement techniques et des équipes d'ingénierie
- À l'aise pour opérer dans des environnements en évolution rapide et très ambigus
- Aime résoudre des problèmes techniques complexes de manière collaborative
EXPÉRIENCE IDÉALE
- Expérience avec l'entraînement de modèles à grande échelle ou les systèmes d'inférence distribués
- Familiarité avec Ray, Kubeflow, Slurm ou des plateformes de planification distribuées similaires
- Expérience avec InfiniBand, RDMA ou le réseau haute performance
- Expérience dans l'exploitation d'infrastructure bare metal
- Familiarité avec les systèmes de stockage couramment utilisés dans les environnements ML
- Expérience de travail dans une entreprise d'infrastructure IA, cloud, MLOps ou d'outils de développement
- Contributions à des projets d'ingénierie plateforme, d'infrastructure développeur ou d'outils opérationnels
- Expérience dans l'écriture d'automatisation, d'outils ou de scripts en Python ou langages similaires
AVANTAGES ET PERKS
Nous proposons un package d'avantages complet et compétitif conçu pour soutenir la santé, le bien-être et la réussite à long terme de nos employés :
- Couverture santé complète : Couverture médicale, dentaire et optique pour les employés et les personnes à charge éligibles.
- Actions (Equity) significatives : Des RSU qui donnent aux employés une participation dans la réussite à long terme de l'entreprise.
- Épargne retraite : Abondement 401(k) (États-Unis) et cotisations de retraite (Royaume-Uni).
- Congés flexibles : PTO illimité, jours fériés de l'entreprise et jours fériés flottants pour soutenir l'équilibre vie professionnelle-vie privée.
- Pause hivernale à l'échelle de l'entreprise : Deux semaines de fermeture de l'entreprise chaque hiver pour déconnecter et se ressourcer.
- Congé parental et familial payé : Congé payé pour vous soutenir, vous et votre famille, lors des moments importants de la vie.
- Développement professionnel : Allocation annuelle d'apprentissage et de développement pour soutenir votre croissance professionnelle.
- Avantages bien-être : Indemnités de bien-être et de télétravail pour soutenir votre bien-être physique et mental.
- Programme de congé sabbatique : Quatre semaines de congé sabbatique payé après quatre ans de service.
- Travail flexible : Horaires flexibles et modèle de travail hybride pour nos équipes basées au bureau.
- Repas au bureau : Repas offerts dans nos hubs de bureau.
Les avantages peuvent varier selon le lieu, l'équipe et le rôle.
