ComTec Solutions LLC
Lightning AI
Ingénieur Senior en Exploitation d'Infrastructure
QUI SOMMES-NOUS
Lightning AI est la société derrière PyTorch Lightning. Fondée en 2019, nous construisons une plateforme de bout en bout pour développer, entraîner et déployer des systèmes d'IA, conçue pour transformer les idées de la recherche à la production avec moins de friction.
Grâce à notre fusion avec Voltage Park, un neocloud et une usine d'IA, Lightning AI combine un logiciel axé sur les développeurs avec une puissance de calcul à grande échelle et économique. Les équipes obtiennent les outils dont elles ont besoin pour l'expérimentation, l'entraînement et l'inférence de production, avec sécurité, observabilité et contrôle intégrés.
Nous servons des chercheurs indépendants, des startups et de grandes entreprises. Lightning AI opère à l'échelle mondiale avec des bureaux à New York, San Francisco, Seattle et Londres, et est soutenu par Coatue, Index Ventures, Bain Capital Ventures et Firstminute.
NOTRE FAÇON DE TRAVAILLER
Les personnes qui réussissent ici sont des bâtisseurs qui agissent rapidement, communiquent ouvertement, prennent des responsabilités et s'améliorent continuellement eux-mêmes, leurs équipes et notre entreprise. Voici ce que cela implique concrètement : *
- Agir avec Urgence : Nous avançons rapidement, prenons des décisions réfléchies et maintenons l'élan. Nous privilégions l'action à la perfection et apprenons en livrant. *
- Prendre des Responsabilités : Nous assumons les résultats, pas seulement notre travail individuel. Nous prenons des décisions qui font avancer l'entreprise et nous allons jusqu'au bout. *
- Communiquer Ouvertement : Nous communiquons directement, cherchons à comprendre et apportons de la clarté aux autres. Des conversations honnêtes nous aident à avancer plus vite ensemble. *
- Construire de Grandes Équipes : Nous donnons l'exemple, responsabilisons les autres et créons des équipes saines où les gens peuvent donner le meilleur d'eux-mêmes. *
- Élever le Niveau : Nous nous améliorons constamment. Nous apprenons des retours, nous nous mettons continuellement au défi de grandir et nous nous concentrons sur le travail qui compte le plus. *
- Penser à Long Terme : Nous concevons pour l'avenir. Nous créons des systèmes évolutifs, simplifions la complexité et utilisons l'IA et l'automatisation pour amplifier notre impact.
CE QUE NOUS RECHERCHONS
Lightning AI recherche un Ingénieur Senior en Exploitation d'Infrastructure expérimenté pour aider à exploiter et à faire évoluer l'infrastructure derrière l'une des plus grandes flottes de GPU au monde.
Notre équipe d'Exploitation d'Infrastructure est au cœur de la fiabilité de production pour l'infrastructure IA de Lightning. L'équipe travaille sur Linux, des serveurs bare-metal, des GPU, le réseau, le stockage, le provisionnement et l'orchestration de clusters, servant de point d'escalade technique critique lorsque des problèmes d'infrastructure complexes surviennent.
Il ne s'agit pas d'un rôle traditionnel d'administration système ou d'exploitation basée sur des tickets. Vous dépannerez des problèmes sur l'ensemble de la pile d'infrastructure, gérerez les problèmes jusqu'à leur résolution et identifierez les opportunités d'automatiser le travail récurrent. Vous contribuerez également à des projets d'ingénierie à plus long terme qui améliorent la fiabilité, standardisent les opérations et permettent à notre infrastructure de s'adapter efficacement.
Nous recherchons un généraliste en infrastructure qui est à l'aise pour approfondir les problèmes lorsqu'ils surviennent, mais qui prend également du recul pour se demander comment éviter que le même problème ne se reproduise.
Ce rôle peut être entièrement à distance aux États-Unis, ou hybride depuis l'un de nos hubs de bureaux américains (NYC, SF ou Seattle) avec des séminaires d'équipe et d'entreprise occasionnels. Nous ne sommes pas en mesure de fournir de parrainage de visa pour ce poste pour le moment.
CE QUE VOUS FEREZ *
- Exploiter et dépanner une infrastructure GPU et bare-metal à grande échelle couvrant Linux, le calcul, le réseau, le stockage et l'orchestration de clusters. *
- Servir de point d'escalade technique pour les problèmes d'infrastructure complexes, en gérant les problèmes de l'enquête initiale à la résolution et à l'analyse des causes profondes. *
- Assumer la responsabilité des flux de travail opérationnels tout au long du cycle de vie de l'infrastructure, y compris le provisionnement, la configuration, la validation, la maintenance, la remédiation et le déclassement. *
- Construire des automatisations et des outils internes qui éliminent le travail opérationnel répétitif et permettent à la flotte d'infrastructure de s'adapter efficacement. *
- Identifier les modes de défaillance récurrents et collaborer avec l'Ingénierie d'Infrastructure pour construire des systèmes plus fiables, reproductibles et automatisés. *
- Améliorer les processus de provisionnement, de surveillance, de diagnostic et d'exploitation sur une empreinte d'infrastructure en croissance rapide. *
- Collaborer étroitement avec l'Ingénierie d'Infrastructure, l'Ingénierie Réseau, les Opérations de Centre de Données, l'Expérience Client et l'Ingénierie de Plateforme pour résoudre les problèmes qui traversent les limites des équipes ou des systèmes. *
- Participer à une rotation de garde primaire/secondaire distribuée pour le support de l'infrastructure de production.
CE DONT VOUS AVEZ BESOIN
QUALIFICATIONS REQUISES *
- Solide expérience dans l'exploitation et le dépannage d'infrastructures de production basées sur Linux à grande échelle. *
- Expérience dans le dépannage de problèmes d'infrastructure complexes couvrant le calcul, le réseau, le stockage et les systèmes d'exploitation. *
- Solides compétences en automatisation et en scripting utilisant Python, Go, Bash, Ansible, ou des outils similaires. *
- Expérience avec Kubernetes, Slurm, ou d'autres systèmes d'orchestration de clusters et de charges de travail. *
- Expérience dans l'utilisation de systèmes de surveillance, d'observabilité et de télémétrie pour diagnostiquer et dépanner l'infrastructure de production. *
- Solides fondamentaux en systèmes et réseaux, avec une expérience avérée dans la gestion des problèmes de production jusqu'à leur résolution. *
- A l'aise pour travailler dans des environnements ambigus et collaborer avec les équipes d'ingénierie, d'exploitation et en contact avec les clients.
ATOUTS *
- Expérience dans le dépannage, le provisionnement ou l'exploitation d'infrastructures de serveurs bare-metal. *
- Expérience dans l'exploitation ou le dépannage d'infrastructures GPU, HPC ou autre calcul haute performance. *
- Connaissance des GPU NVIDIA, DCGM, InfiniBand, RoCE/RDMA, NVLink, ou des réseaux de centres de données à haute vitesse. *
- Expérience avec des technologies de gestion et de provisionnement matériel telles que PXE, BMC, IPMI, Redfish ou iDRAC. *
- Expérience avec des systèmes de stockage distribués ou haute performance tels que VAST, Ceph, GPFS ou WEKA. *
- Expérience avec l'infrastructure-as-code, la gestion de configuration ou les flux de travail GitOps.
RÉMUNÉRATION
Nous nous engageons à offrir une rémunération compétitive qui reflète la valeur que chaque membre de l'équipe apporte à notre mission. Les offres finales sont basées sur des facteurs tels que l'expérience, les compétences, la localisation géographique et les attentes du rôle. En plus du salaire de base, notre programme de rémunération totale pour les rôles éligibles comprend une prime discrétionnaire, une composante d'équité significative et des avantages complets.
La fourchette de salaire annuel de base anticipée pour ce rôle est : $175,000—$200,000 USD
Chez Lightning AI, nous nous engageons à favoriser un lieu de travail inclusif et diversifié. Nous croyons que des équipes diversifiées stimulent l'innovation et créent de meilleurs produits. Nous offrons des opportunités d'emploi égales à tous les employés et candidats sans distinction de race, de couleur, de religion, de sexe, d'orientation sexuelle, d'identité de genre, d'origine nationale, d'âge, de handicap, de statut d'ancien combattant ou de toute autre caractéristique protégée. Nous nous engageons à bâtir une culture où chacun peut s'épanouir et contribuer à son plein potentiel.
AVANTAGES ET ATOUTS
Nous offrons un ensemble complet et compétitif d'avantages conçu pour soutenir la santé, le bien-être et le succès à long terme de nos employés : *
- Couverture Santé Complète : Couverture médicale, dentaire et visuelle pour les employés et les personnes à charge éligibles. *
- Équité Significative : RSU (Restricted Stock Units) qui donnent aux employés une participation au succès à long terme de l'entreprise. *
- Épargne Retraite : Correspondance 401(k) (États-Unis) et cotisations de retraite (Royaume-Uni). *
- Congés Payés Flexibles : Congés payés illimités, jours fériés de l'entreprise et jours fériés flottants pour soutenir l'équilibre vie professionnelle-vie privée. *
- Pause Hivernale d'Entreprise : Deux semaines de fermeture de l'entreprise chaque hiver pour se déconnecter et se ressourcer. *
- Congés Parentaux et Familiaux Payés : Congés payés pour vous soutenir, vous et votre famille, dans les moments importants de la vie. *
- Développement Professionnel : Allocation annuelle d'apprentissage et de développement pour soutenir votre croissance professionnelle. *
- Avantages Bien-être : Primes de bien-être et de télétravail pour soutenir votre bien-être physique et mental. *
- Programme de Sabbatical : Quatre semaines de congé sabbatique payé après quatre ans de service. *
- Travail Flexible : Horaires flexibles et modèle de travail hybride pour nos équipes basées au bureau. *
- Repas sur Site : Repas gratuits dans nos hubs de bureaux.
Les avantages peuvent varier selon le lieu, l'équipe et le rôle.
