Hasbro
Databricks
Ingénieur Logiciel Staff, AI Runtime
À propos du poste
P-1930
Consultez notre récent article de blog : databricks.com/blog/how-we-keep-gpus-reliable-across-databricks-ai databricks.com/blog/fast-fault-tolerant-pytorch-training-ai-runtime
Transparence de la fourchette de rémunération
Databricks s'engage à des pratiques de rémunération justes et équitables. Les fourchettes de rémunération pour ce rôle sont indiquées ci-dessous et représentent la fourchette de salaire attendue pour les postes non commissionnables ou les gains cibles pour les postes commissionnables. La rémunération réelle est basée sur plusieurs facteurs uniques à chaque candidat, y compris, mais sans s'y limiter, les compétences liées au poste, la profondeur de l'expérience, les certifications et la formation pertinentes, et le lieu de travail spécifique. Sur la base des facteurs ci-dessus, Databricks prévoit d'utiliser toute la largeur de la fourchette. Le forfait de rémunération totale pour ce poste peut également inclure l'éligibilité à une prime de performance annuelle, des actions et les avantages listés ci-dessus. Pour plus d'informations sur la fourchette correspondant à votre localisation, visitez notre page ici databricks.com/sites/default/files/2024-08/us-pay-zone-mapping.pdf.
Fourchette de rémunération locale
$190,000—$265,000 USD
Notre engagement envers la diversité et l'inclusion
Chez Databricks, nous nous engageons à favoriser une culture diversifiée et inclusive où chacun peut exceller. Nous prenons grand soin de garantir que nos pratiques d'embauche sont inclusives et respectent les normes d'égalité des chances en matière d'emploi. Les personnes recherchant un emploi chez Databricks sont considérées sans égard à l'âge, la couleur, le handicap, l'origine ethnique, le statut familial ou matrimonial, l'identité ou l'expression de genre, la langue, l'origine nationale, l'aptitude physique et mentale, l'affiliation politique, la race, la religion, l'orientation sexuelle, le statut socio- économique, le statut d'ancien combattant et d'autres caractéristiques protégées.
Conformité
Si l'accès à une technologie ou à un code source soumis au contrôle des exportations est requis pour l'exécution des fonctions du poste, il est à la discrétion de l'Employeur de demander une licence du gouvernement américain pour de tels postes, et l'Employeur peut refuser de poursuivre avec un candidat sur cette base seule.
Chez Databricks, nous sommes passionnés par l'idée de permettre aux équipes de données de résoudre les problèmes les plus difficiles du monde — de faire du prochain mode de transport une réalité à accélérer le développement de percées médicales. Nous y parvenons en construisant et en exploitant la meilleure plateforme d'infrastructure de données et d'IA au monde afin que nos clients puissent utiliser des informations approfondies sur les données pour améliorer leur activité.
L'entraînement et la personnalisation de modèles d'IA de pointe représentent l'une des charges de travail les plus exigeantes en informatique, et elle est au cœur de la mission Mosaic AI de Databricks. AI Runtime (AIR) est notre plateforme gérée pour l'entraînement et le réglage fin à grande échelle des GPU. Elle offre aux clients un accès à la demande à des flottes des derniers accélérateurs et une expérience sans serveur qui masque la complexité de l'approvisionnement, de la planification et de l'orchestration des tâches multi-nœuds, avec la résilience nécessaire pour maintenir l'entraînement pendant des jours ou des semaines sur des milliers de GPU. AIR alimente tout le spectre de l'entraînement personnalisé, du réglage fin des modèles ouverts à la pré-formation de modèles fondamentaux à l'échelle de la frontière, pour certaines des équipes d'IA les plus sophistiquées au monde.
En tant qu'Ingénieur Logiciel Staff pour AI Runtime, vous jouerez un rôle essentiel dans la construction et la mise à l'échelle des systèmes qui rendent l'entraînement à grande échelle rapide, fiable et sans effort. Vous dirigerez l'architecture et l'évolution de la pile d'entraînement GPU gérée, couvrant la planification et la capacité, les performances d'entraînement distribué, la tolérance aux pannes et l'expérience développeur pour le lancement et l'exploitation de tâches à grande échelle. Au-delà des contributions pratiques aux systèmes centraux, vous contribuerez à définir la vision technique à long terme d'AIR, à encadrer des ingénieurs seniors, à collaborer avec les équipes produit, recherche et plateforme, et à diriger les initiatives qui élargissent l'impact technique et commercial de l'entraînement personnalisé chez Databricks.
L'impact que vous aurez : *
- Diriger l'architecture et l'évolution de la plateforme d'entraînement GPU gérée d'AIR, en fournissant un entraînement évolutif, à haut débit et résilient sur des flottes qui s'étendent sur des milliers d'accélérateurs. *
- Résoudre les problèmes les plus difficiles de l'entraînement à grande échelle, notamment l'orchestration multi-nœuds, les stratégies de parallélisme distribué, la planification des GPU et le routage dynamique, le chargement de données à haut débit, et le checkpointing et la restauration pour des tâches de très longue durée. *
- Améliorer l'efficacité des GPU et les performances d'entraînement, en augmentant l'utilisation (telle que l'utilisation des FLOPs du modèle et le débit de bout en bout) et en réduisant le coût par exécution d'entraînement sur diverses architectures de modèles et générations de matériel. *
- Construire les fondations de résilience et d'observabilité qui maintiennent les tâches multi-nœuds en bonne santé, en détectant et en récupérant des pannes matérielles et logicielles avec une perturbation minimale pour les clients. *
- Collaborer avec les équipes produit, recherche et plateforme pour façonner les APIs, l'interface en ligne de commande (CLI) et l'expérience développeur qui facilitent le lancement, la surveillance et le débogage des tâches d'entraînement en production. *
- Mener des efforts d'ingénierie de bout en bout, de la conception au déploiement en production, en maintenant un niveau élevé de performance, de correction et de fiabilité. *
- Contribuer directement et de manière significative aux systèmes centraux derrière AIR, et aider à prendre en charge les derniers accélérateurs et les nouvelles régions à mesure que la flotte s'agrandit. *
- Promouvoir l'excellence en ingénierie, encadrer d'autres ingénieurs par le biais de revues de conception et de discussions techniques, et aider à façonner la direction technique à long terme de Databricks dans l'infrastructure d'entraînement IA.
Ce que nous recherchons : *
- 10+ années d'expérience dans la construction et l'exploitation de systèmes distribués à grande échelle, avec une profondeur significative dans l'infrastructure d'entraînement GPU, le calcul haute performance ou les systèmes ML. *
- Expérience pratique des frameworks d'entraînement distribué (tels que PyTorch, FSDP, DeepSpeed ou Megatron) et des stratégies de parallélisme (parallélisme de données, de tenseurs, de pipeline et de séquence) utilisées pour entraîner de grands modèles. *
- Compréhension approfondie des modèles de résilience d'entraînement, y compris le checkpointing, la détection de pannes et la récupération automatique pour les tâches multi-nœuds de longue durée. *
- Solide maîtrise des fondamentaux de la performance GPU, y compris l'architecture des accélérateurs, les interconnexions à haute vitesse (telles que NVLink et InfiniBand ou RoCE), la communication collective, et les goulots d'étranglement qui régissent le débit et l'utilisation de l'entraînement. *
- Expérience dans la construction et l'exploitation de produits de plateforme gérés et multi-locataires dans le cloud, avec des SLA et des SLO clairs pour la disponibilité, la performance et la fiabilité. *
- Solide base en algorithmes, structures de données et conception de systèmes appliquée aux systèmes distribués à grande échelle sensibles aux performances. *
- Capacité avérée à livrer des initiatives techniquement complexes et à fort impact qui créent une valeur client ou commerciale claire. *
- Solides compétences en communication et capacité à collaborer avec les équipes produit, recherche et infrastructure dans un environnement en évolution rapide. *
- Esprit stratégique et orienté produit avec la capacité d'aligner l'exécution technique sur une vision à long terme, et une passion pour l'encadrement des ingénieurs et la promotion de l'excellence technique. *
- Diplôme de licence (BS) en informatique ou dans un domaine connexe (master ou doctorat préféré).
À propos de Databricks
Databricks est la société Data et IA. Plus de 20,000 organisations dans le monde — y compris adidas, AT&T, Bayer, Block, Mastercard, Rivian, Unilever, et 70% des entreprises du Fortune 500 — s'appuient sur la plateforme Data + AI de Databricks pour construire et faire évoluer des applications de données et d'IA, des analyses et des agents. Basée à San Francisco avec plus de 30 bureaux dans le monde entier, Databricks propose une plateforme unifiée qui comprend Genie, Lakebase, Agent Bricks, Lakeflow, Lakehouse et Unity Catalog. Pour en savoir plus, suivez Databricks sur LinkedIn linkedin.com/company/databricks, X x.com/databricks, YouTube youtube.com/@Databricks et Instagram instagram.com/databricksinc/?hl=en.
Avantages
Chez Databricks, nous nous efforçons de fournir des avantages et des primes complets qui répondent aux besoins de tous nos employés. Pour des détails spécifiques sur les avantages offerts dans votre région, cliquez ici docs.google.com/document/d/154un3e8Xav4BceOSlcYFZRGEuQI54xMxVydRwQn54eQ/edit?usp=sharing.
