Nebius

Ingénieur Infrastructure ML

PythonAWSGCPDockerKubernetes
Traduction automatique. Consultez l’original.

À propos de Nebius

Nebius ouvre une nouvelle ère dans l'infrastructure cloud pour l'économie mondiale de l'IA. Nous construisons une plateforme cloud IA full-stack qui prend en charge les développeurs et les entreprises, de la formation des données et des modèles au déploiement en production, sans les coûts et la complexité liés à la construction d'une infrastructure IA/ML interne à grande échelle.

Conçu par des ingénieurs, pour des ingénieurs. De l'orchestration GPU à grande échelle à l'optimisation de l'inférence, nous maîtrisons les défis complexes liés au calcul, au stockage, au réseau et à l'IA appliquée.

Cotée au Nasdaq (NBIS) et basée à Amsterdam, nous avons une présence mondiale avec des centres de R&D en Europe, au Royaume-Uni, en Amérique du Nord et en Israël. Notre équipe de plus de 1,500 personnes comprend des centaines d'ingénieurs possédant une expertise approfondie en matériel, logiciel et R&D IA.

Le poste

Nous recherchons un ingénieur ML/IA hautement qualifié pour rejoindre notre équipe afin de diriger et de soutenir le benchmarking des plateformes GPU pour les charges de travail de machine learning et d'IA. Vous jouerez un rôle essentiel dans l'évaluation des performances du matériel basé sur GPU pour divers frameworks de deep learning et d'IA, permettant des décisions basées sur les données pour l'optimisation de la plateforme et le développement de matériel de nouvelle génération.

Comment se déroule une journée chez Nebius

Rythme rapide - Pensée audacieuse - Croissance constante - Impact significatif - Confiance et réelle autonomie - Opportunité de façonner l'avenir de l'IA.

Déclaration d'égalité des chances

--------------------------------------------------------------------------------

Nebius est un employeur qui respecte l'égalité des chances. Nous nous engageons à favoriser un environnement de travail inclusif et diversifié et à offrir des opportunités d'emploi égales dans tous les aspects de l'emploi. Nous ne faisons aucune discrimination fondée sur la race, la couleur, la religion, le sexe (y compris la grossesse), l'origine nationale, l'ascendance, l'âge, le handicap, les informations génétiques, le statut matrimonial, le statut d'ancien combattant, l'orientation sexuelle, l'identité ou l'expression de genre, ou toute autre caractéristique protégée par la loi applicable.

Les candidats doivent être autorisés à travailler dans le pays où ils postulent et devront fournir une preuve d'éligibilité à l'emploi comme condition d'embauche.

Si vous avez besoin d'aménagements pendant le processus de candidature, veuillez nous en informer.

Vos responsabilités incluront : *

  1. Travailler en étroite collaboration avec les équipes matérielles et de développement pour profiler et analyser les performances GPU au niveau système et noyau. *
  1. Évaluer et comparer les performances GPU sur différentes plateformes, architectures et piles logicielles (par exemple, CUDA, ROCm). *
  1. Déboguer et optimiser les charges de travail ML pour qu'elles s'exécutent efficacement sur le matériel GPU, en identifiant et en résolvant les goulots d'étranglement de performance. *
  1. Effectuer les tests d'acceptation pour les nouveaux clusters GPU, en s'assurant que le matériel et le logiciel répondent aux exigences de performance, de stabilité et de compatibilité pour les charges de travail d'IA. *
  1. Réaliser des expériences sur diverses configurations de systèmes GPU pour évaluer l'impact des différentes stratégies d'interconnexion et des optimisations au niveau du système sur les performances et la scalabilité. *
  1. Développer des outils et des tableaux de bord pour visualiser les métriques de performance, les goulots d'étranglement et les tendances. *
  1. Contribuer aux outils internes, aux frameworks et aux meilleures pratiques.

Nous attendons de vous : *

  1. Une compréhension approfondie des fondements théoriques du machine learning. *
  1. Une compréhension approfondie des aspects de performance de l'entraînement et de l'inférence des réseaux neuronaux à grande échelle (parallélisme de données/tenseur/contexte/expert, déchargement, noyaux personnalisés, fonctionnalités matérielles, optimisations d'attention, batching dynamique, etc.). *
  1. Une expérience approfondie des frameworks modernes de deep learning (PyTorch, JAX, Megatron-LM, TensorRT-LLM). *
  1. Une bonne compréhension de la pile GPU : CUDA, NCCL, pilotes et bibliothèques pertinentes. *
  1. Une familiarité avec les environnements conteneurisés (par exemple, Docker, Kubernetes). *
  1. De solides compétences en communication et la capacité de travailler de manière autonome.

Pour vous démarquer : *

  1. Une familiarité avec les frameworks modernes d'inférence LLM (vLLM, SGLang, TensorRT). *
  1. Une expérience en Python et avec les outils de profilage de performance (par exemple, Nsight, nvprof, perf). *
  1. Une familiarité avec les plateformes ML cloud telles que AWS, GCP, Azure ML. *
  1. Des contributions à des outils open-source de benchmarking ML.

Avantages et Perks : *

  • Une rémunération compétitive. *
  • Opportunités de croissance professionnelle et d'apprentissage. *
  • Flexibilité et autonomie. *
  • Culture collaborative et innovante. *
  • Opportunité de travailler sur des projets d'IA impactants. *
  • Environnement international et équipes talentueuses.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter