Solaris
EnCharge AI
Ingénieur de Recherche, Modèles IA
À propos du poste
Ingénieur de Recherche, IA Appliquée
L'Opportunité
Les charges de travail IA modernes — des grands modèles de langage aux générateurs basés sur la diffusion en passant par les systèmes multimodaux — représentent certaines des frontières les plus gourmandes en calcul de l'IA, et certaines des applications les plus prometteuses pour les avantages d'efficacité énergétique de notre matériel. Nous construisons une pile IA intégrée verticalement qui mettra en valeur le potentiel transformateur de notre silicium tout en offrant une valeur réelle aux clients dès aujourd'hui.
Nous recherchons un Ingénieur de Recherche pour repousser les limites de la capacité, de la qualité et de l'efficacité des modèles IA. Vous construirez des pipelines de fine-tuning et de post-entraînement, développerez des cadres d'évaluation rigoureux, et travaillerez à l'intersection de la recherche ML et de l'optimisation consciente du matériel — garantissant que nos modèles fonctionnent parfaitement sur notre silicium.
Ceci est un rôle pour quelqu'un qui excelle à la frontière entre la recherche et l'ingénierie. Vous lirez des articles, implémenterez des techniques, et livrerez du code de qualité production — le tout au service de rendre l'inférence IA plus rapide, moins chère et meilleure.
Lieu : Allemagne
La fourchette salariale pour ce poste est de €116,000 à €154,000 EUR par an. La rémunération réelle offerte sera déterminée en fonction des connaissances, compétences et expériences liées au poste.
À propos de EnCharge AI
EnCharge AI construit la prochaine génération de plateforme IA. Notre nouvelle architecture de calcul en mémoire offre une amélioration de 10x en termes d'efficacité énergétique et de performance pour les charges de travail d'inférence IA. Alors que les exigences de l'intelligence artificielle dépassent les modèles actuels, nous pensons que l'infrastructure sous-jacente fondamentale doit évoluer. Nous sommes une équipe expérimentée de chercheurs en IA, d'ingénieurs en silicium et systèmes, et d'architectes soutenus par des investisseurs de premier plan, prêts à devenir la plateforme essentielle pour la prochaine vague d'innovation IA.
Responsabilités Clés
- Accélération Algorithmique : Rechercher et implémenter des techniques de pointe pour accélérer l'inférence IA — quantification, sparsité, distillation, décodage spéculatif, stratégies de mise en cache et modifications architecturales. Caractériser systématiquement les compromis entre la qualité du modèle, la latence, le débit et la consommation d'énergie pour trouver des points de fonctionnement optimaux pour différents cas d'utilisation.
- Co-conception Matérielle : Collaborer étroitement avec les équipes matérielles, compilateurs et de quantification pour garantir que les améliorations algorithmiques se traduisent par des gains réels sur notre silicium. Identifier les optimisations alignées sur les forces de notre architecture — maximisant le débit tout en minimisant la puissance. Façonner la boucle de rétroaction entre le développement du modèle et le matériel.
- Évaluation : Construire des outils de profilage et des cadres d'évaluation complets pour comprendre les goulots d'étranglement de calcul, mesurer la qualité du modèle sur des évaluations standard et spécifiques au domaine, et suivre les métriques d'efficacité.
- Recherche Appliquée : Construire des flux de travail de fine-tuning robustes pour les modèles IA modernes, permettant une expérimentation rapide avec LoRA, les adaptateurs et le fine-tuning complet. Rester à jour avec le paysage en évolution rapide — évaluer de nouvelles architectures, implémenter des techniques prometteuses et apporter des perspectives qui éclairent la stratégie technique et de mise sur le marché.
Qualifications
- 5+ années d'expérience en recherche ML, ML appliquée ou systèmes ML
- Solides fondamentaux en Python et PyTorch
- Expérience pratique avec les transformeurs, les modèles de diffusion, les modèles d'espace d'états, etc.
- Expérience dans le fine-tuning de grands modèles et la construction de pipelines d'entraînement/évaluation
- Compréhension approfondie des transformeurs, des mécanismes d'attention et des techniques d'optimisation
- Aisance à lire et implémenter des techniques issues d'articles de recherche
Atouts Souhaitables
- Expérience avec les techniques d'inférence efficaces (optimisation du cache KV, variantes d'attention, routage MoE, flow matching)
- Expérience en optimisation ML consciente du matériel ou en quantification
- Connaissance des outils de profilage (PyTorch Profiler, Nsight, instrumentation personnalisée)
- Publications dans les domaines de la modélisation générative, de l'inférence efficace ou des systèmes ML
- Contributions à des projets ML open-source
