Terra Quantum
Tensordyne
Ingénieur Déploiement Avancé d'Inférence
À propos de Tensordyne
Tensordyne construit une nouvelle classe de systèmes d'inférence IA conçus pour le déploiement haute performance et économe en énergie des charges de travail d'IA générative les plus exigeantes au monde.
Notre plateforme combine des puces dédiées, de nouvelles mathématiques pour l'IA, un réseau optimisé pour le scale-up et une architecture mémoire dans un système étroitement intégré, spécialement conçu pour l'inférence IA à grande échelle. Nous travaillons avec des hyperscalers, des Neoclouds, des développeurs de modèles de pointe, des entreprises et des partenaires d'infrastructure opérant à l'avant-garde de l'IA.
Alors que Tensordyne passe du développement système à la mise en service des puces, à la validation client, aux déploiements bêta et au déploiement en production, nous construisons l'organisation technique client qui se situera directement entre nos équipes d'ingénierie et les entreprises qui déploient la plateforme.
Résumé du rôle
Nous recherchons un Ingénieur Déploiement Avancé d'Inférence qui combine une expertise approfondie des systèmes IA avec un sens aigu du client. Cette personne sera responsable du parcours allant d'une charge de travail client ou d'une demande de modèle à un résultat technique et, si nécessaire, à un modèle optimisé fonctionnant avec succès sur le matériel et le logiciel de Tensordyne.
Le rôle se situe à l'intersection de l'architecture des modèles, de la performance d'inférence, de l'optimisation des systèmes, des outils de développement et du déploiement client. Vous travaillerez en étroite collaboration avec l'ingénierie tout en servant de pont technique vers le Produit, le Développement Commercial, les Ventes et les clients.
Valeurs de Tensordyne
- Penser grand. Poursuivre des objectifs techniques et commerciaux ambitieux.
- Viser l'excellence. La qualité compte dans tout ce que nous construisons et livrons.
- S'approprier et accomplir. Prendre ses responsabilités et obtenir des résultats.
- Agir avec intégrité. Être direct, transparent et respectueux.
- Gagner en équipe. Rendre les personnes autour de soi plus efficaces.
- Valoriser les différentes perspectives. Les équipes les plus solides remettent en question les hypothèses et apportent une expérience diversifiée à des problèmes difficiles.
Tensordyne est un employeur garantissant l'égalité des chances. Nous croyons que les équipes diversifiées sont mieux équipées pour résoudre des problèmes complexes et construire une technologie exceptionnelle. Tous les candidats qualifiés recevront une considération pour l'emploi sans distinction d'âge, de couleur, d'identité ou d'expression de genre, d'état civil, d'origine nationale, de handicap, de statut d'ancien combattant protégé, de race, de religion, de grossesse, d'orientation sexuelle ou de toute autre caractéristique protégée par les lois, réglementations et ordonnances applicables.
Ce que vous ferez
- Transformer les charges de travail clients en réponses de performance rapides et crédibles grâce au profilage et au benchmarking. Définir des KPI pertinents, comparer avec des références concurrentielles et maintenir notre méthodologie d'évaluation à jour avec les benchmarks externes.
- Activation et optimisation des modèles : convertir et mettre en service les modèles clients sur la pile logicielle de Tensordyne, valider la qualité numérique, identifier les goulots d'étranglement de performance et travailler avec les équipes compilateur, runtime, noyau et système pour améliorer les résultats.
- Déploiement / Ingénierie avancée : travailler directement avec les clients et les partenaires sur des PoC techniques, l'intégration, le déploiement et le débogage ; traduire les exigences en critères d'acceptation mesurables pour la qualité, la latence, le débit et d'autres KPI pertinents.
- Suivre la précision du profilage par rapport au matériel en comparant continuellement les résultats de profilage/simulation avec les déploiements matériels réels, expliquer les écarts importants et signaler les capacités manquantes dans le compilateur, le SDK, le serveur d'inférence, la gestion du cache KV ou les systèmes adjacents aux équipes responsables.
- Transformer les apprentissages clients répétés en outils réutilisables, documentation, benchmarks ou améliorations de produits.
Qualifications principales
- Solide expérience pratique avec les modèles IA et les systèmes d'inférence, en particulier les LLMs denses et MoE (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM), ainsi que les modèles VLM, vocaux et de diffusion.
- Solides compétences en Python et PyTorch et capacité à comprendre et modifier le code des modèles.
- Expérience en profilage, benchmarking ou optimisation de l'inférence de modèles et raisonnement sur la latence, le débit, la mémoire et l'utilisation.
- Solides compétences en résolution de problèmes et en communication, avec la capacité de résoudre des problèmes techniques ambigus au-delà des frontières des équipes.
- Maîtrise de l'utilisation d'outils de développement basés sur l'IA (par exemple, Claude Code, Cursor).
Atouts majeurs
- Expérience avec les piles de service et de déploiement de LLM telles que vLLM, SGLang ou des systèmes similaires.
- Expérience de travail direct avec des clients ou des partenaires techniques externes.
- Expérience dans la mise en service de modèles sur de nouveaux accélérateurs ou du matériel non standard, y compris le débogage de performance aux frontières entre le framework, le runtime et le matériel.
- Expérience pratique des techniques ou environnements d'inférence en production tels que la quantification, l'inférence distribuée ou Kubernetes.
- Expérience de navigation et de contribution aux bases de code Rust.
Note aux agences de recrutement : Veuillez ne pas contacter les employés ou les responsables de Tensordyne concernant ce poste. Nous n'acceptons pas les CV d'agences non sollicités et ne sommes pas responsables des frais associés aux soumissions non sollicitées.
