Haeger Consulting
Tensordyne
Ingénieur d'Inférence Déployé sur le Terrain
À PROPOS DE TENSORDYNE
Tensordyne développe une nouvelle classe de systèmes d'inférence IA conçus pour le déploiement haute performance et économe en énergie des charges de travail d'IA générative les plus exigeantes au monde.
Notre plateforme combine des puces matérielles dédiées, de nouvelles méthodes mathématiques pour l'IA, un réseau d'interconnexion à l'échelle optimisé et une architecture mémoire, le tout intégré dans un système conçu spécifiquement pour l'inférence IA à grande échelle. Nous collaborons avec des hyperscalers, des Neoclouds, des développeurs de modèles de pointe, des entreprises et des partenaires d'infrastructure opérant à l'avant-garde de l'IA.
Alors que Tensordyne passe du développement système à la mise en service du matériel, la validation client, les déploiements bêta et le déploiement en production, nous construisons l'organisation technique client qui se situera directement entre nos équipes d'ingénierie et les entreprises qui déploient la plateforme.
RÉSUMÉ DU RÔLE
Nous recherchons un Ingénieur d'Inférence Déployé sur le Terrain qui combine une expertise approfondie des systèmes IA avec un sens aigu du client. Cette personne sera responsable du parcours allant d'une charge de travail client ou d'une demande de modèle à un résultat technique et, si nécessaire, à un modèle optimisé fonctionnant avec succès sur le matériel et le logiciel de Tensordyne.
Le rôle se situe à l'intersection de l'architecture des modèles, de la performance d'inférence, de l'optimisation des systèmes, des outils de développement et du déploiement client. Vous travaillerez en étroite collaboration avec l'ingénierie tout en servant de pont technique avec les équipes Produit, Développement Commercial, Ventes et les clients.
CE QUE VOUS FEREZ *
- Transformer les charges de travail clients en réponses de performance rapides et crédibles grâce au profilage et au benchmarking. Définir des KPI pertinents, comparer avec des références concurrentielles et maintenir notre méthodologie d'évaluation à jour avec les benchmarks externes. *
- Activation et optimisation de modèles : convertir et mettre en service les modèles clients sur la pile logicielle de Tensordyne, valider la qualité numérique, identifier les goulots d'étranglement de performance et travailler avec les équipes compilateur, runtime, noyau et système pour améliorer les résultats. *
- Déploiement / Ingénierie avancée : travailler directement avec les clients et partenaires sur des preuves de concept techniques, l'intégration, le déploiement et le débogage ; traduire les exigences en critères d'acceptation mesurables pour la qualité, la latence, le débit et d'autres KPI pertinents. *
- Suivre la précision du profilage par rapport au matériel en comparant continuellement les résultats de profilage/simulation avec les déploiements matériels réels, expliquer les écarts significatifs et signaler les capacités manquantes dans le compilateur, le SDK, le serveur d'inférence, la gestion du cache KV ou les systèmes adjacents aux équipes responsables. *
- Transformer les apprentissages clients répétés en outils réutilisables, documentation, benchmarks ou améliorations de produits.
QUALIFICATIONS DE BASE *
- Solide expérience pratique avec les modèles IA et les systèmes d'inférence, en particulier les LLMs denses et MoE (Llama, DeepSeek, Qwen, GPT-OSS, Kimi, GLM), ainsi que les modèles VLM, vocaux et de diffusion. *
- Solides compétences en Python et PyTorch et capacité à comprendre et modifier le code des modèles. *
- Expérience en profilage, benchmarking ou optimisation de l'inférence de modèles et raisonnement sur la latence, le débit, la mémoire et l'utilisation. *
- Solides compétences en résolution de problèmes et en communication, avec la capacité de résoudre des problèmes techniques ambigus au-delà des frontières des équipes. *
- Maîtrise de l'utilisation d'outils de développement basés sur l'IA (par exemple, Claude Code, Cursor).
ATOUTS MAJEURS *
- Expérience avec les piles de service et de déploiement de LLM telles que vLLM, SGLang ou des systèmes similaires. *
- Expérience de travail direct avec des clients ou des partenaires techniques externes. *
- Expérience dans la mise en service de modèles sur de nouveaux accélérateurs ou du matériel non standard, y compris le débogage de performance aux frontières entre le framework, le runtime et le matériel. *
- Expérience pratique des techniques ou environnements d'inférence en production tels que la quantification, l'inférence distribuée ou Kubernetes. *
- Expérience de navigation et de contribution aux bases de code Rust.
LA CULTURE DE TENSORDYNE A ÉTÉ CONSTRUITE SUR LES VALEURS SUIVANTES *
- Mettre les gens en premier. Nous ne réussissons que lorsque nos employés réussissent. *
- Éthique et intégrité avant tout ; Être ouvert, honnête et respectueux envers chacun. *
- Penser grand. Soyez ambitieux et fixez-vous des objectifs audacieux. *
- Viser l'excellence. La qualité et l'excellence comptent dans tout ce que nous faisons. *
- Prendre ses responsabilités et accomplir les tâches. Les résultats comptent ! *
- Améliorer mutuellement ensemble, plutôt que chacun individuellement. *
- Accepter les différences de chacun et accepter qu'il y aura des différences.
Tensordyne est un employeur qui souscrit au principe de l'égalité des chances. Nous croyons que des équipes diversifiées sont mieux équipées pour résoudre des problèmes complexes et construire une technologie exceptionnelle. Tous les candidats qualifiés recevront une considération pour l'emploi sans distinction d'âge, de couleur, d'identité ou d'expression de genre, d'état civil, d'origine nationale, de handicap, de statut de vétéran protégé, de race, de religion, de grossesse, d'orientation sexuelle ou de toute autre caractéristique protégée par les lois, réglementations et ordonnances applicables.
Note aux agences de recrutement : Veuillez ne pas contacter les employés ou les responsables de Tensordyne concernant ce poste. Nous n'acceptons pas les CV non sollicités d'agences et ne sommes pas responsables des frais associés aux soumissions non sollicitées.
