Launch Legends
SpaceXAI
Ingénieur Réseau - Infrastructure ML (Interconnexions Haute Vitesse)
À propos du poste
La mission de SpaceXAI est de créer des systèmes d'IA capables de comprendre précisément l'univers et d'aider l'humanité dans sa quête de connaissance. Notre équipe est petite, très motivée et axée sur l'excellence en ingénierie. Cette organisation s'adresse aux personnes qui aiment se lancer des défis et qui sont animées par la curiosité. Nous opérons avec une structure organisationnelle plate. Tous les employés doivent être proactifs et contribuer directement à la mission de l'entreprise. Le leadership est accordé à ceux qui font preuve d'initiative et fournissent constamment d'excellents résultats. L'éthique de travail et de solides compétences en matière de priorisation sont importantes. Tous les employés doivent posséder de solides compétences en communication. Ils doivent être capables de partager des connaissances de manière concise et précise avec leurs coéquipiers.
À PROPOS DU POSTE
SpaceXAI construit à un rythme effréné avec le matériel de calcul et de commutation le plus récent pour aider les gens à comprendre l'univers. Nous recherchons des ingénieurs exceptionnels en infrastructure ML ayant une expertise approfondie des technologies d'interconnexion à haute vitesse pour concevoir, construire et optimiser le réseau qui alimente les clusters d'entraînement et d'inférence d'IA à grande échelle. Ce rôle stratégique stimulera l'innovation dans les interconnexions à large bande passante, à faible latence et économes en énergie, essentielles pour les clusters IA/ML basés sur des plateformes de calcul avancées. Vous aurez l'opportunité de travailler sur toutes les modalités d'interconnexions connectant les GPU et les commutateurs, à l'intérieur et entre les centres de données, y compris nos réseaux principaux et backend qui entraînent Grok et que les clients utilisent pour l'inférence. Les ingénieurs seront responsables de tous les aspects, de la conception et du développement à la construction et aux opérations. Vous devrez définir et améliorer les processus d'équipe et contribuer aux efforts de mise à l'échelle et de maintenance.
Vous vous concentrerez sur la couche physique et l'intégration au niveau du système des interconnexions en cuivre (ACC, AEC, CPC) et optiques (FRO, LRO/TRO, LPO, AOC, CPO) qui déterminent directement les performances, l'efficacité énergétique, l'échelle et le coût des clusters IA/ML de nouvelle génération. C'est un rôle très technique et pratique qui fait le pont entre les exigences des clusters ML et le matériel d'interconnexion de pointe — idéal pour les ingénieurs qui aiment à la fois les systèmes d'IA à grande échelle et la physique/l'ingénierie des SerDes 200G+, PAM4, la photonique, l'intégrité du signal et les diagnostics.
RESPONSABILITÉS
- Concevoir, valider et industrialiser des solutions de connectivité cuivre et optique à haute vitesse pour les clusters IA (100k+ GPU).
- Gérer la diligence raisonnable des fournisseurs et l'intégration de nouveaux produits 1.6T, y compris les émetteurs-récepteurs optiques enfichables et AEC (DR4/8, FR4), y compris la mise en service et la caractérisation rigoureuses.
- Étudier l'opportunité d'utiliser LPO et LRO dans notre réseau.
- Évaluer les premiers moteurs co-packagés et proches du boîtier pour les commutateurs et les GPU.
- Rechercher de nouvelles modalités d'interconnexion, y compris les solutions basées sur la radio VCSEL, microLED, THz, pour améliorer l'économie et la fiabilité du réseau.
- Travailler en étroite collaboration avec les fournisseurs (émetteurs-récepteurs, câbles, SerDes, DSP, fonderies de photonique silicium) pour influencer les feuilles de route et assurer la livraison en temps voulu des solutions de nouvelle génération.
- Collaborer avec les équipes d'entraînement ML pour traduire les modèles de communication des charges de travail en exigences concrètes de topologie d'interconnexion et de reconfigurabilité optique.
- Effectuer la simulation au niveau du système des performances globales du tissu réseau.
- Mener l'analyse des défaillances, la recherche des causes profondes et les actions correctives pour les problèmes liés aux interconnexions dans les clusters de production grâce à la collecte et à l'analyse de métriques au niveau de la flotte.
- Contribuer aux outils internes et à l'automatisation pour la surveillance de l'état des interconnexions, la télémétrie, le diagnostic, la remédiation et les pipelines de qualification automatisés.
- Se tenir au courant des normes de l'industrie (OIF CMIS, IEEE) et des technologies émergentes (fibre multi-cœur/creuse, SerDes 448G, TFLN, résonateurs annulaires)
QUALIFICATIONS DE BASE
- Au moins 8+ années d'expérience pratique dans la conception, le déploiement et l'exploitation d'interconnexions cuivre et optique à haute vitesse, de préférence dans un rôle de conception de module ou dans un environnement de datacenter hyperscale.
- Master ou Doctorat en génie électrique, photonique ou physique.
- Connaissance approfondie des performances des SerDes PAM4, de l'égalisation, de la gigue, de la diaphonie.
- Solide compréhension opérationnelle des FEC, Retimers, TIA et Drivers.
- Connaissance approfondie de l'analyse du budget de liaison optique et des métriques de performance, y compris TDECQ, OMA, Tcode, sensibilité du récepteur sous contrainte et diagnostics associés.
- Expertise dans les composants d'émetteurs-récepteurs, y compris les lasers CW, les PIC SiPh, les EML, les DSP, les sous-ensembles passifs, leurs modes de défaillance et leur caractérisation.
- Connaissance des contraintes thermiques, mécaniques, d'alimentation et d'intégrité du signal dans le matériel dense.
- Connaissance du processus de conception SiPh, de l'amélioration du rendement et des tests de fiabilité.
- Familiarité avec les technologies CPO et les défis/zones à risque.
- Familiarité avec les chaînes d'approvisionnement des sous-composants et les fabricants mondiaux, les ODM et les CM.
- Solides compétences en résolution de problèmes et capacité à prospérer dans un environnement rapide et ambigu.
RÉMUNÉRATION ET AVANTAGES
$180,000 - $440,000 USD
Le salaire de base n'est qu'une partie de notre programme de rémunération globale chez SpaceXAI, qui comprend également des actions, une couverture médicale, visuelle et dentaire complète, l'accès à un plan de retraite 401(k), une assurance invalidité de courte et longue durée, une assurance-vie, ainsi que divers autres rabais et avantages.
SpaceXAI est un employeur garantissant l'égalité des chances. Pour plus de détails sur le traitement des données, consultez notre Avis de confidentialité de recrutement x.ai/legal/recruitment-privacy-notice.
