OKSI
Groq
Ingénieur Conception Réseau Staff / Senior, IA/HPC
MISSION
Groq construit une infrastructure IA haute performance conçue pour rendre l'inférence rapide, prévisible et évolutive. Nos équipes d'infrastructure conçoivent et exploitent les systèmes qui connectent le calcul, les données et les services à grande échelle. Nous recherchons un Ingénieur Réseau IA/HPC Staff / Senior pour aider à architecturer, concevoir, valider et faire évoluer l'infrastructure réseau soutenant les environnements de calcul IA en croissance rapide de Groq.
En tant qu'Ingénieur Conception Réseau Staff / Senior, vous serez responsable de l'architecture et de la conception du réseau sur des environnements d'infrastructure IA et de centres de données haute performance. Vous traduirez les exigences de capacité, de performance, de fiabilité et commerciales en conceptions réseau évolutives qui peuvent être déployées et exploitées de manière cohérente.
Ce rôle exige une expertise approfondie en réseautage de centres de données, protocoles de routage, architecture réseau, automatisation et infrastructure à grande échelle. Vous travaillerez en étroite collaboration avec les équipes d'exploitation réseau, d'ingénierie de centres de données, de calcul, de plateforme, de sécurité et d'infrastructure pour mener les conceptions du concept à la validation et au déploiement en production. Vous contribuerez également à établir les normes d'ingénierie, les modèles de conception, les outils et la direction technique qui permettront à l'infrastructure réseau de Groq de s'adapter.
Dans ce rôle, le succès signifie construire des architectures réseau qui permettent à l'infrastructure de Groq de croître sans sacrifier la performance, la fiabilité ou la simplicité opérationnelle. Vous créerez des conceptions reproductibles plutôt que des solutions uniques, automatiserez dans la mesure du possible, identifierez les limites d'évolutivité avant qu'elles ne deviennent des problèmes de production, et ferez du réseau une couche facilitatrice pour l'infrastructure de calcul de Groq.
Vous combinerez une expertise réseau approfondie avec un état d'esprit d'ingénierie système, en considérant non seulement si un réseau fonctionne, mais aussi comment il se comporte à grande échelle, comment il échoue, comment il est validé et avec quelle efficacité il peut être exploité.
Rémunération
Lieu : Ce poste sera basé dans l'un de nos trois pôles de recrutement : la région de Dallas, San Francisco ou New York. La personne embauchée pour ce poste doit résider dans l'une de ces trois régions. Vous aurez la flexibilité de travailler à distance pendant que nous établissons notre bureau local Groq, avec l'attente que ce rôle deviendra sur site une fois le bureau ouvert.
Groq s'engage à fournir une rémunération compétitive grâce à notre philosophie de 'Total Cash', qui intègre la valeur potentielle des bonus directement dans le salaire de base. La fourchette de salaire total en espèces pour ce poste, qui inclut la valeur potentielle des bonus, est de 270,400 à 401,600 $, le placement individuel étant déterminé par votre emplacement géographique, votre expérience, vos compétences et votre alignement avec les normes de rémunération internes. Cette fourchette est spécifique aux candidats situés aux États-Unis. La rémunération des candidats internationaux variera en fonction des dynamiques du marché local. Au-delà de la rémunération en espèces, Groq propose également un programme d'incitation à long terme (LTI) et une suite complète d'avantages sociaux pour les employés.
RESPONSABILITÉS ET OPPORTUNITÉS DANS CE RÔLE : *
- Être responsable du processus de conception réseau de bout en bout, en traduisant les exigences de calcul client, de charge de travail, d'échelle et de tenancy en architectures prêtes pour la production pour l'entraînement et l'inférence IA. *
- Travailler en étroite collaboration avec les équipes logicielles développant des piles d'inférence et d'entraînement pour aligner la topologie réseau sur l'architecture de la pile. *
- Développer des architectures réseau, des conceptions de haut niveau (HLD), des conceptions de bas niveau (LLD), examiner les nomenclatures (BOM) et les normes de mise en œuvre en s'appuyant sur les architectures de référence de l'industrie et des fournisseurs. *
- Concevoir des fabrics spine-leaf/Clos pour les réseaux front-end, back-end et de stockage, en mettant l'accent sur la performance, la résilience, l'évolutivité et la simplicité opérationnelle. *
- Évaluer et implémenter des technologies telles que BGP, EVPN, VXLAN, ECMP, IPv4/IPv6, QoS. *
- Développer des stratégies pour l'interconnexion de centres de données, la connectivité WAN, le bord Internet, la connectivité cloud et le peering externe. *
- Effectuer la planification de la capacité réseau et l'ingénierie du trafic pour les charges de travail IA et de calcul distribué à large bande passante. *
- Collaborer avec les équipes d'ingénierie de calcul et d'infrastructure pour comprendre les modèles de communication des charges de travail et les traduire en exigences réseau. *
- Établir des normes pour les plateformes matérielles réseau, la topologie, l'adressage, la politique de routage, la configuration et la gestion du cycle de vie. *
- Évaluer les commutateurs, les optiques, les architectures de câblage, les systèmes d'exploitation réseau et les technologies réseau émergentes. *
- Construire des environnements de laboratoire, des preuves de concept et des cadres de validation de conception avant d'introduire de nouvelles architectures en production. *
- Définir les scénarios de défaillance et valider le comportement du réseau lors de défaillances de liens, d'appareils, de plans de contrôle et de sites. *
- Piloter l'automatisation du réseau et les pratiques d'infrastructure en tant que code (IaC) en utilisant des technologies telles que Python, Ansible, Git, APIs et les pipelines CI/CD. *
- Développer des capacités de validation de conception automatisée, de génération de configuration, de conformité et de test. *
- Établir les exigences d'observabilité du réseau, y compris la télémétrie, les métriques de performance, l'alerte et la visibilité de la capacité. *
- Diriger des revues techniques et fournir des conseils sur des décisions complexes d'architecture et de conception réseau. *
- Dépanner des problèmes complexes de performance et de fiabilité qui couvrent le réseau, le calcul, le matériel et les systèmes distribués. *
- Collaborer avec les équipes d'exploitation pour garantir que les conceptions sont supportables, observables et sûres à exploiter à grande échelle. *
- Mentorer des ingénieurs et élever le niveau technique pour l'architecture réseau, l'automatisation, la documentation et les pratiques d'ingénierie.
LES CANDIDATS IDÉAUX ONT/SONT : *
- + de 8 ans d'expérience en ingénierie réseau, architecture ou ingénierie d'infrastructure, avec une expérience significative dans la conception de réseaux de centres de données à grande échelle. *
- Compréhension approfondie de TCP/IP, BGP et des architectures de routage modernes de centres de données. *
- Solide expérience dans la conception de fabrics réseau leaf-spine / Clos. *
- Expérience avec EVPN/VXLAN et les architectures modernes de virtualisation réseau. *
- Solide compréhension de l'ECMP, de la convergence de routage, des domaines de défaillance, de l'ingénierie du trafic et de la résilience du réseau. *
- Expérience dans la conception de réseaux avec des plateformes Ethernet à large bande passante, y compris des interfaces 100G, 400G ou plus rapides. *
- Solide connaissance des fondamentaux du réseau optique, des émetteurs-récepteurs, de l'infrastructure fibre et du câblage des centres de données. *
- Expérience avec des plateformes et systèmes d'exploitation réseau de fournisseurs tels qu'Arista, Cisco, Juniper, NVIDIA ou équivalents. *
- Expérience avec l'automatisation réseau et le développement logiciel en utilisant Python et APIs. *
- Familiarité avec l'infrastructure en tant que code, le contrôle de version, les tests automatisés et les pratiques d'ingénierie CI/CD. *
- Expérience avec les technologies de télémétrie et d'observabilité réseau telles que la télémétrie en flux, SNMP, les données de flux et la surveillance des séries temporelles. *
- Solide compréhension du réseautage Linux et des fondamentaux de TCP/IP. *
- Capacité démontrée à développer des documents d'architecture, des normes de conception, des plans de mise en œuvre et des spécifications techniques. *
- Capacité à analyser des systèmes complexes et à prendre des décisions architecturales solides impliquant des compromis de performance, de fiabilité, de coût et d'exploitation. *
- Solides compétences en communication et capacité à influencer les décisions techniques au sein des organisations d'ingénierie. *
- Expérience dans la conception de réseaux pour des clusters IA/ML, des environnements HPC, des systèmes de calcul distribué ou des déploiements GPU/accélérateurs à grande échelle. *
- Expérience avec des fabrics Ethernet à très grande échelle et des modèles de trafic est-ouest à haut débit. *
- Connaissance de RDMA, Priority Flow Control (PFC), ECN, gestion de la congestion et conception Ethernet sans perte ou quasi sans perte. *
- Expérience dans la conception de réseaux supportant l'entraînement distribué ou l'inférence IA à grande échelle. *
- Familiarité avec SONiC ou d'autres plateformes réseau désagrégées/ouvertes. *
- Expérience avec l'architecture de centres de données multi-sites et l'interconnexion de centres de données. *
- Expérience de travail avec des environnements réseau cloud tels que AWS, GCP ou Azure. *
- Familiarité avec les plateformes de source de vérité réseau et d'automatisation telles que NetBox, Nautobot ou des systèmes équivalents. *
- Expérience dans la conception et l'exploitation d'infrastructures à l'échelle hyperscale ou dans des environnements technologiques en croissance rapide.
- Familiarité avec les technologies backend comme Infiniband/RoCE/Spectrum-X fortement préférée. *
Pourquoi nous rejoindre : *
- Recrutement ciblé : Vous n'êtes pas ici par hasard, et personne d'autre non plus. Chaque membre de l'équipe est choisi avec intention car ceux avec qui nous construisons comptent. *
- Appel aux bâtisseurs : Vous ne faites pas que monter dans la fusée, vous la construisez. Votre travail façonne directement la trajectoire de notre entreprise. *
- Travail axé sur la mission : Nous sommes là pour avoir un impact réel. Notre mission alimente tout ce que nous faisons. *
- Relever des défis complexes : Si la facilité n'est pas votre truc, vous êtes au bon endroit. Nous résolvons certains des défis les plus complexes et passionnants de notre secteur. *
- L'excellence est la norme : La haute performance n'est pas seulement encouragée, c'est la base. Et c'est contagieux.
