ComTec Solutions LLC
Groq
Sr./Staff Network Design Engineer, AI/HPC
MISSION
Groq baut eine hochleistungsfähige KI-Infrastruktur auf, die darauf ausgelegt ist, Inferenz schnell, vorhersagbar und skalierbar zu machen. Unsere Infrastrukturteams entwerfen und betreiben die Systeme, die Compute, Daten und Dienste in erheblichem Umfang verbinden. Wir suchen einen Sr./Staff Network Engineer, AI/HPC, der uns bei der Architektur, dem Design, der Validierung und der Weiterentwicklung der Netzwerkinfrastruktur unterstützt, die die schnell wachsende KI-Compute-Umgebung von Groq trägt.
Als Sr./Staff Network Design Engineer sind Sie für die Netzarchitektur und das Design in Hochleistungs-Rechenzentren und KI-Infrastrukturen verantwortlich. Sie übersetzen Kapazitäts-, Leistungs-, Zuverlässigkeits- und Geschäftsanforderungen in skalierbare Netzwerkdesigns, die konsistent bereitgestellt und betrieben werden können.
Diese Rolle erfordert tiefgreifende Expertise in Rechenzentrumsnetzwerken, Routing-Protokollen, Netzarchitektur, Automatisierung und groß angelegten Infrastrukturen. Sie arbeiten eng mit den Teams für Netzwerkbetrieb, Rechenzentrumstechnik, Compute, Plattform, Sicherheit und Infrastruktur zusammen, um Designs vom Konzept über die Validierung bis zur Produktionsbereitstellung zu bringen. Sie werden auch dazu beitragen, die Engineering-Standards, Designmuster, Werkzeuge und die technische Ausrichtung festzulegen, die es der Netzwerkinfrastruktur von Groq ermöglichen, zu skalieren.
In dieser Rolle bedeutet Erfolg, Netzarchitekturen zu schaffen, die es der Infrastruktur von Groq ermöglichen, zu wachsen, ohne Leistung, Zuverlässigkeit oder betriebliche Einfachheit zu beeinträchtigen. Sie erstellen wiederholbare Designs anstelle von Einzellösungen, automatisieren, wo immer es praktikabel ist, identifizieren Skalierungsgrenzen, bevor sie zu Produktionsproblemen werden, und machen das Netzwerk zu einer ermöglichenden Schicht für die Compute-Infrastruktur von Groq.
Sie kombinieren tiefgreifende Netzwerkerfahrung mit einem System-Engineering-Ansatz – und berücksichtigen dabei nicht nur, ob ein Netzwerk funktioniert, sondern auch, wie es in großem Maßstab funktioniert, wie es ausfällt, wie es validiert wird und wie effizient es betrieben werden kann.
Vergütung
Standort: Diese Stelle wird in einem unserer drei Einstellungszentren angesiedelt sein: im Großraum Dallas, San Francisco oder New York City. Die für diese Stelle eingestellte Person muss in einem dieser drei Gebiete ansässig sein. Sie haben die Flexibilität, remote zu arbeiten, während wir unser lokales Groq-Büro einrichten, mit der Erwartung, dass diese Stelle nach Eröffnung des Büros vor Ort stattfindet.
Groq verpflichtet sich, eine wettbewerbsfähige Vergütung durch unsere Total Cash-Philosophie anzubieten, die den potenziellen Bonuswert direkt in das Grundgehalt integriert. Die Gehaltsspanne für diese Position, die den potenziellen Bonuswert einschließt, beträgt 270.400 $-401.600 $, wobei die individuelle Einstufung durch Ihren geografischen Standort, Ihre Erfahrung, Ihre Fähigkeiten und die Übereinstimmung mit internen Vergütungsstandards bestimmt wird. Diese Spanne gilt speziell für Kandidaten mit Sitz in den Vereinigten Staaten. Die Vergütung für internationale Kandidaten variiert je nach lokalen Marktdynamiken. Über die Barvergütung hinaus bietet Groq auch ein Long-Term Incentive (LTI) Programm und eine robuste Palette von Mitarbeiterleistungen an.
VERANTWORTLICHKEITEN & MÖGLICHKEITEN IN DIESER ROLLE: *
- Verantwortlich für den gesamten Netzwerkdesignprozess, die Übersetzung von Kundenanforderungen an Compute, Workloads, Skalierung und Mandantenfähigkeit in produktionsreife Architekturen für KI-Training und -Inferenz. *
- Enge Zusammenarbeit mit Softwareteams, die Inferenz- und Trainingsstacks entwickeln, um die Netzwerktopologie mit der Stack-Architektur abzustimmen. *
- Entwicklung von Netzarchitekturen, High-Level Designs (HLDs), Low-Level Designs (LLDs), Überprüfung von Stücklisten (BOMs) und Implementierungsstandards unter Nutzung von Branchen- und Anbieterreferenzarchitekturen. *
- Design von Spine-Leaf/Clos-Netzwerk-Fabrics für front-end, back-end und Speichernetzwerke mit Schwerpunkt auf Leistung, Ausfallsicherheit, Skalierbarkeit und betrieblicher Einfachheit. *
- Bewertung und Implementierung von Technologien wie BGP, EVPN, VXLAN, ECMP, IPv4/IPv6, QoS. *
- Entwicklung von Strategien für Rechenzentrum-Interconnect, WAN-Konnektivität, Internet-Edge, Cloud-Konnektivität und externe Peering. *
- Durchführung von Netzwerk-Kapazitätsplanung und Traffic Engineering für High-Bandwidth-KI- und verteilte Compute-Workloads. *
- Partnerschaft mit Compute- und Infrastruktur-Engineering-Teams, um Kommunikationsmuster von Workloads zu verstehen und diese in Netzwerkanforderungen zu übersetzen. *
- Festlegung von Standards für Netzwerk-Hardwareplattformen, Topologie, Adressierung, Routing-Richtlinien, Konfiguration und Lebenszyklusmanagement. *
- Bewertung von Switches, Optiken, Verkabelungsarchitekturen, Netzwerkbetriebssystemen und aufkommenden Netzwerktechnologien. *
- Aufbau von Laborumgebungen, Proofs of Concept und Design-Validierungs-Frameworks, bevor neue Architekturen in die Produktion eingeführt werden. *
- Definition von Fehlerszenarien und Validierung des Netzwerkverhaltens bei Ausfällen von Links, Geräten, Control-Planes und Standorten. *
- Förderung von Netzwerautomatisierung und Infrastructure-as-Code-Praktiken unter Verwendung von Technologien wie Python, Ansible, Git, APIs und CI/CD-Pipelines. *
- Entwicklung von automatisierten Design-Validierungs-, Konfigurationsgenerierungs-, Compliance- und Testfähigkeiten. *
- Festlegung von Anforderungen an die Netzwerksichtbarkeit, einschließlich Telemetrie, Leistungsmetriken, Alarmierung und Kapazitätsübersicht. *
- Leitung technischer Überprüfungen und Bereitstellung von Anleitungen zu komplexen Netzarchitektur- und Designentscheidungen. *
- Fehlerbehebung bei komplexen Leistungs- und Zuverlässigkeitsproblemen, die Netzwerk, Compute, Hardware und verteilte Systeme umfassen. *
- Partnerschaft mit Betriebsteams, um sicherzustellen, dass Designs supportfähig, beobachtbar und sicher im Betrieb in großem Maßstab sind. *
- Mentoring von Ingenieuren und Anhebung der technischen Messlatte für Netzarchitektur, Automatisierung, Dokumentation und Engineering-Praktiken.
IDEALE KANDIDATEN HABEN/SIND: *
- 8+ Jahre Erfahrung in Netzwerk-Engineering, Architektur oder Infrastruktur-Engineering, mit erheblicher Erfahrung im Design von Rechenzentrumsnetzwerken in großem Maßstab. *
- Tiefes Verständnis von TCP/IP, BGP und modernen Rechenzentrums-Routing-Architekturen. *
- Umfangreiche Erfahrung im Design von Leaf-Spine / Clos-Netzwerk-Fabrics. *
- Erfahrung mit EVPN/VXLAN und modernen Netzwerkvirtualisierungsarchitekturen. *
- Starkes Verständnis von ECMP, Routing-Konvergenz, Fehlerdomänen, Traffic Engineering und Netzwerkausfallsicherheit. *
- Erfahrung im Design von Netzwerken mit High-Bandwidth-Ethernet-Plattformen, einschließlich 100G, 400G oder höherer Schnittstellen. *
- Fundierte Kenntnisse der Grundlagen optischer Netzwerke, Transceiver, Glasfaserinfrastruktur und Rechenzentrumverkabelung. *
- Erfahrung mit Netzwerkplattformen und Betriebssystemen von Anbietern wie Arista, Cisco, Juniper, NVIDIA oder gleichwertig. *
- Erfahrung mit Netzwerautomatisierung und Softwareentwicklung mit Python und APIs. *
- Vertrautheit mit Infrastructure-as-Code, Quellcodeverwaltung, automatisierten Tests und CI/CD-Engineering-Praktiken. *
- Erfahrung mit Netzwerk-Telemetrie- und Beobachtbarkeitstechnologien wie Streaming-Telemetrie, SNMP, Flow-Daten und Zeitreihenüberwachung. *
- Starkes Verständnis von Linux-Netzwerken und TCP/IP-Grundlagen. *
- Nachgewiesene Fähigkeit, Architektur-Dokumente, Design-Standards, Implementierungspläne und technische Spezifikationen zu entwickeln. *
- Fähigkeit, komplexe Systeme zu analysieren und fundierte architektonische Entscheidungen zu treffen, die Leistungs-, Zuverlässigkeits-, Kosten- und betriebliche Kompromisse beinhalten. *
- Starke Kommunikationsfähigkeiten und die Fähigkeit, technische Entscheidungen in Engineering-Organisationen zu beeinflussen. *
- Erfahrung im Design von Netzwerken für KI/ML-Cluster, HPC-Umgebungen, verteilte Computersysteme oder große GPU/Beschleuniger-Bereitstellungen. *
- Erfahrung mit Ethernet-Fabrics in sehr großem Maßstab und East-West-Verkehrsmustern mit hohem Durchsatz. *
- Kenntnisse von RDMA, Priority Flow Control (PFC), ECN, Congestion Management und verlustfreien oder nahezu verlustfreien Ethernet-Designs. *
- Erfahrung im Design von Netzwerken, die verteiltes Training oder KI-Inferenz in großem Maßstab unterstützen. *
- Vertrautheit mit SONiC oder anderen disaggregierten/offenen Netzwerkplattformen. *
- Erfahrung mit Multi-Site-Rechenzentrumarchitekturen und Rechenzentrum-Interconnect. *
- Erfahrung in der Arbeit mit Cloud-Netzwerkumgebungen wie AWS, GCP oder Azure. *
- Vertrautheit mit Netzwerk-Source-of-Truth- und Automatisierungsplattformen wie NetBox, Nautobot oder gleichwertigen Systemen. *
- Erfahrung im Design und Betrieb von Infrastrukturen bei Hyperscalern oder in schnell wachsenden Technologieumgebungen.
- Vertrautheit mit Backend-Technologien wie Infiniband/RoCE/Spectrum-X ist sehr wünschenswert. *
Warum zu uns kommen: *
- Purposeful Hiring: Sie sind nicht zufällig hier, und niemand sonst. Jedes Teammitglied wird bewusst ausgewählt, denn mit wem wir aufbauen, ist wichtig. *
- Builders Wanted: Sie reiten nicht nur auf der Rakete, Sie bauen sie. Ihre Arbeit prägt direkt die Flugbahn unseres Unternehmens. *
- Missionsgetriebene Arbeit: Wir sind hier, um einen echten Einfluss zu erzielen. Unsere Mission treibt alles an, was wir tun. *
- Harte Probleme angehen: Wenn Einfachheit nicht Ihr Ding ist, sind Sie hier genau richtig. Wir lösen einige der komplexesten und spannendsten Herausforderungen in unserem Bereich. *
- Exzellenz ist der Standard: Hohe Leistung wird nicht nur gefördert, sie ist die Basis. Und sie ist ansteckend.
