OKSI
Groq
Ingeniero/a de diseño de redes Sr./Staff, IA/HPC
MISIÓN
Groq está construyendo una infraestructura de IA de alto rendimiento diseñada para que la inferencia sea rápida, predecible y escalable. Nuestros equipos de infraestructura diseñan y operan los sistemas que conectan la computación, los datos y los servicios a gran escala. Buscamos un/a ingeniero/a de redes Sr./Staff, IA/HPC para ayudar a arquitectar, diseñar, validar y evolucionar la infraestructura de red que da soporte a los entornos de computación de IA de Groq, en rápido crecimiento.
Como ingeniero/a de diseño de redes Sr./Staff, serás responsable de la arquitectura y el diseño de la red en entornos de centros de datos de alto rendimiento e infraestructura de IA. Traducirás los requisitos de capacidad, rendimiento, fiabilidad y negocio en diseños de red escalables que puedan implementarse y operarse de forma consistente.
Este puesto requiere una profunda experiencia en redes de centros de datos, protocolos de enrutamiento, arquitectura de redes, automatización e infraestructura a gran escala. Trabajarás en estrecha colaboración con los equipos de operaciones de red, ingeniería de centros de datos, computación, plataforma, seguridad e infraestructura para llevar los diseños desde el concepto hasta la validación y el despliegue en producción. También ayudarás a establecer los estándares de ingeniería, los patrones de diseño, las herramientas y la dirección técnica que permitan escalar la infraestructura de red de Groq.
En este puesto, el éxito significa construir arquitecturas de red que permitan el crecimiento de la infraestructura de Groq sin sacrificar el rendimiento, la fiabilidad o la simplicidad operativa. Crearás diseños repetibles en lugar de soluciones únicas, automatizarás siempre que sea práctico, identificarás los límites de escalabilidad antes de que se conviertan en problemas de producción y harás de la red una capa habilitadora para la infraestructura de computación de Groq.
Combinarás una profunda experiencia en redes con una mentalidad de ingeniería de sistemas, considerando no solo si una red funciona, sino cómo se comporta a escala, cómo falla, cómo se valida y cuán eficientemente se puede operar.
Compensación
Ubicación: Este puesto se basará en uno de nuestros tres centros de contratación: el área de Dallas, San Francisco o Nueva York. La persona contratada para este puesto debe residir en una de estas tres áreas. Tendrás la flexibilidad de trabajar de forma remota mientras establecemos nuestra oficina local de Groq, con la expectativa de que este puesto se traslade a la oficina una vez que esta abra.
Groq se compromete a proporcionar una compensación competitiva a través de nuestra filosofía de Efectivo Total, que incorpora el valor potencial de bonificación directamente en el salario base. El rango salarial total en efectivo para este puesto, que incluye el valor potencial de bonificación, es de $270,400-$401,600, con la ubicación individual determinada por tu ubicación geográfica, experiencia, habilidades y alineación con los estándares de compensación internos. Este rango es específico para candidatos ubicados en los Estados Unidos. La compensación para candidatos internacionales variará según la dinámica del mercado local. Más allá de la compensación en efectivo, Groq también ofrece un Programa de Incentivos a Largo Plazo (LTI) y un sólido conjunto de beneficios para empleados.
RESPONSABILIDADES Y OPORTUNIDADES EN ESTE PUESTO: *
- Ser responsable del proceso de diseño de red de extremo a extremo, traduciendo los requisitos de computación, carga de trabajo, escala y tenencia del cliente en arquitecturas listas para producción para entrenamiento e inferencia de IA. *
- Trabajar en estrecha colaboración con los equipos de software que desarrollan pilas de inferencia y entrenamiento para alinear la topología de red con la arquitectura de la pila. *
- Desarrollar arquitecturas de red, diseños de alto nivel (HLD), diseños de bajo nivel (LLD), revisar listas de materiales (BOM) y estándares de implementación aprovechando arquitecturas de referencia de la industria y del proveedor. *
- Diseñar tejidos spine-leaf/Clos en redes front-end, back-end y de almacenamiento, con un enfoque en el rendimiento, la resiliencia, la escalabilidad y la simplicidad operativa. *
- Evaluar e implementar tecnologías como BGP, EVPN, VXLAN, ECMP, IPv4/IPv6, QoS. *
- Desarrollar estrategias para la interconexión de centros de datos, conectividad WAN, borde de Internet, conectividad en la nube y peering externo. *
- Realizar planificación de capacidad de red y ingeniería de tráfico para cargas de trabajo de IA y computación distribuida de alto ancho de banda. *
- Colaborar con los equipos de ingeniería de computación e infraestructura para comprender los patrones de comunicación de las cargas de trabajo y traducirlos en requisitos de red. *
- Establecer estándares para plataformas de hardware de red, topología, direccionamiento, política de enrutamiento, configuración y gestión del ciclo de vida. *
- Evaluar switches, ópticas, arquitecturas de cableado, sistemas operativos de red y tecnologías de red emergentes. *
- Construir entornos de laboratorio, pruebas de concepto y marcos de validación de diseño antes de introducir nuevas arquitecturas en producción. *
- Definir escenarios de fallo y validar el comportamiento de la red durante fallos de enlace, dispositivo, plano de control y sitio. *
- Impulsar la automatización de redes y las prácticas de infraestructura como código utilizando tecnologías como Python, Ansible, Git, APIs y pipelines de CI/CD. *
- Desarrollar capacidades de validación de diseño automatizada, generación de configuración, cumplimiento y pruebas. *
- Establecer requisitos de observabilidad de red, incluyendo telemetría, métricas de rendimiento, alertas y visibilidad de capacidad. *
- Liderar revisiones técnicas y proporcionar orientación sobre decisiones complejas de arquitectura y diseño de redes. *
- Solucionar problemas complejos de rendimiento y fiabilidad que abarcan redes, computación, hardware y sistemas distribuidos. *
- Colaborar con los equipos de operaciones para garantizar que los diseños sean compatibles, observables y seguros para operar a escala. *
- Mentorizar a ingenieros y elevar el nivel técnico de la arquitectura de red, la automatización, la documentación y las prácticas de ingeniería.
LOS CANDIDATOS IDEALES TIENEN/SON: *
- + de 8 años de experiencia en ingeniería de redes, arquitectura o ingeniería de infraestructura, con experiencia significativa en el diseño de redes de centros de datos a gran escala. *
- Profundo conocimiento de TCP/IP, BGP y arquitecturas de enrutamiento modernas de centros de datos. *
- Sólida experiencia en el diseño de tejidos de red leaf-spine / Clos. *
- Experiencia con EVPN/VXLAN y arquitecturas modernas de virtualización de red. *
- Sólido conocimiento de ECMP, convergencia de enrutamiento, dominios de fallo, ingeniería de tráfico y resiliencia de red. *
- Experiencia en el diseño de redes con plataformas Ethernet de alto ancho de banda, incluyendo interfaces de 100G, 400G o de mayor velocidad. *
- Sólidos conocimientos de los fundamentos de la red óptica, transceptores, infraestructura de fibra y cableado de centros de datos. *
- Experiencia con plataformas y sistemas operativos de red de proveedores como Arista, Cisco, Juniper, NVIDIA o equivalentes. *
- Experiencia en automatización de redes y desarrollo de software utilizando Python y APIs. *
- Familiaridad con infraestructura como código, control de versiones, pruebas automatizadas y prácticas de ingeniería de CI/CD. *
- Experiencia con tecnologías de telemetría y observabilidad de red como telemetría de streaming, SNMP, datos de flujo y monitorización de series temporales. *
- Sólido conocimiento de redes Linux y fundamentos de TCP/IP. *
- Capacidad demostrada para desarrollar documentos de arquitectura, estándares de diseño, planes de implementación y especificaciones técnicas. *
- Capacidad para analizar sistemas complejos y tomar decisiones arquitectónicas sólidas que involucren compensaciones de rendimiento, fiabilidad, coste y operativas. *
- Sólidas habilidades de comunicación y capacidad para influir en las decisiones técnicas en organizaciones de ingeniería. *
- Experiencia en el diseño de redes para clústeres de IA/ML, entornos HPC, sistemas de computación distribuida o despliegues a gran escala de GPU/aceleradores. *
- Experiencia con tejidos Ethernet a muy gran escala y patrones de tráfico este-oeste de alto rendimiento. *
- Conocimiento de RDMA, Priority Flow Control (PFC), ECN, gestión de congestión y diseño de Ethernet sin pérdidas o casi sin pérdidas. *
- Experiencia en el diseño de redes que soportan entrenamiento distribuido o inferencia de IA a gran escala. *
- Familiaridad con SONiC u otras plataformas de red abiertas/desagregadas. *
- Experiencia con arquitectura de centros de datos multisitio e interconexión de centros de datos. *
- Experiencia trabajando con entornos de redes en la nube como AWS, GCP o Azure. *
- Familiaridad con plataformas de fuente de verdad y automatización de redes como NetBox, Nautobot o sistemas equivalentes. *
- Experiencia en el diseño y operación de infraestructura a hiperescala o en entornos tecnológicos en rápido crecimiento.
- Familiaridad con tecnologías backend como Infiniband/RoCE/ Spectrum-X, experiencia muy valorada. *
¿Por qué unirte a nosotros? *
- Contratación con Propósito: No estás aquí por accidente, y nadie más lo está. Cada miembro del equipo es elegido a mano con intención porque con quién construimos importa. *
- Buscamos Constructores: No solo estás montando en la nave espacial, la estás construyendo. Tu trabajo da forma directamente a la trayectoria de nuestra empresa. *
- Trabajo Impulsado por la Misión: Estamos aquí para tener un impacto real. Nuestra misión impulsa todo lo que hacemos. *
- Abordando Problemas Difíciles: Si lo fácil no es lo tuyo, estás en el lugar correcto. Resolvemos algunos de los desafíos más complejos y emocionantes en nuestro sector. *
- La Excelencia es el Estándar: El alto rendimiento no solo se fomenta, es la base. Y es contagioso.
