Roku
CoreWeave
Ingeniero Principal - Rendimiento y Benchmarking
SOBRE ESTE ROL
CoreWeave es The Essential Cloud for AI™.
Creado por pioneros para pioneros, CoreWeave ofrece una plataforma de tecnología, herramientas y equipos que permite a los innovadores crear y escalar IA con confianza. Con la confianza de los principales laboratorios de IA, startups y empresas globales, CoreWeave combina un rendimiento de infraestructura superior con una profunda experiencia técnica para acelerar los avances y convertir la computación en capacidad. Fundada en 2017, CoreWeave se convirtió en una empresa que cotiza en bolsa (Nasdaq: CRWV) en marzo de 2025. Obtenga más información en coreweave.com coreweave.com/.
Buscamos un Ingeniero Principal para liderar técnicamente el equipo de Benchmarking y Rendimiento de CoreWeave. Será responsable de nuestro almacén de datos de rendimiento a escala planetaria: ingesta, almacenamiento, transformación y análisis de eventos de rendimiento en todos los centros de datos de nuestra infraestructura global. También será una parte integral para lograr publicaciones de referencia de rendimiento de extremo a extremo líderes en la industria: Si MLPerf (Entrenamiento e Inferencia), trabajando en estrecha colaboración con NVIDIA (Megatron-LM, TensorRT-LLM y DGX cloud) y la comunidad de código abierto (llm-d, vLLM y todos los frameworks de ML populares) le interesan, venga a ayudarnos a demostrar el liderazgo en fiabilidad de rendimiento de CoreWeave en el campo.
Qué harás
- Estrategia y Liderazgo - Definir la estrategia y hoja de ruta de benchmarking multianual; priorizar modelos/cargas de trabajo (LLMs, difusión, visión, voz) y niveles de hardware. Construir, liderar y mentorizar un equipo de alto rendimiento de ingenieros de rendimiento y analistas de datos. Establecer la gobernanza de las afirmaciones: metodologías documentadas, versionado, reproducibilidad y pistas de auditoría.
- Propiedad del Rendimiento - Liderar las presentaciones de MLPerf Inferencia y Entrenamiento de extremo a extremo: selección de cargas de trabajo, planificación de clústeres, runbooks, auditorías y publicación de resultados. Coordinar las pistas de optimización con NVIDIA (CUDA, cuDNN, TensorRT/TensorRT-LLM, Triton, NCCL) para obtener resultados competitivos; impulsar correcciones upstream cuando sea necesario.
- Benchmarks Internos de Latencia y Rendimiento - Diseñar un servicio de benchmarking repetible, nativo de Kubernetes, que ejercite las pilas de CoreWeave a través de SUNK (Slurm en Kubernetes), Kueue y pipelines de Kubeflow. Medir y reportar latencia p50/p95/p99, jitter, tokens/s, tiempo hasta el primer token, arranque en frío/caliente, y coste por token/solicitud en modelos, precisiones (BF16/FP8/FP4), tamaños de lote y tipos de GPU. Mantener un corpus de escenarios representativos (streaming, batch, multi-inquilino) y conjuntos de datos; automatizar comparaciones entre lanzamientos de software y generaciones de hardware.
- Herramientas y Automatización - Construir pipelines de CI/CD y controladores/operadores de K8 para programar benchmarks a escala; integrar con pilas de observabilidad (Prometheus, Grafana, OpenTelemetry) y almacenes de resultados. Implementar la integridad de la cadena de suministro para artefactos de benchmark (SBOMs, firmas Cosign).
- Interfuncional y Comunidad - Colaborar con NVIDIA, ISVs clave y proyectos OSS (vLLM, Triton, KServe, PyTorch/DeepSpeed, ONNX Runtime) para co-desarrollar optimizaciones y mejoras upstream. Apoyar a Ventas/SEs con números autorizados para RFPs y evaluaciones competitivas; informar a analistas y prensa con datos rigurosos y defendibles.
Quién eres
- Más de 10 años construyendo sistemas distribuidos o servicios HPC/cloud, con profunda experiencia en entrenamiento de ML a gran escala o cargas de trabajo de alto rendimiento similares.
- Trayectoria probada en la arquitectura o construcción de sistemas de datos a escala planetaria (por ejemplo, plataformas de telemetría, pilas de observabilidad, almacenes de datos en la nube, motores OLAP a gran escala).
- Profundo conocimiento del rendimiento de GPU (CUDA, NCCL, RDMA, NVLink/PCIe, ancho de banda de memoria), pilas de servidores de modelos (Triton, vLLM, TensorRT-LLM, TorchServe) y frameworks de entrenamiento distribuido (PyTorch FSDP/DeepSpeed/Megatron-LM).
- Competente en Kubernetes y planos de control de ML; familiaridad con SUNK, Kueue y Kubeflow en entornos de producción.
- Excelentes habilidades de comunicación para interactuar con ejecutivos, clientes, auditores y comunidades OSS.
A tener en cuenta
- Experiencia con bases de datos de series temporales, árboles de fusión de registros (LSM) o desarrollo de motores de almacenamiento personalizados.
- Experiencia en la ejecución de envíos de MLPerf (Inferencia y/o Entrenamiento) o benchmarks auditados equivalentes a escala.
- Contribuciones a MLPerf, Triton, vLLM, PyTorch, KServe o proyectos OSS similares.
- Experiencia en benchmarking de flotas multirregionales y clústeres grandes (miles de GPUs).
- Publicaciones/charlas sobre rendimiento de ML, ingeniería de latencia o metodología de benchmarking a gran escala.
Qué ofrecemos
El rango salarial base para este puesto es de $206,000 a $333,000. El salario inicial se determinará en función del conocimiento, las habilidades, la experiencia y la ubicación del mercado relacionados con el puesto. Nos esforzamos por lograr tanto la alineación con el mercado como la equidad interna al determinar la compensación. Además del salario base, nuestro paquete total de recompensas incluye un bono discrecional, concesión de acciones y un programa integral de beneficios (todo sujeto a elegibilidad).
El rango que hemos publicado representa el rango de compensación típico para este puesto. Para determinar la compensación real, revisamos la tarifa de mercado para cada candidato, que puede incluir una variedad de factores. Estos incluyen calificaciones, experiencia, rendimiento en la entrevista y ubicación.
Además de un salario competitivo, ofrecemos una variedad de beneficios para satisfacer sus necesidades. Los beneficios a continuación reflejan nuestras ofertas para empleados a tiempo completo en EE. UU.; para puestos en otras ubicaciones, los beneficios varían y se comparten durante el proceso de contratación. Estos incluyen:
- Seguro médico, dental y de visión: 100% pagado por CoreWeave
- Seguro de vida pagado por la empresa
- Seguro de vida suplementario voluntario
- Seguro de incapacidad a corto y largo plazo
- Cuenta de Gasto Flexible
- Cuenta de Ahorro para la Salud
- Reembolso de Matrícula
- Posibilidad de participar en el Programa de Compra de Acciones para Empleados (ESPP)
- Beneficios de Bienestar Mental a través de Spring Health
- Soporte para la Formación Familiar proporcionado por Carrot
- Permiso Parental Pagado
- Cuidado infantil flexible y de servicio completo con Kinside
- 401(k) con una generosa contrapartida del empleador
- PTO Flexible
- Almuerzo de catering cada día en nuestras oficinas y centros de datos
- Un entorno de trabajo informal
- Una cultura de trabajo centrada en la disrupción innovadora
Igualdad de Oportunidades y Acomodaciones
Solicitantes de California
Ley de Privacidad del Consumidor de California drive.google.com/file/d/1gPBRBhUNAMBmj7Yn4_M-hCugm7ZJD4hr/view?usp=sharing
CoreWeave es un empleador que ofrece igualdad de oportunidades, comprometido con fomentar un lugar de trabajo inclusivo y de apoyo. Todos los solicitantes y candidatos cualificados recibirán consideración para el empleo sin distinción de raza, color, religión, sexo, discapacidad, edad, orientación sexual, identidad de género, origen nacional, estado de veterano o información genética.
Como parte de este compromiso y de acuerdo con la Ley de Estadounidenses con Discapacidades (ADA) eeoc.gov/laws/guidance/fact-sheet-disability-discrimination, CoreWeave garantizará que a los solicitantes y candidatos cualificados con discapacidades se les proporcionen acomodaciones razonables para el proceso de contratación, a menos que dicha acomodación cause una dificultad excesiva. Si se necesita una acomodación razonable, póngase en contacto con: [email protected] [[email protected]].
Cumplimiento de Control de Exportaciones
Este puesto requiere acceso a información sujeta a control de exportaciones. Para cumplir con las regulaciones de exportación del Gobierno de EE. UU. aplicables a esa información, el solicitante debe ser (A) una persona de EE. UU., definida como (i) ciudadano o nacional de EE. UU., (ii) residente legal permanente de EE. UU. (titular de tarjeta verde), (iii) refugiado según 8 U.S.C. § 1157, o (iv) asilado según 8 U.S.C. § 1158, (B) elegible para acceder a la información sujeta a control de exportaciones sin la autorización de exportación requerida, o (C) elegible y con probabilidades razonables de obtener la autorización de exportación requerida de la agencia gubernamental de EE. UU. correspondiente. CoreWeave puede, por razones comerciales legítimas, negarse a tramitar cualquier proceso de licencia de exportación.
