Hasbro
CoreWeave
Engenheiro Principal - Performance e Benchmarking
SOBRE ESTA VAGA
CoreWeave é a Nuvem Essencial para IA™.
Construída por pioneiros para pioneiros, a CoreWeave oferece uma plataforma de tecnologia, ferramentas e equipes que permitem aos inovadores construir e escalar IA com confiança. Confiável pelos líderes em laboratórios de IA, startups e empresas globais, a CoreWeave combina desempenho de infraestrutura superior com profundo conhecimento técnico para acelerar descobertas e transformar computação em capacidade. Fundada em 2017, a CoreWeave tornou-se uma empresa de capital aberto (Nasdaq: CRWV) em março de 2025. Saiba mais em coreweave.com coreweave.com/.
Estamos procurando um Engenheiro Principal para ser o líder técnico da equipe de Benchmarking e Performance da CoreWeave. Você será responsável pelo nosso data warehouse de performance em escala planetária: Ingerindo, armazenando, transformando e analisando eventos de performance em todos os datas centers de nossa infraestrutura global. Você também será parte integrante da obtenção de publicações de benchmarking de performance de ponta a ponta: Se MLPerf (Treinamento e Inferência), trabalhar próximo à NVIDIA (Megatron-LM, TensorRT-LLM e DGX cloud) e à comunidade de código aberto (llm-d, vLLM e todos os frameworks populares de ML) falam com você, venha nos ajudar a demonstrar a liderança em confiabilidade de performance da CoreWeave no setor.
O que você fará
- Estratégia e Liderança - Definir a estratégia e o roadmap de benchmarking multianual; priorizar modelos/cargas de trabalho (LLMs, difusão, visão, fala) e níveis de hardware. Construir, liderar e orientar uma equipe de alta performance de engenheiros de performance e analistas de dados. Estabelecer governança para reivindicações: metodologias documentadas, versionamento, reprodutibilidade e trilhas de auditoria.
- Propriedade de Performance - Liderar submissões de MLPerf Inference e Training de ponta a ponta: seleção de carga de trabalho, planejamento de cluster, runbooks, auditorias e publicação de resultados. Coordenar trilhas de otimização com a NVIDIA (CUDA, cuDNN, TensorRT/TensorRT-LLM, Triton, NCCL) para atingir resultados competitivos; impulsionar correções upstream quando necessário.
- Benchmarks Internos de Latência e Throughput - Projetar um serviço de benchmarking repetível e nativo de Kubernetes, que exercite as pilhas da CoreWeave em pipelines SUNK (Slurm on Kubernetes), Kueue e Kubeflow. Medir e reportar latência p50/p95/p99, jitter, tokens/s, time-to-first-token, cold-start/warm-start, e custo por token/requisição entre modelos, precisões (BF16/FP8/FP4), tamanhos de lote e tipos de GPU. Manter um corpus de cenários representativos (streaming, batch, multi-tenant) e conjuntos de dados; automatizar comparações entre releases de software e gerações de hardware.
- Ferramental e Automação - Construir pipelines de CI/CD e controladores/operadores de 8 para agendar benchmarks em escala; integrar com pilhas de observabilidade (Prometheus, Grafana, OpenTelemetry) e data warehouses de resultados. Implementar integridade da cadeia de suprimentos para artefatos de benchmark (SBOMs, assinaturas Cosign).
- Interfuncional e Comunidade - Colaborar com a NVIDIA, ISVs chave e projetos OSS (vLLM, Triton, KServe, PyTorch/DeepSpeed, ONNX Runtime) para co-desenvolver otimizações e melhorias upstream. Apoiar Vendas/SEs com números autoritativos para RFPs e avaliações competitivas; apresentar a analistas e imprensa com dados rigorosos e defensáveis.
Quem você é
- 10+ anos construindo sistemas distribuídos ou serviços HPC/cloud, com profunda expertise em treinamento de ML em larga escala ou cargas de trabalho de alta performance similares.
- Histórico comprovado de arquitetar ou construir sistemas de dados em escala planetária (ex: plataformas de telemetria, pilhas de observabilidade, data warehouses de nuvem, motores OLAP em larga escala).
- Profundo entendimento de performance de GPU (CUDA, NCCL, RDMA, NVLink/PCIe, largura de banda de memória), pilhas de servidores de modelos (Triton, vLLM, TensorRT-LLM, TorchServe) e frameworks de treinamento distribuído (PyTorch FSDP/DeepSpeed/Megatron-LM).
- Proficiente com Kubernetes e planos de controle de ML; familiaridade com SUNK, Kueue e Kubeflow em ambientes de produção.
- Excelentes habilidades de comunicação, capaz de interagir com executivos, clientes, auditores e comunidades OSS.
Diferenciais
- Experiência com bancos de dados de séries temporais, merge trees baseados em logs (LSM) ou desenvolvimento de motores de armazenamento customizados.
- Experiência em executar submissões de MLPerf (Inferência e/ou Treinamento) ou benchmarks auditados equivalentes em escala.
- Contribuições para MLPerf, Triton, vLLM, PyTorch, KServe ou projetos OSS similares.
- Experiência em benchmarking de frotas multirregionais e clusters grandes (milhares de GPUs).
- Publicações/palestras sobre performance de ML, engenharia de latência ou metodologia de benchmarking em larga escala.
O que oferecemos
A faixa salarial base para esta função é de US$ 206,000 a US$ 333,000. O salário inicial será determinado com base no conhecimento, habilidades, experiência e localização no mercado relacionados à função. Buscamos alinhamento com o mercado e equidade interna ao determinar a remuneração. Além do salário base, nosso pacote total de recompensas inclui um bônus discricionário, prêmios de ações (equity) e um programa abrangente de benefícios (todos sujeitos à elegibilidade).
A faixa que publicamos representa a faixa de remuneração típica para esta função. Para determinar a remuneração real, revisamos a taxa de mercado para cada candidato, que pode incluir uma variedade de fatores. Estes incluem qualificações, experiência, desempenho na entrevista e localização.
Além de um salário competitivo, oferecemos uma variedade de benefícios para apoiar suas necessidades. Os benefícios abaixo refletem nossas ofertas para funcionários em tempo integral baseados nos EUA; para funções em outras localizações, os benefícios variam e são compartilhados durante o processo de contratação. Estes incluem:
- Seguro médico, odontológico e de visão - 100% pago pela CoreWeave
- Seguro de vida pago pela empresa
- Seguro de vida suplementar voluntário
- Seguro contra invalidez de curto e longo prazo
- Conta de Despesas Flexíveis (Flexible Spending Account)
- Conta de Poupança para Saúde (Health Savings Account)
- Reembolso de mensalidades
- Possibilidade de Participar do Programa de Compra de Ações para Funcionários (ESPP)
- Benefícios de Bem-Estar Mental através da Spring Health
- Suporte para Formação Familiar fornecido pela Carrot
- Licença Parental Remunerada
- Suporte flexível e completo para cuidados infantis com a Kinside
- 401(k) com um generoso matching do empregador
- Férias Flexíveis (Flexible PTO)
- Almoço servido diariamente em nossos escritórios e locais de data center
- Ambiente de trabalho casual
- Cultura de trabalho focada em disrupção inovadora
Igualdade de Oportunidades e Acomodações
Candidatos da Califórnia
California Consumer Privacy Act drive.google.com/file/d/1gPBRBhUNAMBmj7Yn4_M-hCugm7ZJD4hr/view?usp=sharing
A CoreWeave é um empregador que oferece igualdade de oportunidades, comprometida em fomentar um local de trabalho inclusivo e solidário. Todos os candidatos qualificados receberão consideração para emprego sem distinção de raça, cor, religião, sexo, deficiência, idade, orientação sexual, identidade de gênero, nacionalidade, status de veterano ou informação genética.
Como parte deste compromisso e em conformidade com o Americans with Disabilities Act (ADA) eeoc.gov/laws/guidance/fact-sheet-disability-discrimination, a CoreWeave garantirá que candidatos qualificados com deficiências recebam acomodações razoáveis para o processo de contratação, a menos que tal acomodação cause um ônus indevido. Se uma acomodação razoável for necessária, por favor, entre em contato: [email protected] [[email protected]].
Conformidade com Controle de Exportação
Esta posição requer acesso a informações controladas por exportação. Para estar em conformidade com os regulamentos de exportação do Governo dos EUA aplicáveis a essas informações, o candidato deve ser (A) uma pessoa dos EUA, definida como (i) cidadão ou nacional dos EUA, (ii) residente permanente legal dos EUA (portador de green card), (iii) refugiado sob 8 U.S.C. § 1157, ou (iv) asilado sob 8 U.S.C. § 1158, (B) elegível para acessar as informações controladas por exportação sem a autorização de exportação necessária, ou (C) elegível e com probabilidade razoável de obter a autorização de exportação necessária da agência governamental dos EUA aplicável. A CoreWeave pode, por razões comerciais legítimas, recusar-se a prosseguir com qualquer processo de licenciamento de exportação.
