CoreWeave

Ingénieur Principal - Performance et Benchmarking

Kubernetes
Traduction automatique. Consultez l’original.

À PROPOS DE CE POSTE

CoreWeave est le Cloud Essentiel pour l'IA™.

Construit par des pionniers pour des pionniers, CoreWeave offre une plateforme de technologie, d'outils et d'équipes qui permet aux innovateurs de construire et de faire évoluer l'IA en toute confiance. Approuvé par les principaux laboratoires d'IA, startups et entreprises mondiales, CoreWeave combine des performances d'infrastructure supérieures avec une expertise technique approfondie pour accélérer les découvertes et transformer la puissance de calcul en capacité. Fondé en 2017, CoreWeave est devenu une société cotée en bourse (Nasdaq : CRWV) en mars 2025. En savoir plus sur coreweave.com coreweave.com/.

Nous recherchons un Ingénieur Principal pour diriger techniquement l'équipe de Benchmarking et Performance de CoreWeave. Vous serez responsable de notre entrepôt de données de performance à l'échelle planétaire : ingestion, stockage, transformation et analyse des événements de performance dans tous les centres de données de notre infrastructure mondiale. Vous ferez également partie intégrante de la publication de benchmarks de performance de bout en bout, leaders du secteur : Si MLPerf (Entraînement et Inférence), en travaillant en étroite collaboration avec NVIDIA (Megatron-LM, TensorRT-LLM et DGX cloud) et la communauté open-source (llm-d, vLLM et tous les frameworks ML populaires) vous parlent, venez nous aider à démontrer le leadership de CoreWeave en matière de fiabilité de performance dans ce domaine.

Ce que vous ferez

  1. Stratégie et Leadership - Définir la stratégie et la feuille de route de benchmarking pluriannuelle ; prioriser les modèles/charges de travail (LLMs, diffusion, vision, parole) et les niveaux de matériel. Construire, diriger et encadrer une équipe performante d'ingénieurs performance et d'analystes de données. Établir la gouvernance des revendications : méthodologies documentées, versioning, reproductibilité et pistes d'audit.
  1. Propriété de la Performance - Diriger les soumissions MLPerf Inférence et Entraînement de bout en bout : sélection des charges de travail, planification des clusters, runbooks, audits et publication des résultats. Coordonner les pistes d'optimisation avec NVIDIA (CUDA, cuDNN, TensorRT/TensorRT-LLM, Triton, NCCL) pour obtenir des résultats compétitifs ; piloter les corrections en amont si nécessaire.
  1. Benchmarks Internes de Latence et Débit - Concevoir un service de benchmarking répétable, natif Kubernetes, qui exerce les piles CoreWeave sur SUNK (Slurm sur Kubernetes), Kueue et les pipelines Kubeflow. Mesurer et rapporter la latence p50/p95/p99, le jitter, les tokens/s, le temps jusqu'au premier token, le démarrage à froid/à chaud, et le coût par token/requête sur les modèles, les précisions (BF16/FP8/FP4), les tailles de batch et les types de GPU. Maintenir un corpus de scénarios représentatifs (streaming, batch, multi-tenant) et d'ensembles de données ; automatiser les comparaisons entre les versions logicielles et les générations matérielles.
  1. Outillage et Automatisation - Construire des pipelines CI/CD et des contrôleurs/opérateurs K8 pour planifier les benchmarks à grande échelle ; intégrer avec les piles d'observabilité (Prometheus, Grafana, OpenTelemetry) et les entrepôts de résultats. Mettre en œuvre l'intégrité de la chaîne d'approvisionnement pour les artefacts de benchmark (SBOMs, signatures Cosign).
  1. Interfonctionnel et Communauté - Collaborer avec NVIDIA, les principaux ISV et les projets OSS (vLLM, Triton, KServe, PyTorch/DeepSpeed, ONNX Runtime) pour co-développer des optimisations et des améliorations en amont. Soutenir les ventes/SEs avec des chiffres faisant autorité pour les RFP et les évaluations concurrentielles ; informer les analystes et la presse avec des données rigoureuses et défendables.

Qui vous êtes

  1. 10+ années dans la construction de systèmes distribués ou de services HPC/cloud, avec une expertise approfondie sur l'entraînement ML à grande échelle ou des charges de travail haute performance similaires.
  1. Expérience avérée dans l'architecture ou la construction de systèmes de données à l'échelle planétaire (par exemple, plateformes de télémétrie, piles d'observabilité, entrepôts de données cloud, moteurs OLAP à grande échelle).
  1. Compréhension approfondie des performances GPU (CUDA, NCCL, RDMA, NVLink/PCIe, bande passante mémoire), des piles de serveurs de modèles (Triton, vLLM, TensorRT-LLM, TorchServe) et des frameworks d'entraînement distribué (PyTorch FSDP/DeepSpeed/Megatron-LM).
  1. Maîtrise de Kubernetes et des plans de contrôle ML ; familiarité avec SUNK, Kueue et Kubeflow en environnements de production.
  1. Excellentes compétences en communication pour interagir avec les dirigeants, les clients, les auditeurs et les communautés OSS.

Atouts

  1. Expérience avec les bases de données de séries temporelles, les arbres de fusion log-structurés (LSM) ou le développement de moteurs de stockage personnalisés.
  1. Expérience dans la réalisation de soumissions MLPerf (Inférence et/ou Entraînement) ou de benchmarks audités équivalents à grande échelle.
  1. Contributions à MLPerf, Triton, vLLM, PyTorch, KServe ou des projets OSS similaires.
  1. Expérience dans le benchmarking de flottes multi-régions et de grands clusters (milliers de GPUs).
  1. Publications/présentations sur la performance ML, l'ingénierie de latence ou la méthodologie de benchmarking à grande échelle.

Ce que nous offrons

La fourchette de salaire de base pour ce poste est de 206 000 $ à 333 000 $. Le salaire de départ sera déterminé en fonction des connaissances, compétences, expérience et localisation du candidat. Nous visons à la fois l'alignement sur le marché et l'équité interne lors de la détermination de la rémunération. En plus du salaire de base, notre programme de rémunération globale comprend un bonus discrétionnaire, des attributions d'actions et un programme complet d'avantages sociaux (tous sous réserve d'éligibilité).

La fourchette que nous avons publiée représente la fourchette de rémunération typique pour ce poste. Pour déterminer la rémunération réelle, nous examinons le taux du marché pour chaque candidat, ce qui peut inclure une variété de facteurs. Ceux-ci incluent les qualifications, l'expérience, la performance lors des entretiens et la localisation.

En plus d'un salaire compétitif, nous offrons une variété d'avantages pour soutenir vos besoins. Les avantages ci-dessous reflètent nos offres basées aux États-Unis pour les employés à temps plein ; pour les postes dans d'autres régions, les avantages varient et sont communiqués pendant le processus d'embauche. Ceux-ci comprennent :

  • Assurance médicale, dentaire et optique - 100 % pris en charge par CoreWeave
  • Assurance vie payée par l'entreprise
  • Assurance vie supplémentaire facultative
  • Assurance invalidité de courte et longue durée
  • Compte de dépenses flexibles
  • Compte d'épargne santé
  • Remboursement des frais de scolarité
  • Possibilité de participer au programme d'achat d'actions des employés (ESPP)
  • Avantages pour le bien-être mental via Spring Health
  • Soutien à la formation familiale fourni par Carrot
  • Congés parentaux payés
  • Soutien à la garde d'enfants flexible et complet avec Kinside
  • 401(k) avec une généreuse contrepartie de l'employeur
  • Congés payés flexibles
  • Déjeuner traiteur chaque jour dans nos bureaux et centres de données
  • Un environnement de travail décontracté
  • Une culture de travail axée sur la disruption innovante

Égalité des Chances et Accommodements

Candidats Californiens

California Consumer Privacy Act drive.google.com/file/d/1gPBRBhUNAMBmj7Yn4_M-hCugm7ZJD4hr/view?usp=sharing

CoreWeave est un employeur garantissant l'égalité des chances, engagé à favoriser un lieu de travail inclusif et solidaire. Tous les candidats qualifiés recevront une considération pour l'emploi sans distinction de race, couleur, religion, sexe, handicap, âge, orientation sexuelle, identité de genre, origine nationale, statut d'ancien combattant ou information génétique.

Dans le cadre de cet engagement et conformément à l'Americans with Disabilities Act (ADA) eeoc.gov/laws/guidance/fact-sheet-disability-discrimination, CoreWeave s'assurera que les candidats qualifiés handicapés bénéficient d'accommodements raisonnables pour le processus d'embauche, à moins qu'un tel accommodement ne cause une contrainte excessive. Si un accommodement raisonnable est nécessaire, veuillez contacter : [email protected] [[email protected]].

Conformité aux contrôles à l'exportation

Ce poste nécessite l'accès à des informations soumises à des contrôles à l'exportation. Pour se conformer aux réglementations gouvernementales américaines applicables à ces informations, le candidat doit soit (A) être une personne américaine, définie comme (i) un citoyen ou un ressortissant américain, (ii) un résident permanent légal américain (titulaire d'une carte verte), (iii) un réfugié en vertu du 8 U.S.C. § 1157, ou (iv) un demandeur d'asile en vertu du 8 U.S.C. § 1158, (B) être éligible pour accéder aux informations soumises à des contrôles à l'exportation sans autorisation d'exportation requise, ou (C) être éligible et raisonnablement susceptible d'obtenir l'autorisation d'exportation requise de l'agence gouvernementale américaine compétente. CoreWeave peut, pour des raisons commerciales légitimes, refuser de poursuivre tout processus de licence d'exportation.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter