Esri
Designworks Talent
Senior AI Training Infrastructure Engineer
Über die Gelegenheit
AI Training Infrastructure Engineer
Entwickle die Trainingsinfrastruktur, die KI-Modelle der nächsten Generation antreibt
Ein gut finanziertes, schnell wachsendes KI-Infrastrukturunternehmen baut eine Cloud-Plattform der nächsten Generation auf, die den gesamten Lebenszyklus der künstlichen Intelligenz unterstützt. Die Organisation entwickelt ein umfassendes Portfolio an KI-Infrastruktur, Plattformen und Diensten, das das gesamte Spektrum von KI-Workloads unterstützt – einschließlich skalierbarer Rechenleistung, Modelltraining, Feinabstimmung, Inferenz und aufkommender agentischer KI-Anwendungen.
Mit erheblichen langfristigen Investitionen kombiniert das Unternehmen die Geschwindigkeit, Eigenverantwortung und Innovation eines Start-ups mit der Stabilität und den Ressourcen einer etablierten Mutterorganisation. Die Ingenieurteams sind bewusst schlank, hochgradig kollaborativ und KI-nativ und nutzen moderne Werkzeuge und Automatisierung, um eine Infrastruktur aufzubauen, die die anspruchsvollsten KI-Workloads der Branche unterstützen kann.
Wir suchen AI Training Infrastructure Engineers, die die verteilten Systeme aufbauen und skalieren, die das groß angelegte KI-Modelltraining ermöglichen. Dieses Team konzentriert sich auf Zuverlässigkeit, Effizienz und operative Exzellenz über GPU-Cluster hinweg, um Forschern und Ingenieuren das Trainieren und Bereitstellen fortschrittlicher KI-Modelle in großem Maßstab zu ermöglichen.
Die Gelegenheit
Dies ist eine grundlegende Ingenieurrolle, die sich auf den Aufbau der Infrastrukturschicht hinter groß angelegten KI-Trainings-Workloads konzentriert. Sie arbeiten an verteilten Trainingssystemen, GPU-Clustern, Modell-Pipelines und den Werkzeugen, die erforderlich sind, um die KI-Entwicklung zuverlässiger, effizienter und skalierbarer zu gestalten.
Sie arbeiten eng mit den Teams für Infrastruktur, Orchestrierung, Leistung und machine learning zusammen, um komplexe Herausforderungen in Bezug auf verteilte Systeme, Fehlertoleranz, Trainingseffizienz und Produktionsbereitschaft zu lösen.
Diese Gelegenheit ist ideal für Ingenieure, die gerne hoch skalierbare Systeme entwickeln und an der Schnittstelle von KI-Forschung, Infrastruktur-Engineering und verteilten Systemen arbeiten.
Standort
Standort: Hybrid | Bellevue, WA (Innenstadt)
Titel: Senior und Staff (mehrere Stellen verfügbar)
Hybrid-Rolle mit Sitz in der Innenstadt von Bellevue, WA.
Ungefähr drei Tage pro Woche im Büro.
Kandidaten aus anderen Teilen der USA, die zur Umsiedlung bereit sind, werden ermutigt, sich zu bewerben.
Eine Arbeitserlaubnis für die USA ist erforderlich. Ein Visum-Sponsoring ist derzeit nicht verfügbar.
Warum beitreten?
- Bauen Sie die Infrastruktur auf, die die nächste Generation von KI-Modellen und -Anwendungen antreibt.
- Arbeiten Sie direkt an verteilten Trainingssystemen, GPU-Clustern und groß angelegten KI-Plattformen.
- Lösen Sie einige der herausforderndsten Probleme der Branche in Bezug auf KI-Skalierbarkeit, Zuverlässigkeit und Effizienz.
- Treten Sie früh genug ein, um Architektur, Werkzeuge und Engineering-Praktiken zu beeinflussen.
- Arbeiten Sie mit einem hoch erfahrenen Team zusammen, das kritische KI-Infrastruktur von Grund auf neu aufbaut.
- Genießen Sie die Eigenverantwortung und den technischen Einfluss einer Startup-Umgebung, die durch erhebliche langfristige Investitionen unterstützt wird.
Was Sie tun werden
- Aufbau und Skalierung verteilter Trainingsinfrastrukturen, die große KI-Modelle über große GPU-Cluster hinweg unterstützen.
- Entwurf und Verbesserung von Systemen, die die Trainingszuverlässigkeit, Effizienz und Ressourcenauslastung erhöhen.
- Entwicklung von Lösungen für Fehlertoleranz, Checkpointing, Wiederherstellung und groß angelegte Trainingsoperationen.
- Integration von KI-Modellen in Produktions-Trainings-Pipelines in Zusammenarbeit mit den Teams für Plattform-, Orchestrierungs- und Leistungs-Engineering.
- Diagnose und Behebung von Problemen, die den Trainingsdurchsatz, die Stabilität, die Zuverlässigkeit und die Kosteneffizienz beeinträchtigen.
- Erstellung von Werkzeugen und Automatisierung, die die Entwicklererfahrung für KI-Forscher und -Ingenieure verbessern.
- Festlegung von Best Practices für Trainingsinfrastruktur, Betriebsprozesse und Plattformzuverlässigkeit.
- Beitrag zur Weiterentwicklung der KI-Infrastrukturplattform als frühes Mitglied des Engineering-Teams.
Was wir suchen
- Praktische Erfahrung im Aufbau und Betrieb von verteilten Trainingssystemen oder groß angelegter machine learning-Infrastruktur.
- Erfahrung in der Unterstützung großer KI-Modelle, Foundation Models, Post-Training-Workflows oder ähnlicher ML-Systeme.
- Starkes Verständnis der Herausforderungen in Bezug auf Zuverlässigkeit, Skalierbarkeit und Effizienz, die mit Multi-Node-GPU-Training verbunden sind.
- Erfahrung in der Integration von Trainingssystemen mit Produktions-machine learning-Pipelines.
- Starke Programmierkenntnisse und Erfahrung mit komplexen verteilten Systemen.
- Fähigkeit, technisch anspruchsvolle Projekte in einem sich schnell entwickelnden Engineering-Umfeld eigenständig zu verantworten.
- Komfort mit hoher Eigenverantwortung und geringem Prozessaufwand.
Bevorzugte Qualifikationen
- Erfahrung mit verteilten Trainingsframeworks wie PyTorch Distributed, DeepSpeed, Megatron-LM, Ray oder ähnlichen Technologien.
- Erfahrung mit Supervised Fine-Tuning (SFT), Reinforcement Learning from Human Feedback (RLHF) oder anderen Post-Training-Workflows.
- Hintergrund im Betrieb von KI-Trainingsinfrastrukturen im großen Maßstab bei einem Hyperscaler, einer KI-Forschungsorganisation, einem Cloud-Anbieter oder einer GPU-Cloud-Umgebung.
- Erfahrung in der Optimierung der GPU-Auslastung, der Trainingsleistung oder der Zuverlässigkeit verteilter Systeme.
- Vertrautheit mit Kubernetes, containerisierten KI-Workloads und groß angelegten Infrastrukturplattformen.
Vergütung
Wettbewerbsfähiges Grundgehalt für den Markt in Bellevue
Bestimmte Rollen sind für zusätzliche Vergütungen berechtigt, einschließlich Gehaltserhöhungen, Jahresboni und langfristiger Anreize. Diese Vergütungen werden basierend auf individueller Leistung zugewiesen.
Mitarbeiter in den USA haben Zugang zu Kranken-, Zahn- und Augenversicherungen, einem 401(k)-Plan und einem Unternehmens-Match. Mitarbeiter erhalten außerdem pro Kalenderjahr bezahlte Feiertage.
