Roku
Designworks Talent
Staff Senior Virtualization & Orchestration Engineer
Über die Stelle
Staff Virtualization & Orchestration Engineer
Entwickle die Plattformschicht, die die KI-Infrastruktur der nächsten Generation antreibt
Über die Gelegenheit
Ein gut finanziertes, schnell wachsendes KI-Infrastrukturunternehmen baut eine Cloud-Plattform der nächsten Generation auf, die für den Betrieb des gesamten Lebenszyklus künstlicher Intelligenz entwickelt wurde. Die Organisation entwickelt ein umfassendes Portfolio an KI-Infrastruktur, Plattformen und Diensten, das das gesamte Spektrum von KI-Workloads unterstützt – einschließlich skalierbarer Rechenleistung, Modelltraining, Feinabstimmung, Inferenz und aufkommender agentischer KI-Anwendungen.
Unterstützt durch erhebliche langfristige Investitionen, kombiniert das Unternehmen die Geschwindigkeit, Eigenverantwortung und Innovation eines Start-ups mit der Stabilität und den Ressourcen einer etablierten Mutterorganisation. Die Ingenieurteams sind bewusst schlank, hochgradig kollaborativ und KI-nativ, wobei sie moderne Automatisierungs- und Tooling-Lösungen nutzen, um eine Infrastruktur aufzubauen, die die anspruchsvollsten KI-Workloads der Branche unterstützen kann.
Wir suchen Virtualization & Orchestration Engineers, um die Plattformschicht zu erstellen, die es Kunden ermöglicht, GPU-Compute zuverlässig und in großem Maßstab zu nutzen. Dieses Team ist verantwortlich für das Design und den Betrieb der Virtualisierungs-, Kubernetes-, Provisionierungs- und Orchestrierungssysteme, die skalierbare KI-Workloads über Rechenzentrumsinfrastrukturen der nächsten Generation hinweg ermöglichen.
Die Gelegenheit
Dies ist eine grundlegende Ingenieurrolle innerhalb der größten Infrastruktur-Engineering-Organisation des Unternehmens. Sie werden beim Entwurf und Aufbau der Systeme helfen, die GPU-Kapazität verfügbar, skalierbar, sicher und zuverlässig über eine Multi-Tenant-KI-Cloud-Plattform hinweg machen.
Sie werden an der Schnittstelle von Virtualisierung, Kubernetes, verteilten Systemen, GPU-Infrastruktur und Hochleistungsrechnen arbeiten und komplexe Herausforderungen in Bezug auf Workload-Scheduling, Ressourcenallokation, Cluster-Management und Infrastrukturautomatisierung lösen.
Diese Gelegenheit ist ideal für Ingenieure, die gerne skalierbare Plattformen von Grund auf neu aufbauen und kritische Infrastruktursysteme End-to-End verantworten.
Standort: Hybrid | Bellevue, WA Umgebung
Titel: Engineer, Senior und Staff (mehrere Rollen verfügbar)
Standort
- Hybrid-Rolle mit Sitz im Großraum Bellevue, WA.
- Ungefähr drei Tage pro Woche im Büro.
- Bewerber aus anderen Teilen der USA, die zur Umsiedlung bereit sind, werden ermutigt, sich zu bewerben.
- Eine Arbeitserlaubnis für die USA ist erforderlich. Ein Visum-Sponsoring ist derzeit nicht verfügbar.
Warum beitreten?
- Entwickle die Orchestrierungsplattform, die eine der fortschrittlichsten KI-Infrastrukturen der Branche antreibt.
- Arbeite direkt an GPU-Clustern, Kubernetes-Plattformen und skalierbaren verteilten Systemen.
- Löse komplexe Infrastrukturherausforderungen in den Bereichen Virtualisierung, Scheduling, Ressourcenmanagement und Automatisierung.
- Schließe dich früh genug an, um Architektur, Engineering-Praktiken und Plattformstrategie zu beeinflussen.
- Arbeite mit einem hoch erfahrenen Team zusammen, das die Grundlage für KI-Anwendungen der nächsten Generation schafft.
- Genieße die Eigenverantwortung und den technischen Einfluss eines Startup-Umfelds, das durch erhebliche langfristige Investitionen unterstützt wird.
Was Sie tun werden
- Entwurf und Aufbau von Virtualisierungsinfrastrukturen zur Unterstützung von GPU-intensiven KI- und HPC-Workloads.
- Entwicklung und Betrieb von Kubernetes-basierten Orchestrierungssystemen für die GPU-Cluster-Bereitstellung und Workload-Planung.
- Aufbau automatisierter Bereitstellungssysteme, die eine effiziente Zuweisung, Skalierung und Rückgewinnung von GPU-Kapazitäten über mehrere Mandanten hinweg ermöglichen.
- Entwurf von Lösungen für Workload-Platzierung, Ressourcenmanagement und Cluster-Lebenszyklusoperationen.
- Enge Zusammenarbeit mit Hardware-, Netzwerk-, Infrastruktur- und KI-Plattformteams, um sicherzustellen, dass die Orchestrierungssysteme mit realen Cluster-Architekturen und Einschränkungen übereinstimmen.
- Verbesserung der Zuverlässigkeit, Sicherheit, Skalierbarkeit und operativen Reife der Orchestrierungsplattform.
- Erstellung von Tools und Automatisierung, die die Infrastrukturverwaltung vereinfachen und die Erfahrungen von Entwicklern und Kunden verbessern.
- Beitrag zu Architekturentscheidungen, Engineering-Standards und Best Practices, während sich die Plattform weiterentwickelt.
Mindestanforderungen
Was wir suchen
- Umfangreiche praktische Erfahrung mit Kubernetes und Container-Orchestrierung in Produktionsumgebungen.
- Erfahrung im Entwurf, Aufbau und Betrieb von skalierbaren Infrastrukturplattformen.
- Hintergrund mit Virtualisierungstechnologien, die Cloud-, HPC-, GPU- oder verteilte Computing-Umgebungen unterstützen.
- Verständnis von GPU-Cluster-Provisionierung, Workload-Scheduling und Ressourcenmanagement.
- Erfahrung mit Linux-basierten Infrastrukturen und Konzepten verteilter Systeme.
- Fähigkeit, komplexe Systeme eigenständig vom Entwurf bis zum Produktionsbetrieb zu verantworten.
- Komfortable Arbeit in einem sich schnell entwickelnden Umfeld, in dem Architektur und Prozesse noch etabliert werden.
Bevorzugte Qualifikationen
- Erfahrung mit GPU-Scheduling-Technologien wie Slurm, Kubernetes-Geräte-Plugins, NVIDIA GPU Operator oder ähnlichen Frameworks.
- Erfahrung in der Unterstützung von KI-Infrastruktur, machine learning-Plattformen, HPC-Umgebungen oder GPU-Cloud-Anbietern.
- Hintergrund im Aufbau von Multi-Tenant-Infrastrukturplattformen für Cloud-Anbieter oder skalierbare Computing-Umgebungen.
- Erfahrung mit Infrastrukturautomatisierung, Infrastructure as Code und Plattform-Engineering-Praktiken.
- Vertrautheit mit Hochleistungsnetzwerken und GPU-Cluster-Architekturen.
Vergütung
- Wettbewerbsfähiges Grundgehalt für den Markt Bellevue
- Bestimmte Rollen sind für zusätzliche Belohnungen berechtigt, einschließlich Gehaltserhöhungen, Jahresboni und langfristiger Anreize. Diese Prämien werden basierend auf individueller Leistung zugewiesen.
- Mitarbeiter mit Sitz in den USA haben Zugang zu Kranken-, Zahn- und Augenversicherungen, einem 401(k)-Plan und Arbeitgeberzuschuss. Mitarbeiter erhalten außerdem bezahlte Feiertage pro Kalenderjahr.
