Roku
NVIDIA
Senior Software Engineer, Capacity Management - DGX Cloud
Über die Stelle
NVIDIA DGX Cloud bietet die Infrastruktur und Softwareplattform, die es Unternehmen ermöglicht, KI in großem Maßstab zu entwickeln, zu trainieren und bereitzustellen. Da die Nachfrage nach beschleunigtem Computing wächst, ist ein effektives Kapazitätsmanagement unerlässlich, um zuverlässige Kundenerlebnisse zu liefern und gleichzeitig die Auslastung der eingeschränkten GPU-Infrastruktur zu maximieren.
Wir suchen einen Senior Software Engineer, der die Systeme entwirft und erstellt, die Kundennachfrage, Infrastrukturangebot, Reservierungen, Zuweisungen und Auslastung in DGX Cloud-Umgebungen verbinden. Sie werden mit Ingenieur-, Produkt-, Betriebs-, Finanz- und Geschäftsteams zusammenarbeiten, um komplexe Kapazitätsdaten und Betriebsprozesse in skalierbare Software und automatisierte Entscheidungsfindung umzuwandeln.
Was Sie tun werden
- Entwurf und Erstellung verteilter Dienste und Datenpipelines für Kapazitätsplanung, Zuweisung, Reservierungen und Auslastung.
- Entwicklung eines einheitlichen Modells für verfügbare, zugesagte und prognostizierte GPU-Kapazitäten über Cloud-Anbieter, Regionen, Cluster und Produkte hinweg.
- Automatisierung von Kapazitätsmanagement-Workflows, die derzeit von manueller Analyse und Koordination abhängen.
- Erstellung von APIs, Tools und Integrationen, die es anderen DGX Cloud-Systemen und -Teams ermöglichen, kapazitätsbewusste Entscheidungen zu treffen.
- Verbesserung von Prognosen, Szenarioplanung und betrieblicher Transparenz durch Kombination von Nachfragesignalen mit Infrastrukturangebotsdaten.
- Einrichtung von Überwachungs-, Datenqualitätskontrollen und Service-Level-Indikatoren für Kapazitätssysteme.
- Leitung technischer Design-Reviews, Festlegung von Engineering-Standards und Mentoring anderer Ingenieure.
- Diagnose komplexer Produktionsprobleme und Verbesserung der Zuverlässigkeit, Leistung und Skalierbarkeit von Kapazitätsmanagement-Diensten.
Was wir sehen müssen
- BS oder gleichwertige Erfahrung in Informatik, Computer Engineering oder einem verwandten technischen Bereich.
- 12+ Jahre Erfahrung im Software-Engineering mit Erstellung von Produktionssystemen.
- Umfangreiche Programmiererfahrung in Sprachen wie Python, Go, Java oder ähnlichen.
- Erfahrung im Entwurf verteilter Systeme, backend-Dienste, APIs und Datenverarbeitungspipelines.
- Erfahrung mit Cloud-Infrastruktur, Kubernetes, Compute-Plattformen oder großen Systemen zur Ressourcenverwaltung.
- Starkes Verständnis von Datenmodellierung, Systemintegration, Beobachtbarkeit und Produktionsbetrieb.
- Fähigkeit, mehrdeutige geschäftliche und betriebliche Anforderungen in klare technische Designs umzusetzen.
- Starke Kommunikationsfähigkeiten und Erfahrung in der Zusammenarbeit mit technischen und nicht-technischen Organisationen.
Wege, sich abzuheben
- Erfahrung mit GPU-Infrastruktur, KI/ML-Plattformen, Schedulern, Cluster-Management oder beschleunigtem Computing.
- Erfahrung im Aufbau von Systemen für Kapazitätsplanung, Inventur, Angebot und Nachfrage, Kontingente, Reservierungen oder Ressourcenzuweisung.
- Vertrautheit mit Optimierungs-, Prognose-, Simulations- oder Operations-Research-Techniken.
- Erfahrung im Betrieb von Infrastrukturen über mehrere Cloud-Anbieter oder geografisch verteilte Umgebungen hinweg und als technischer Leiter für funktionsübergreifende, geschäftskritische Initiativen.
- Nachgewiesener Erfolg bei der Verbesserung der Infrastrukturauslastung bei gleichzeitiger Aufrechterhaltung der Zuverlässigkeit und der Kundenverpflichtungen.
NVIDIA ist führend bei bahnbrechenden Entwicklungen in den Bereichen Künstliche Intelligenz, High-Performance Computing und Visualisierung. Die GPU, unsere Erfindung, dient als visuelles Gehirn moderner Computer und ist das Herzstück unserer Produkte und Dienstleistungen. Unsere Arbeit eröffnet neue Universen zur Erkundung, ermöglicht erstaunliche Kreativität und Entdeckungen und treibt das voran, was einst Science-Fiction-Erfindungen von künstlicher Intelligenz bis hin zu autonomen Autos waren. NVIDIA sucht phänomenale Leute wie Sie, die uns helfen, die nächste Welle der künstlichen Intelligenz zu beschleunigen. NVIDIA ist weithin als einer der begehrtesten Arbeitgeber der Technologiewelt anerkannt. Wir haben einige der fortschrittlichsten und engagiertesten Menschen der Welt, die für uns arbeiten.
Ihr Grundgehalt wird basierend auf Ihrem Standort, Ihrer Erfahrung und dem Gehalt von Mitarbeitern in ähnlichen Positionen ermittelt. Die Gehaltsspanne für das Grundgehalt beträgt 200,000 USD - 322,000 USD.
Sie haben außerdem Anspruch auf Aktienoptionen und Zusatzleistungen.
Bewerbungen für diese Stelle werden mindestens bis zum September 24, 2026 angenommen.
Diese Ausschreibung gilt für eine bestehende Stelle.
NVIDIA verwendet KI-Tools in seinen Rekrutierungsprozessen.
NVIDIA setzt sich für die Förderung eines integrativen Arbeitsumfelds ein und ist stolz darauf, ein Arbeitgeber zu sein, der Chancengleichheit bietet. Da wir Vielfalt bei unseren aktuellen und zukünftigen Mitarbeitern sehr schätzen, diskriminieren wir nicht (einschließlich unserer Einstellungs- und Beförderungspraktiken) aufgrund von Rasse, Religion, Hautfarbe, nationaler Herkunft, Geschlecht, Geschlechtsausdruck, sexueller Orientierung, Alter, Familienstand, Veteranenstatus, Behinderungsstatus oder anderen gesetzlich geschützten Merkmalen.
