Nscale

HPC/GPU Systems Engineer

PythonKubernetesTerraform
Automatische Übersetzung. Prüfe das Original.

ÜBER NSCALE

Nscale ist die vertikal integrierte KI-Cloud, die für KI entwickelt wurde. Wir besitzen und betreiben die full stack — Energie, Rechenzentren, GPU-Supercluster, Orchestrierung und KI-Dienste — und liefern Hochleistungsinfrastruktur an KI-native Unternehmen, Konzerne und Regierungen in ganz Europa und den USA. Wir stellen GPU-Kapazitäten im Hyperscale-Bereich bereit und betreiben einige der dichtesten und fortschrittlichsten KI-Infrastrukturen der Welt.

Bei Nscale spielt unser Support- und Betriebsteam eine entscheidende Rolle bei der Aufrechterhaltung der Serviceverfügbarkeit, der Steigerung der Servicezuverlässigkeit und der schnellen Reaktion auf Kundenprobleme. Wir leben eine Kultur der unermüdlichen Innovation, des Eigentums und der Verantwortlichkeit, in der jedes Teammitglied stolz auf seine Arbeit ist und diese mit Exzellenz und Dringlichkeit vorantreibt. Als Nscaler bauen Sie Vertrauen durch Offenheit und Transparenz auf, wo jeder inspiriert ist, seine beste Arbeit zu leisten. Wenn Sie unserem Team beitreten, tragen Sie zum Aufbau der Technologie bei, die die Zukunft antreibt.

ÜBER DIE ROLLE

Infrastructure Support Engineers sind die treibende Kraft des Infrastructure Support (L2/L3), die sich um die tägliche Gesundheit der GPU-Flotten von Nscale kümmern — Tickets, Alarme, Hardwarefehler und Kundenprobleme — über GPU-Knoten, Hochleistungsnetzwerke, Linux und Rechenzentrumsbetrieb. Dies ist eine praktische technische Rolle: Sie bringen eine starke technische Basis und praktische Kenntnisse der GPU-Infrastruktur mit und entwickeln sich durch die Arbeit mit einigen der fortschrittlichsten KI-Infrastrukturen der Welt zum Senior-Level weiter.

WAS SIE TUN WERDEN

Sie werden:

  1. Ihre Tickets und Aufgaben End-to-End eigenverantwortlich bearbeiten, frühzeitig und angemessen eskalieren, wenn Probleme Ihren Zuständigkeitsbereich überschreiten — mit sauberen, faktenreichen Übergaben.
  1. Technische Details klar, spezifisch und prägnant kommunizieren — in Tickets, an Kunden und an Kollegen. Wir betrachten Kommunikationsqualität als Kernkompetenz im Ingenieurwesen, nicht als Soft Skill.
  1. Neue technische Konzepte und Probleme schnell erfassen; neugierig bleiben und wissen, welche Fragen Sie stellen müssen, um schnell auf den neuesten Stand zu kommen.
  1. Disziplin und Organisation mitbringen: genaue Aufzeichnungen, strukturierte Fehlersuche, zuverlässige Nachverfolgung.
  1. Feedback suchen und in das Lernen investieren — diese Rolle ist ein bewusster Weg zum Senior-Level.
  1. Am Support-Rotationsdienst teilnehmen und tägliche Tickets und Alarme bearbeiten, frühzeitig und angemessen eskalieren. Mit Engineering-Teams zusammenarbeiten, mit Anleitung, wenn Vorfälle oder Änderungen dies erfordern.
  1. Triage und Hardware-Fehlersuche von GPU-Knoten durchführen: nvidia-smi/DCGM-Ausgaben und Systemprotokolle interpretieren, Fehler über GPU-, NIC- und Server-Hardware hinweg isolieren, physische Behebungsmaßnahmen durchführen (Neusetzen, Testaustausch, Komponentenprüfung) und saubere Beweise für RMA-Vorgänge beim Hersteller vorbereiten.
  1. Fabric- und Link-Diagnosen gemäß etablierten Runbooks (mlxlink oder Äquivalent) durchführen, Beweise genau erfassen und mit einer Übergabe eskalieren, die es dem nächsten Ingenieur ermöglicht, ohne Neustart fortzufahren.
  1. Unterstützung bei Speicher- und Datenpfaduntersuchungen (Mounts, Konnektivität, Client-seitige Symptome) auf Hochleistungsplattformen, Erfassung von Beweisen für die Diagnose durch Senior- oder Engineering-Teams.
  1. Etablierte Runbooks befolgen, um häufige Probleme zu lösen; Verbesserungen vorschlagen und inkrementelle Korrekturen mit Überprüfung beitragen.
  1. Tickets genau aufzeichnen, aktualisieren, verwalten und lösen, alle Parteien mit klaren Notizen, nächsten Schritten und Kundenkommunikation über die vereinbarten Kanäle auf dem Laufenden halten.
  1. An Überwachung, Fehlerbehebung und Triage teilnehmen. Protokolle und Fakten erfassen, um eine effiziente Übergabe zu ermöglichen.
  1. An Änderungen unter Peer-Review teilnehmen, Risikobewertung und Backout-Praktiken in Live-Kundenumgebungen erlernen.
  1. Helfen, die Genauigkeit der „Source of Truth“ über DCIM-, Inventar- und Asset-Aufzeichnungen (NetBox oder ähnliche Muster) aufrechtzuerhalten.
  1. Automatisierungsmöglichkeiten identifizieren und einfache Skripte und Tooling-Verbesserungen beitragen, um Prozesse zu optimieren.
  1. Als Eskalationspunkt für das Onsite-DC-Betriebspersonal fungieren; Smart-Hands-Aufgaben in Ihrem Zuständigkeitsbereich koordinieren.
  1. Die Grundlagen der Plattform erlernen, damit Sie Kunden helfen können, den Wert unserer Dienste zu nutzen, und bei Bedarf Unterstützung für tiefere Expertise anfordern.
  1. Wissen teilen, indem Sie validierte Schritte dokumentieren und zu Schulungsmaterialien beitragen. Seniors bei komplexen Arbeiten begleiten, um Fähigkeiten aufzubauen.
  1. An Incident Reviews als Mitwirkender teilnehmen und bei der Nachverfolgung präventiver Maßnahmen in Ihrem Zuständigkeitsbereich helfen.
  1. Zugewiesene Aufgaben und Projektarbeit mit vereinbarter Qualität und Zeitvorgaben liefern. Blockaden frühzeitig melden und bei Bedarf Hilfe suchen.
  1. Nach der Einarbeitung an Rufbereitschaften und Außerhalb der Geschäftszeiten teilnehmen, wenn geplant. Reisen zu Nscale- oder Kundenstandorten, um bei Bereitstellungen, Fehlerbehebungen und operativen Aufgaben zu helfen, und Teilnahme an Lieferantenschulungen nach Bedarf.

ÜBER SIE

Erforderliche Erfahrung: 3-4+ Jahre in der Infrastrukturunterstützung oder in Support-Engineering-Rollen, einschließlich tiefgreifender Support-/Service-Desk-Erfahrung in strukturierten, kundenorientierten Umgebungen, mit praktischen Kenntnissen der GPU-Infrastruktur und praktischer Hardware-Fehlersuche.

  1. Erfahrung. 3+ Jahre in der Infrastrukturunterstützung oder im Support-Engineering, einschließlich Support-/Service-Desk-Erfahrung in strukturierten, SLA-gesteuerten, kundenorientierten Umgebungen (Cloud, Rechenzentrum oder Managed Services).
  1. Kommunikation. Klare schriftliche Notizen, prägnante Updates und zuverlässige Nachverfolgung. Fähigkeit, technische Probleme Kunden und Kollegen genau zu erklären und Übergaben zu erstellen, auf die die nächste Schicht sofort reagieren kann.
  1. GPU- und Hardware-Fehlersuche. Praktische Kenntnisse der GPU-Infrastruktur: Erfahrung mit nvidia-smi oder ähnlichen Diagnosetools, sicherer Umgang mit der Interpretation von Hardware-Fehlerausgaben und Protokollen, und Zuversicht bei der physischen Fehlersuche an Servern — Komponenten neu einsetzen, Testaustausch, Arbeit über BMC/Out-of-Band-Management — bis zur Vorbereitung von RMA-Nachweisen. Eine starke technische Basis ist hier erforderlich, kein Lernziel.
  1. Linux. Solide praktische Kenntnisse: Sicher auf der Kommandozeile mit systemd, Dateisystemen, Berechtigungen und Standard-Netzwerkt tools. Fähigkeit, häufige Probleme selbstständig zu beheben und zu wissen, wann eskaliert werden muss.
  1. Netzwerk. Solides Verständnis von IP-Adressierung, Subnetzen, VLANs, Routing, DNS und Firewalls. Kenntnisse von Hochleistungs-East-West-Fabrics (RDMA/InfiniBand-Konzepte) sind ein Plus und ein Kernwachstumsbereich in dieser Rolle.
  1. Ticketing und ITSM-Disziplin. Erfahrung mit strukturierten Support-Prozessen (ITIL oder ähnlich): Priorisierung, Eskalation, SLA-Bewusstsein und genaue Dokumentation.
  1. Grundlagen der Beobachtbarkeit. Fähigkeit, Dashboards und Alarme zu nutzen, um Symptome zu identifizieren, Beweise zu sammeln und Runbooks zu befolgen. Komfort bei der Vorschlagung einfacher Alarm- oder Dashboard-Verbesserungen mit Überprüfung.
  1. Grundlagen von Skripting und Automatisierung. Sicher im Lesen und Schreiben einfacher Bash- oder Python-Skripte und Verwendung von Git zur Versionskontrolle.
  1. Grundlagen von Plattform und Rechenzentrum. Verständnis von Server-, Netzwerk-, Speicher- und Virtualisierungskonzepten, idealerweise aus einem Support- oder Betriebs-Hintergrund.
  1. Wachstumsmentalität. Neugierig, zuverlässig und kollaborativ. Sie suchen Feedback, stellen Fragen und investieren in das Lernen, um sich zum Senior-Level zu entwickeln.
  1. Anpassungsfähigkeit. Fähigkeit, in einem sich schnell entwickelnden Umfeld mit sich ändernden Prozessen zu arbeiten, nach der Einarbeitung an Rufbereitschaften teilzunehmen und bei Bedarf zu reisen.

NICHT ZWINGEND ERFORDERLICH (NICE TO HAVE)

Dies sind Wachstumsbereiche, keine Voraussetzungen:

  1. Hochleistungs-Fabrics und GPU-HPC: Erfahrung mit RDMA/InfiniBand, Link-Level-Diagnostik (mlxlink, ibdiagnet oder Äquivalent), NCCL-basierte Fehlerbehebung oder NVLink-Konzepte.
  1. Hochleistungs-Speicher: Erfahrung mit VAST oder vergleichbaren KI-optimierten Speicherplattformen, Ceph oder NFS im großen Maßstab, einschließlich grundlegender Speicher-Netzwerk-Fehlersuche.
  1. OpenStack und Fleet-Operations-Tools: Vertrautheit mit OpenStack-Fehlerbehebungsabläufen oder Fleet-Scale-Tools für Provisionierung und Gesundheit (MAAS, NetBox, Redfish oder Ähnliches).
  1. Kubernetes: Verständnis der Kernkonzepte (Nodes, Pods, Services, Logs) und grundlegende Fehlerbehebung über Runbooks. Hilfreicher Kontext für unsere Plattform, aber nicht der Kern dieser Rolle.
  1. Automatisierung und Zugriffstools: Erfahrung mit Ansible oder Terraform, CI/CD-Teilnahme (GitHub Actions oder Ähnliches) oder Zugriffs- und Sicherheitstools wie Teleport oder Vault.
  1. Zertifizierungen: Fortschritt in Richtung relevanter Linux-, Netzwerk-, Kubernetes-, Cloud- oder Sicherheitszertifizierungen im Laufe der Zeit.

WAS WIR IHNEN BIETEN KÖNNEN

Bei Nscale finden Sie ein kollaboratives, unterstützendes und innovatives Umfeld, in dem Ihre Beiträge echte Wirkung erzielen. Wir bauen etwas Außergewöhnliches auf, und wir möchten Sie im Mittelpunkt haben.

  • Hochgradig wettbewerbsfähiges Paket (Basis + Aktienoptionen) mit Überprüfungen alle 12 Monate. 🚀
  • Treten Sie dem am schnellsten wachsenden Tech-Startup bei, Ihre Chance, Grenzen zu verschieben, mit brillanten Köpfen zusammenzuarbeiten und sich auf modernster KI zu verewigen. ✨
  • Erwarten Sie einen dynamischen Entwicklungsplan, der auf Ihre Ambitionen zugeschnitten ist. Wachsen Sie, indem Sie neue Dinge ausprobieren, führen, den Status quo in Frage stellen und Ihre Wirkung eigenverantwortlich gestalten, immer mit unserer vollen Unterstützung.
  • Menschzentrierte Flexibilität: Wir betrachten Sie zuerst als Menschen. 🫶🏽 Unser flexibler Arbeitsplatz vertraut Nscalern, Ergebnisse zu liefern, und gibt Ihnen die Autonomie, Ihren Tag um die Momente des Lebens herum zu gestalten.
  • Treten Sie unserem florierenden Remote-First-Team bei. Geografie ist keine Barriere für Wirkung oder Verbindung. Wir bauen nahtlose virtuelle Zusammenarbeit auf und befähigen Sie, wo immer Sie arbeiten.

ERKLÄRUNG ZU GLEICHEN CHANCEN

Wir ermutigen ausdrücklich Bewerbungen von People of Colour, der LGBTQ+-Community, Menschen mit Behinderungen, neurodivergenten Menschen, Eltern, Betreuern und Menschen aus niedrigeren sozioökonomischen Verhältnissen.

Wenn es irgendetwas gibt, das wir tun können, um Ihre spezifische Situation zu berücksichtigen, lassen Sie es uns bitte wissen.

Die in dieser Stellenbeschreibung dargelegten Verantwortlichkeiten sind nicht abschließend und sollen einen allgemeinen Überblick über die Position geben. Der Mitarbeiter kann aufgefordert werden, zusätzliche Aufgaben, Tätigkeiten und Verantwortlichkeiten auszuführen, wie vom Management zugewiesen, im Einklang mit den für die Rolle erforderlichen Fähigkeiten und Qualifikationen.

Die unten angegebene Spanne spiegelt das Grundgehalt für die Position wider. Die tatsächliche Vergütung kann je nach berufsbezogenen Faktoren wie Fähigkeiten, Erfahrung, Ausbildung und Standort variieren. Zusätzlich zum Grundgehalt kann diese Rolle für Bonus-, Aktienoptions- und/oder Provisionsprogramme in Frage kommen. Nscale kann ein wettbewerbsfähiges Leistungspaket anbieten, einschließlich Kranken-, Zahn-, Sehversicherung, flexible bezahlte Urlaubszeit, Elternurlaub und Teilnahme an Altersvorsorgeplänen.

Gehaltsspanne

$100,000—$140,000 USD

Informationen darüber, wie Nscale personenbezogene Daten von Kandidaten verarbeitet, finden Sie in unserer Mitarbeiter- und Kandidaten-Datenschutzerklärung: Hier. drive.google.com/file/d/1QK5Yg04WHD9K9IAtJgQWubJZC9oLvatK/view?usp=sharing

Nscale akzeptiert keine unaufgeforderten Kandidatenangebote von Personalvermittlungsagenturen.

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026