Launch Legends
Nscale
Senior HPC/GPU Systems Engineer
ÜBER NSCALE
Nscale ist die vertikal integrierte KI-Cloud, die für KI entwickelt wurde. Wir besitzen und betreiben die full stack – Energie, Rechenzentren, GPU-Supercluster, Orchestrierung und KI-Dienste – und liefern Hochleistungsinfrastruktur an KI-native Unternehmen, Konzerne und Regierungen in ganz Europa und den USA. Wir stellen GPU-Kapazitäten im Hyperscale-Bereich bereit und betreiben einige der dichtesten und fortschrittlichsten KI-Infrastrukturen der Welt.
Bei Nscale spielt unser Support- und Operationsteam eine entscheidende Rolle bei der Aufrechterhaltung der Serviceverfügbarkeit, der Steigerung der Servicezuverlässigkeit und der schnellen Reaktion auf Kundenprobleme. Wir leben eine Kultur der unermüdlichen Innovation, des Eigentums und der Verantwortlichkeit, in der jedes Teammitglied stolz auf seine Arbeit ist und diese mit Exzellenz und Dringlichkeit vorantreibt. Als Nscaler bauen Sie Vertrauen durch Offenheit und Transparenz auf, wo jeder inspiriert ist, sein Bestes zu geben. Wenn Sie unserem Team beitreten, tragen Sie zum Aufbau der Technologie bei, die die Zukunft antreibt.
ÜBER DIE ROLLE (JOBZIEL)
Senior Infrastructure Support Engineers sind die technische Eskalationsinstanz innerhalb des Infrastructure Support und verantwortlich für die Gesundheit der GPU-Flotten von Nscale und die Hochleistungs-Netzwerke, die sie verbinden. Dies ist eine praktische L2/L3-Rolle an der Schnittstelle von GPU-Hardware, East-West-Networking, Linux und Rechenzentrumsbetrieb – als operative Brücke zwischen Support, DC Operations und Engineering.
WAS SIE TUN WERDEN (VERANTWORTLICHKEITEN)
- Sie werden: * Komplexe, unklare Probleme End-to-End übernehmen und entscheidende Entscheidungen in einem ergebnisorientierten Umfeld treffen, wobei Sie kalkulierte Risiken eingehen, wenn Geschwindigkeit zählt.
- * Technische Details klar, spezifisch und prägnant kommunizieren – an Ingenieure, an Kunden und an die Führungsebene. Wir betrachten Kommunikationsqualität als Kernkompetenz eines Ingenieurs, nicht als Soft Skill.
- * Ohne Autorität Einfluss nehmen und starke Beziehungen zu leitenden Stakeholdern im gesamten Unternehmen aufbauen, um Dinge zu erledigen.
- * Neue technische Konzepte schnell erfassen, neugierig bleiben und wissen, welche Fragen Sie stellen müssen, um schnell auf den neuesten Stand zu kommen.
- * Disziplin und Organisation mitbringen: evidenzbasierte Untersuchungen, genaue Aufzeichnungen, saubere Übergaben.
- * An der Support-Dienstrotation als Senior-Eskalationspunkt teilnehmen und mit Infrastructure Engineering, CNPRE, Network Operations und Product Engineering bei Vorfällen, Untersuchungen und Änderungen zusammenarbeiten.
- * GPU-Knotenfehler über die full stack hinweg diagnostizieren und beheben – Treiber-, Firmware- und Hardware-Ebenen – von der nvidia-smi/DCGM- und XID/RAS-Analyse über BMC/Redfish und Out-of-Band-Management bis hin zur physischen Fehlerisolierung und Hersteller-RMA.
- * Die East-West-Fabric-Gesundheit verantworten: Link-Level-Diagnosen durchführen (mlxlink, ibdiagnet oder Äquivalent), Transceiver-, Optik-, Kabel- und Switch-Port-Fehler isolieren und die Topologie über InfiniBand- und RoCE/High-Speed-Ethernet-Fabrics validieren.
- * Datenpfadprobleme auf Hochleistungs-Speicherplattformen (z. B. VAST) untersuchen, einschließlich Speicher-Netzwerk-Interaktionen über Clients, Mounts, VIPs und Routing. *
- Strukturierte, hypothesengesteuerte Untersuchungen durchführen; Ursachenanalysen für größere Vorfälle durchführen und langfristige Korrekturen bis zum Abschluss vorantreiben.
- * Änderungen in Live-Kundenumgebungen mit entsprechender Risikobewertung, Peer-Review und Rollback-Plänen erstellen und ausführen.
- * Proaktiv Dashboards, Alarme und Runbooks verbessern, um wiederholte Vorfälle zu verhindern; wiederkehrende Muster identifizieren und in Problemdatensätze und Automatisierung umwandeln.
- * Tickets genau erfassen, aktualisieren und lösen, wobei interne und externe Parteien mit klaren Aussagen zu Kundenbeeinträchtigungen und beweisgestützten Notizen informiert werden, die eine saubere Übergabe ermöglichen.
- * Automatisierungsskripte und kleine Tools entwerfen und implementieren, um Routineaufgaben und menschliche Eingriffe zu reduzieren.
- * Als wichtiger Eskalationspunkt für die Support-Organisation fungieren und strategische Entscheidungen übernehmen, bei denen Ergebnisse zählen.
- * Mid-Level-Ingenieure betreuen und weiterbilden; zum Wissensaustausch in Operations und Engineering beitragen, einschließlich Schulungsinhalten, Workshops und PR-Reviews.
- * Mit gutem Beispiel vorangehen, indem Sie Vertrauen aufbauen und offen sprechen. Bei Bedarf widersprechen und den Status quo in Frage stellen; sich nach getroffenen Entscheidungen voll einbringen.
- * Außerhalb der Geschäftszeiten auf kritische Vorfälle reagieren und nach Bedarf an Rufbereitschaften teilnehmen. Reisen zu Nscale- oder Kundenstandorten, um technische Expertise vor Ort zu leisten.
ÜBER SIE (FÄHIGKEITEN / QUALIFIKATIONEN / ERFAHRUNG)
Erforderliche Erfahrung: 6+ Jahre in Infrastruktur-, Betriebs- oder Support-Engineering-Rollen in Produktionsumgebungen, einschließlich 2–3+ Jahre praktische Erfahrung mit GPU, HPC oder großen Rechenzentrumsumgebungen.
- Erfahrung. 6+ Jahre in Infrastruktur-, Betriebs- oder Support-Engineering in Produktionsumgebungen; 2–3+ Jahre praktische Erfahrung mit GPU, HPC oder großen Rechenzentrumsumgebungen, idealerweise in einer kundenorientierten oder eskalationsgetriebenen Funktion.
- Kommunikation. Fähigkeit, komplexe technische Details klar, spezifisch und prägnant zu erklären – in Tickets, in Incident-Updates und im persönlichen Gespräch mit Kunden und Stakeholdern auf allen Ebenen. Starke schriftliche Disziplin: Ihre Notizen ermöglichen es dem nächsten Ingenieur, dort weiterzumachen, wo Sie aufgehört haben, ohne von vorne beginnen zu müssen.
- GPU-Plattformen (NVIDIA; AMD Instinct von Vorteil). Praktische, aktuelle Erfahrung mit GPU-Treibern, Firmware und Runtime-Stacks auf KI-Trainings- und Inferenzclustern. Sicher im Umgang mit nvidia-smi, DCGM und XID/Fehlerinterpretation; in der Lage, Fehler über GPU, Motherboard, NIC und PCIe-Ebenen zu isolieren und sie von der Diagnose bis zur RMA zu verfolgen.
- Hochleistungs-East-West-Fabrics. Praktische Erfahrung mit RDMA-Fabrics – InfiniBand und/oder RoCE – einschließlich Link-Layer-Diagnosen (mlxlink, ibdiagnet oder Äquivalent), Isolierung von Transceiver-, Kabel- und Switch-Port-Fehlern sowie Verständnis von Rail-optimierten Topologien, NVLink/NVSwitch und NCCL-basiertem Performance-Troubleshooting auf Multi-Node-Clustern.
- HPC-Scheduling. Slurm-Betrieb für große Multi-GPU-Jobs – Container über Pyxis/Enroot, MPI und Diagnose von Queue-, Topologie- und Job-Fehlern.
- Linux System-Engineering im großen Maßstab. Starke Beherrschung moderner Linux-Distributionen, Kernel-Module, Systemd, Netzwerk-Stack und Dateisystem-Tools. Nachgewiesenes Troubleshooting über Compute-, Storage- und Netzwerkschichten in der Produktion.
- Server-Hardware und Steuerungsplattformen. Komfortabler Umgang mit BMC/Redfish, Firmware-Management und Bare-Metal-Provisioning-Workflows (MAAS oder ähnlich) über große Knotenflotten hinweg.
- Netzwerk-Grundlagen. Solides Verständnis von L2/L3, Routing, BGP, VLANs, VXLAN, Firewalls und Load Balancing, mit einem klaren Verständnis dafür, wie sich East-West-Cluster-Traffic von North-South unterscheidet.
- Observability und Incident Response. Erstellung und Nutzung von Alerting-Stacks und Dashboards (Prometheus/Grafana oder ähnlich), Interpretation von Metriken und Alarmen, Durchführung von Runbooks zur Lösung und Beitrag zu SLOs und Post-Incident-Reviews.
- Change- und Risikobewertung. Erfahrung in der Erstellung und Durchführung von Änderungen in geschäftskritischen Umgebungen, einschließlich Risikobewertungen, Analyse von Kundenbeeinträchtigungen und Rollback-Plänen.
- SRE-Style-Operationen. Schreiben und Pflegen von Runbooks, Automatisieren von Diagnosen und Reduzieren menschlicher Eingriffe durch Skripte und kleine Tools.
- Automatisierung und Git. Skripting-Kenntnisse in Bash, Python oder Äquivalent für operative Tools und Integrationen; Erfahrung mit Infrastructure-Automatisierungstools (Ansible, Terraform oder ähnlich).
- Rechenzentrum-Grundlagen. Verständnis der Funktionsweise von Rechenzentren – Server, Netzwerke, Speicher, Stromversorgung und Kühlung – idealerweise erworben durch einen operativen Support-Hintergrund.
- Führung. Diszipliniert, organisiert und selbstmotiviert, mit der Fähigkeit, andere Ingenieure zu betreuen und zu motivieren, entscheidende Maßnahmen zu ergreifen und das Team und die breitere Organisation zur Verbesserung anzutreiben.
- Anpassungsfähigkeit. Fähigkeit, sich an kundengetriebene Anforderungen anzupassen, einschließlich spezialisiertem Support außerhalb der Kernarbeitszeiten und Reisen für Vor-Ort-Arbeiten.
NICHT ZWINGEND ERFORDERLICH (NICE TO HAVE)
- Hochleistungs-Speicher. Praktische Erfahrung mit VAST oder vergleichbaren KI-optimierten Speicherplattformen oder Ceph/Parallel-Dateisystemen und NFS im großen Maßstab (Multipath, Remoteports, Nconnect), einschließlich der Diagnose von Speicher-Netzwerk-Interaktionen und Datenpfad-Performance-Problemen.
- OpenStack und Fleet-Operations-Tools. OpenStack-Betriebserfahrung (Neutron, Cinder, Fehleranalyse) sowie Vertrautheit mit Fleet-Scale-Tools für Provisioning, Gesundheit und Fehlerbehebung über große GPU-Bestände hinweg (MAAS, NetBox, Redfish-gesteuerte Automatisierung oder ähnlich).
- Kubernetes. Betrieb und Fehlerbehebung von Clustern, einschließlich GPU-Operator-Stacks und Verständnis, wie physische Ressourcen im Stack abstrahiert werden. Hilfreicher Kontext für unsere Plattform, obwohl nicht der Kern dieser Rolle.
- Automatisierung im großen Maßstab. Automatisierte Netzwerkkonfiguration mit sicheren, wiederholbaren Änderungen in geschäftskritischen Umgebungen; GitOps und CI/CD-Pipelines (GitHub Actions oder ähnlich); Zugangs- und Sicherheitstools wie Teleport oder Vault in der Produktion.
- Zertifizierungen. Relevante GPU/HPC-, Rechenzentrum-Architektur-, Linux-, Netzwerk-, Kubernetes-, Cloud- oder Sicherheitszertifizierungen (z. B. RHCSA/RHCE, CKA, NVIDIA-zertifiziert) sind ein Plus.
WAS WIR IHNEN BIETEN KÖNNEN
Bei Nscale finden Sie ein kollaboratives, unterstützendes und innovatives Umfeld, in dem Ihre Beiträge echte Wirkung erzielen. Wir bauen etwas Außergewöhnliches auf und möchten Sie im Mittelpunkt haben.
- Hochgradig wettbewerbsfähiges Paket, einschließlich Grundgehalt und Aktienoptionen, mit Überprüfungen alle 12 Monate.
- Treten Sie einem der am schnellsten wachsenden Tech-Startups bei: Ihre Chance, Grenzen zu verschieben, mit brillanten Köpfen zusammenzuarbeiten und Ihre Spuren in der Spitzentechnologie für KI zu hinterlassen.
- Erwarten Sie einen dynamischen Entwicklungsplan, der auf Ihre Ambitionen zugeschnitten ist. Wachsen Sie, indem Sie neue Dinge ausprobieren, führen, den Status quo in Frage stellen und Ihre Wirkung verantworten, immer mit unserer vollen Unterstützung.
- Menschzentrierte Flexibilität. Wir betrachten Sie in erster Linie als Menschen. Unser flexibler Arbeitsplatz vertraut darauf, dass Nscaler ihre Aufgaben erfüllen, und gibt Ihnen die Autonomie, Ihren Tag um die Momente des Lebens herum zu gestalten.
- Treten Sie unserem florierenden Remote-First-Team bei. Geografie ist keine Barriere für Wirkung oder Verbindung. Wir bauen nahtlose virtuelle Zusammenarbeit auf und befähigen Sie, wo auch immer Sie arbeiten.
CHANCENGLEICHHEITSERKLÄRUNG
Bei Nscale verpflichten wir uns, ein inklusives, vielfältiges und gerechtes Arbeitsumfeld zu fördern. Wir glauben, dass eine Vielzahl von Perspektiven unser Arbeitsumfeld bereichert, und wir ermutigen Bewerbungen von Kandidaten aller Hintergründe, Erfahrungen und Fähigkeiten. Wir ermutigen ausdrücklich Bewerbungen von People of Colour, der LGBTQ+-Community, Menschen mit Behinderungen, neurodivergenten Menschen, Eltern, Betreuern und Menschen aus sozioökonomisch benachteiligten Verhältnissen.
Wenn es etwas gibt, das wir tun können, um Ihre spezielle Situation zu berücksichtigen, lassen Sie es uns bitte wissen.
Die nachstehende Spanne spiegelt das Grundgehalt für die Position wider. Die tatsächliche Vergütung kann je nach berufsbezogenen Faktoren wie Fähigkeiten, Erfahrung, Ausbildung und Standort variieren. Zusätzlich zum Grundgehalt kann diese Rolle für Bonus-, Aktienoptions- und/oder Provisionsprogramme in Frage kommen. Nscale kann ein wettbewerbsfähiges Leistungspaket anbieten, einschließlich Kranken-, Zahn-, Sehversicherung, flexible bezahlte Urlaubszeit, Elternzeit und Teilnahme an einem Altersvorsorgeplan.
Gehaltsspanne
$120,000—$170,000 USD
Informationen darüber, wie Nscale personenbezogene Daten von Kandidaten verarbeitet, finden Sie in unserer Datenschutzmitteilung für Mitarbeiter und Kandidaten: Hier. drive.google.com/file/d/1QK5Yg04WHD9K9IAtJgQWubJZC9oLvatK/view?usp=sharing Nscale akzeptiert keine unaufgeforderten Kandidatenangebote von Personalvermittlungsagenturen.
