Sciforium

Distributed Training and Inference Engineer

PythonC++
Automatische Übersetzung. Prüfe das Original.

Über die Stelle

Sciforium ist ein Unternehmen für KI-Infrastruktur, das multimodale KI-Modelle der nächsten Generation sowie eine proprietäre, hocheffiziente Serving-Plattform entwickelt. Unterstützt durch eine Finanzierung in Millionenhöhe und direkte Förderung durch AMD, inklusive praktischer Unterstützung durch AMD-Ingenieure, skaliert das Team schnell, um den full stack zu entwickeln, der moderne KI-Modelle und Echtzeitanwendungen antreibt.

Über die Rolle

Sciforium sucht einen hochqualifizierten Ingenieur für verteiltes Training und Inferenz, um den kritischen Software-Stack zu entwickeln, zu optimieren und zu pflegen, der unsere groß angelegten KI-Trainings- und Serving-Workloads antreibt. In dieser Rolle arbeiten Sie über den gesamten machine learning-Infrastruktur-Stack hinweg, von Low-Level CUDA/ROCm-Runtimes bis hin zu High-Level-Frameworks wie JAX und PyTorch, um sicherzustellen, dass unsere verteilten Trainingssysteme schnell, skalierbar, stabil und effizient sind.

Diese Position ist ideal für jemanden, der tiefgreifendes System-Engineering liebt, komplexe Hardware-Software-Interaktionen debuggt und die Leistung auf jeder Ebene des ML-Stacks optimiert. Sie spielen eine entscheidende Rolle bei der Ermöglichung des Trainings und der Bereitstellung von LLMs und generativen KI-Modellen der nächsten Generation.

Ihre Aufgaben

  1. Wartung des Software-Stacks: Pflege, Aktualisierung und Optimierung kritischer ML-Bibliotheken und Frameworks, einschließlich JAX, PyTorch, CUDA und ROCm über verschiedene Umgebungen und Hardwarekonfigurationen hinweg.
  1. End-to-End Stack-Verantwortung: Aufbau, Wartung und kontinuierliche Verbesserung des gesamten ML-Software-Stacks, von ROCm/CUDA-Treibern bis hin zu High-Level JAX/PyTorch-Tools.
  1. Optimierung verteilter Systeme: Sicherstellung, dass alle Modellimplementierungen effizient gesharded, partitioniert und für groß angelegtes verteiltes Training und Serving konfiguriert sind.
  1. Systemintegration: Kontinuierliche Integration und Validierung von Modulen hinsichtlich Laufzeitkorrektheit, Speichereffizienz und Skalierbarkeit über Multi-Node-GPU/Beschleuniger-Cluster hinweg.
  1. Profiling & Leistungsanalyse: Durchführung detaillierter Profilings von Kompilierungsgraphen, Trainings-Workloads und Laufzeitausführungen, um die Leistung zu optimieren und Engpässe zu beseitigen.
  1. Debugging & Zuverlässigkeit: Fehlerbehebung bei komplexen Hardware-Software-Interaktionsproblemen, einschließlich vLLM-Kompilierungsfehlern auf ROCm, CUDA-Speicherlecks, Fehlern in verteilten Runtimes und Inkonsistenzen auf Kernelebene.

Zusammenarbeit mit Forschungs-, Infrastruktur- und Kernel-Engineering-Teams zur Verbesserung des Systemdurchsatzes, der Stabilität und der Entwicklererfahrung.

Ihr Profil

  1. 5+ Jahre Berufserfahrung in ML-Systemen, verteiltem Training oder verwandten Bereichen.
  1. Bachelor- oder Masterabschluss in Informatik, Computertechnik, Elektrotechnik oder einem verwandten technischen Bereich.
  1. Fundierte Programmiererfahrung in Python, C++ sowie Vertrautheit mit ML-Tools und verteilten Systemen.
  1. Tiefgreifendes Verständnis von Profiling-Tools (z. B. Nsight, ROCm Profiler, XLA Profiler, TPU-Tools).
  1. Fundierte Expertise bei der Konfiguration der Partitionierung in modernen ML-Frameworks wie PyTorch und JAX.
  1. Erfahrung mit verteilten Multi-Node-Trainingssystemen und Orchestrierungs-Frameworks (DTensor, GSPMD usw.).
  1. Praktische Erfahrung in der Wartung oder dem Aufbau von ML-Trainings-Stacks unter Verwendung von CUDA, ROCm, NCCL, XLA oder ähnlichen Technologien.

Wünschenswert

  1. Umfangreiche Erfahrung mit dem XLA/JAX-Stack, einschließlich Kompilierungsinterna und benutzerdefinierten Lowering-Pfaden.
  1. Vertrautheit mit verteiltem Serving oder groß angelegten Inferenz-Frameworks (z. B. vLLM, TensorRT, FasterTransformer).
  1. Hintergrund in der GPU-Kernel-Optimierung oder beschleunigerbewussten Modellpartitionierung.
  1. Starkes Verständnis von Low-Level C++-Bausteinen, die in ML-Frameworks verwendet werden (z. B. XLA, CUDA-Kernels, benutzerdefinierte Ops).

Wir bieten

  • Kranken-, Zahn- und Augenversicherung
  • 401k-Plan
  • Tägliches Mittagessen, Snacks und Getränke
  • Flexible Urlaubsregelung
  • Wettbewerbsfähiges Gehalt und Unternehmensanteile

Chancengleichheit

Sciforium ist ein Arbeitgeber, der Chancengleichheit fördert. Alle Bewerber werden unabhängig von Rasse, Hautfarbe, Religion, Geschlecht, sexueller Orientierung, Geschlechtsidentität, nationaler Herkunft, Veteranenstatus oder Behinderung für eine Anstellung in Betracht gezogen.

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026