Solaris
Prior Labs
ML Engineer, Infrastruktur
Über die Rolle
Wer wir sind
Foundation Models haben Text und Bilder transformiert. Strukturierte Daten – das größte und folgenreichste Datenformat der Welt – blieben unberührt, bis jetzt. Was LLMs für Sprache getan hat, tun wir jetzt für Tabellen.
Wir haben tabellarische Foundation Models entwickelt: TabPFN v2 war auf dem Titelbild von Nature, hat über 3.5 Mio. Downloads und 7,500+ GitHub Sterne erreicht und wird in der Produktion eingesetzt, von der Erkennung von Lungenerkrankungen mit Oxford Cancer Analytics bis zur Verhinderung von Zugausfällen mit Hitachi. Die schwierigsten Probleme – Millionen von Zeilen, Echtzeit-Inferenz, völlig neue Modalitäten – sind noch offen, und niemand sonst arbeitet auf diesem Niveau daran.
Wir sind ein kleines, hochselektives Team von über 40 Personen mit Hintergründen von Google, DeepMind, Meta, Apple, Amazon, Jane Street und CERN, angeführt von Frank Hutter, Noah Hollmann und Sauraj Gambhir, und beraten von Bernhard Schölkopf und Turing-Award-Gewinner Yann LeCun.
Im Juli 2026, weniger als 18 Monate nach unserem €9 Mio. Pre-Seed, sind wir SAP als unabhängiges Frontier AI Lab beigetreten – dasselbe Team, dieselbe Mission und dieselben Open-Weights-Modelle, jetzt unterstützt durch mehr als €1 Milliarden über vier Jahre.
Über die Rolle
Wir geben jährlich zig Millionen für GPU-Rechenleistung aus, um tabellarische Foundation Models zu trainieren. Das ist kein Ziel, sondern das, was wir heute betreiben, und es wächst. Die Person, die diese Infrastruktur verantwortet, trifft Entscheidungen im Wert von Millionen von Dollar: Cluster-Architektur, Effizienz der Zeitplanung, Anbieterstrategie, Hardwareauswahl. Eine falsche Entscheidung kostet sechsstellige Beträge.
Heute betreiben wir Slurm auf GCP über mehrere Cluster hinweg. Wir skalieren auf Multi-Cluster-, Multi-Provider-Infrastruktur und evaluieren neue Hardware-Generationen, sobald sie verfügbar sind. Sie verantworten den full stack, von Cluster-Operationen und Kostenoptimierung bis hin zur Leistung des verteilten Trainings und der Tooling-Schicht, die die Forscher schnell vorankommen lässt. Sie arbeiten direkt mit dem Forschungsteam zusammen und verstehen dessen Arbeit gut genug, um Infrastruktur-Entscheidungen zu treffen, die ihnen tatsächlich helfen. Und dies ist keine reine Support-Rolle. Wir betreiben eine offene Umgebung. Wenn Sie die nächste SOTA-Tabellenarchitektur auf Lager haben, legen Sie los und trainieren Sie sie.
Leben bei Prior Labs
Sie werden Seite an Seite mit Forschern und Entwicklern arbeiten, die hohe Ansprüche an sich selbst stellen – sowohl an die Qualität ihrer Arbeit als auch an die Zusammenarbeit. Wir arbeiten schnell und nehmen uns dennoch die Zeit, Dinge richtig zu machen.
Unsere Teams haben ihren Sitz in Berlin, Freiburg und New York – wenn man an etwas so Schwierigem wie TabPFN arbeitet, ist es wichtig, im selben Raum zu sein. Aber großartige Leute kommen von überall her, und in Ausnahmefällen sind wir offen für Remote-Arbeit, was normalerweise häufige Reisen zu einem unserer Büros bedeutet. Wo auch immer Sie ansässig sind, das gesamte Unternehmen kommt regelmäßig zu Offsites zusammen, um gemeinsam zu entwickeln und zu feiern.
Unsere Verpflichtungen
Die besten Produkte und Teams werden von Menschen mit einer breiten Palette von Perspektiven und Hintergründen aufgebaut. Wir begrüßen Bewerbungen von allen Identitäten und Lebensbereichen – insbesondere, wenn Sie sich jemals entmutigt gefühlt haben, weil Sie "nicht alle Kriterien erfüllen" – und bieten gleiche Chancen unabhängig von Geschlecht, sexueller Orientierung, Herkunft, Behinderung oder jedem anderen Merkmal, das Sie ausmacht.
Wir legen Wert auf den Umgang mit Ihren Daten – siehe unsere Seite zur Datenschutzbestimmungen für Bewerber
Worauf Sie sich konzentrieren werden
- Verantwortung und Weiterentwicklung der Multi-Cluster-GPU-Infrastruktur. Slurm auf GCP heute, morgen Multi-Provider und neue Hardware. Architektur, Scheduling, Zuverlässigkeit, Kostenoptimierung
- Steigerung der GPU-Auslastung und des Trainingsdurchsatzes: Profiling, Speicheroptimierung, Kommunikationsengpässe, systemnahes Debugging von verteiltem Training über große Läufe hinweg
- Architektur der nächsten Generation unserer Infrastruktur: Multi-Cluster-Orchestrierung, neue GPU-Generationen, Diversifizierung der Anbieter, Kapazitätsplanung angesichts wachsender Rechenanforderungen
- Aufbau der Entwicklerproduktivitätsschicht: CI-Pipelines, Experiment-Tracking, Model Registry, Datenverarbeitung und interne Tools, die die Iterationsgeschwindigkeit der Forschung hoch halten
- Verantwortung für das Rechenbudget. Sie verstehen die Kosten pro FLOP über Anbieter und Hardware hinweg und Sie hassen verschwendete Rechenleistung
- Tech-Stack: Slurm, GCP, Docker, wandb, GitHub Actions, uv, PyTorch, Triton
Mindestanforderungen
Sie könnten gut passen, wenn Sie Folgendes mitbringen:
- 3+ Jahre Erfahrung im Aufbau und Betrieb von Produktions-GPU-Infrastrukturen oder verteilten Trainingssystemen im großen Maßstab. In einem großen KI-Labor, einem gut finanzierten ML-Startup oder einer HPC-Umgebung
- Tiefgreifende praktische Erfahrung mit Slurm und Cluster-Management. Sie haben Scheduling-Fehler behoben, die Auslastung über Multi-Tenant-GPU-Workloads optimiert und Infrastrukturen betrieben, bei denen Ausfallzeiten erhebliche Kosten verursachen
- Expertenniveau im Systemdenken: Speicherbandbreite, GPU-Profiling. Sie denken in Hardware, nicht in Konfigurationen
- Starke Python-Kenntnisse und echte Sprachgewandtheit in den PyTorch-Interna. Genug, um einen Trainingslauf zu profilieren und zu erkennen, ob der Engpass beim Laden von Daten, bei der Kommunikation oder bei der Berechnung liegt
- Nachweisbare Erfolge bei Infrastruktur-Entscheidungen, die den Trainingsdurchsatz oder die Kosteneffizienz messbar verbessert haben
- Starke KI-Tooling-Kenntnisse. Sie nutzen Claude Code, Cursor oder ähnliche Tools fließend, um schnell voranzukommen, ohne die Qualität zu beeinträchtigen
Von Vorteil
- Erfahrung im Betrieb von GPU-Ausgaben im zweistelligen Millionenbereich
- Erfahrung mit Multi-Cloud- oder Hybrid-HPC/Cloud-Infrastrukturen
- Erfahrung mit Triton, CUDA oder benutzerdefinierten Kernels
- Erfahrung in der Skalierung von einzelnen Clustern zur Multi-Cluster-Orchestrierung
- Hintergrund im Aufbau von Tools für Experiment-Tracking, Model Registry oder ML-Pipelines
