Roku
Nebius
Senior Developer Advocate
Über uns
Nebius: Nebius leitet eine neue Ära in der Cloud-Infrastruktur für die globale KI-Wirtschaft ein. Wir bauen eine full-stack KI-Cloud-Plattform auf, die Entwickler und Unternehmen vom Training von Daten und Modellen bis hin zur Produktionsbereitstellung unterstützt, ohne die Kosten und Komplexität des Aufbaus großer interner KI/ML-Infrastrukturen. Von Ingenieuren für Ingenieure entwickelt. Von der groß angelegten GPU-Orchestrierung bis zur Inferenzoptimierung – wir meistern die schwierigen Probleme in den Bereichen Compute, Speicher, Netzwerk und angewandte KI. An der Nasdaq (NBIS) notiert und mit Hauptsitz in Amsterdam, verfügen wir über eine globale Präsenz mit F&E-Zentren in Europa, Großbritannien, Nordamerika und Israel. Unser Team von 1,500+ umfasst Hunderte von Ingenieuren mit tiefgreifender Expertise in den Bereichen Hardware, Software und KI-F&E.
Ansässig in der San Francisco Bay Area oder Umzugsbereitschaft.
#LI-LT1
Transparenz bei der Bezahlung
Wir bieten wettbewerbsfähige Vergütungs- und Leistungspakete. Die tatsächliche Vergütung wird auf der Grundlage von berufsbezogenen Faktoren ermittelt, einschließlich Erfahrung, Fähigkeiten, Qualifikationen, der Stufe, auf der der Kandidat eingestellt wird, und des geografischen Standorts, im Einklang mit geltendem Recht.
Basisvergütungsspanne
$179,500—$224,300 USD
Erklärung zu Chancengleichheit
Nebius ist ein Arbeitgeber, der Chancengleichheit fördert. Wir verpflichten uns, ein inklusives und vielfältiges Arbeitsumfeld zu schaffen und in allen Aspekten der Beschäftigung gleiche Beschäftigungsmöglichkeiten zu bieten. Wir diskriminieren nicht aufgrund von Rasse, Hautfarbe, Religion, Geschlecht (einschließlich Schwangerschaft), nationaler Herkunft, Abstammung, Alter, Behinderung, genetischen Informationen, Familienstand, Veteranenstatus, sexueller Orientierung, Geschlechtsidentität oder -ausdruck oder anderen Merkmalen, die durch geltendes Recht geschützt sind.
Bewerber müssen berechtigt sein, in dem Land zu arbeiten, in dem sie sich bewerben, und müssen als Bedingung für die Einstellung einen Nachweis über die Beschäftigungsberechtigung erbringen.
Wenn Sie während des Bewerbungsprozesses Unterkünfte benötigen, teilen Sie uns dies bitte mit.
DIE ROLLE
Wir suchen einen engagierten, einfallsreichen Developer Advocate, der die Inferenz versteht, um Entwickler bei der Ausführung von Open-Source-Modellen in der Produktion auf Token Factory, der Hochleistungs-Inferenzplattform von Nebius, zu unterstützen.
Jeder Agent, Copilot und jedes KI-Produkt läuft auf einer Inferenzschicht, und die Entwickler, die diese Schicht wählen, haben schwierige Fragen: Welches Open-Source-Modell sollte ich für diesen Schritt verwenden? Was kostet das pro Million Tokens bei meinem Traffic? Warum steigt meine p99 Latenz? Warum wird mein Multi-Turn-Agent langsamer und teurer, je mehr Kontext er hat? Wann wechsle ich von einem Serverless-Endpunkt zu einem dedizierten, und wann ist Fine-Tuning besser als ein längerer Prompt? Ihre Aufgabe ist es, glaubwürdige, praxisnahe Antworten auf diese Fragen zu geben und die Arbeit öffentlich zu zeigen.
Sie werden Teil des Token Factory Produkt- und Engineering-Teams in San Francisco sein. Sie werden an deren Stand-ups und Bug-Fixing-Sessions teilnehmen, Kundenfeedback an sie weitergeben und Dokumentationslücken selbst schließen, wenn Sie welche finden.
Sie werden sich in der KI-nativen Community der Bay Area genauso wohlfühlen: bei den Meetups, die unsere Kunden und Partner veranstalten, und in den Open-Source-Inferenzprojekten, die Entwickler tatsächlich nutzen.
Dies ist eine praxisorientierte Rolle für Macher. Der Inhalt, der hier zählt, ist weniger "wie rufe ich die API auf", sondern mehr "so wird ein Produktions-Inferenz-Stack zusammengebaut und das sind die Kompromisse". Wenn Sie starke Meinungen zur Bereitstellung von Open-Source-Modellen haben und eine Plattform suchen, um diese zu beweisen, ist diese Rolle genau das Richtige für Sie.
Diese Stelle ist in der San Francisco Bay Area angesiedelt. Der Schwerpunkt des Token Factory Teams liegt in San Francisco, und wir erwarten, dass diese Person Teil der lokalen Community vor Ort ist.
Wie ist es, bei Nebius zu arbeiten:
Schnelles Tempo – Kühnes Denken – Ständiges Wachstum – Bedeutsame Wirkung – Vertrauen und echte Eigenverantwortung – Möglichkeit, die Zukunft der KI zu gestalten
Ihre Aufgaben umfassen:
- Entwicklern und Teams helfen, Token Factory für Produktions-Inferenz-Workloads zu entdecken, zu bewerten und zu übernehmen, von einem ersten API-Aufruf auf einem Serverless-Endpunkt bis hin zu dedizierten Endpunkten und feinabgestimmten Modellen.
- Demos, Benchmarks und Referenzarchitekturen erstellen, die reale Kompromisse konkret machen: welches Open-Source-Modell für welchen Schritt, Latenz gegen Kosten pro Token, wie das Kontextwachstum Multi-Turn-Agenten beeinflusst, Zuverlässigkeit von Tool-Aufrufen und strukturierten Ausgaben, und wann Fine-Tuning oder ein benutzerdefinierter Spekulant sich im Vergleich zu einem größeren Modell oder einem längeren Prompt auszahlt.
- Zeigen, wie Token Factory in den Stack passt, den Entwickler bereits verwenden: OpenAI-kompatible SDKs, Agenten-Frameworks, MCP und Tool-Nutzung, Evals, Embeddings und Retrieval sowie Post-Training.
- Eingebettet im Token Factory Produkt- und Engineering-Team: Teilnahme an Stand-ups und Bug-Fixing-Sessions, Testen neuer Modelle und Features vor der Veröffentlichung und Sicherstellen, dass die richtigen Beispiele und Dokumentationen am ersten Tag jeder Veröffentlichung vorhanden sind.
- Den Entwickler-Feedback-Loop verantworten. Sammeln, was für Entwickler problematisch ist, als konkretes Produktfeedback zurückgeben und nachverfolgen, bis es umgesetzt oder explizit abgelehnt wird.
- Nebius in der Bay Area Inferenz- und Open-Source-Modell-Community vertreten: Meetups, Partner- und Kundenveranstaltungen, Open-Source-Communities wie vLLM, SGLang und Ray sowie Entwicklerkonferenzen.
- Technische Inhalte veröffentlichen und Vorträge halten, die Entwickler vom ersten Hören von Token Factory bis zur Ausführung von etwas darauf begleiten, und mit dem Marketing zusammenarbeiten, um echte Entwicklergeschichten in Fallstudien zu verwandeln.
- Eng mit dem DevRel-Team und dem Produktmarketing-Team von Token Factory bei Produkteinführungen, Community-Programmen und Content-Strategien zusammenarbeiten.
Mindestanforderungen
Wir erwarten von Ihnen:
- Praktische Erfahrung mit der Ausführung von Open-Source-Modellen in der Produktion oder im großen Maßstab über einen Inferenz-Provider oder einen Serving-Stack, mit einer klaren Vorstellung davon, wie Sie ihn ausgewählt haben und was schiefgelaufen ist. Wenn Sie Token Factory noch nicht ausprobiert haben, erwarten wir, dass Sie dies getan haben, bevor wir sprechen.
- Ein funktionierendes Verständnis dessen, was unter der Haube einer Serving-Engine wie vLLM oder SGLang passiert: kontinuierliches Batching, KV- und Präfix-Caching, Quantisierung, spekulative Dekodierung und wie sich jede davon in Latenz und Kosten niederschlägt. Sie werden diese nicht auf Token Factory abstimmen, aber Sie müssen sich mit den Ingenieuren, die dies tun, auf Augenhöhe unterhalten können.
- Aktuelles, praxisnahes Wissen über das Open-Source-Modell-Ökosystem, einschließlich welcher Modelle für welche Workloads empfehlenswert sind und warum.
- Komfort beim Schreiben und Überprüfen von Code, Reproduzieren von Problemen und selbstständiges Beheben von Fehlern in Dokumentationen und Beispielen.
- Eine Erfolgsbilanz im öffentlichen Erstellen und Erklären: Vorträge, Open-Source-Beiträge, Schreiben oder eine aktive technische Präsenz auf GitHub, X oder LinkedIn. Ein DevRel-Titel ist nicht erforderlich.
- Die Fähigkeit, komplexe Systeme klar für technische und nicht-technische Zielgruppen zu erklären und ein glaubwürdiger technischer Partner für Ingenieure, Produktmanager und Kunden zu sein.
- Ansässig in der San Francisco Bay Area oder Umzugsbereitschaft.
Kandidaten aus den Bereichen Forward-Deployed Engineering, Solutions Architecture, ML Engineering oder Technical Product sind ausdrücklich ermutigt, sich zu bewerben.
Es ist ein Plus, wenn Sie Folgendes haben:
- Praktische Erfahrung mit Supervised Fine-Tuning, Destillation oder RL-Post-Training von Open-Source-Modellen und eine Einschätzung, wann dies einem längeren Prompt oder einem größeren Modell überlegen ist.
- Beiträge zu Open-Source-Inferenz- oder verteilten Computing-Projekten wie vLLM, SGLang oder Ray.
- Erfahrung bei einem Inferenz- oder GPU-Cloud-Anbieter oder als intensiver Nutzer mehrerer davon.
- Ein bestehendes Publikum, das Ihren Einschätzungen zu Modellen und Infrastruktur vertraut.
Wichtige Arbeitnehmerleistungen in den USA:
- Krankenversicherung: 100% vom Unternehmen bezahlte Kranken-, Zahn- und Sehkraftversicherung für Mitarbeiter und Familien.
- 401(k) Plan: Bis zu 4% Unternehmens-Match mit sofortiger Vesting.
- Elternurlaub: 20 Wochen bezahlter Urlaub für primäre Betreuer, 12 Wochen für sekundäre Betreuer.
- Erstattung für Fernarbeit: Bis zu $85/Monat für Mobilfunk und Internet.
- Invaliditäts- und Lebensversicherung: Vom Unternehmen bezahlte kurz-, langfristige und Lebensversicherungsdeckung.
Leistungen & Vergünstigungen
- Wettbewerbsfähige Vergütung
- Karrierewachstum und Lernmöglichkeiten
- Flexibilität und Eigenverantwortung
- Kollaborative und innovative Kultur
- Möglichkeit, an wirkungsvollen KI-Projekten zu arbeiten
- Internationales Umfeld und talentierte Teams
