NVIDIA
Anthropic
Research Engineer, Machine Learning (Reinforcement Learning)
ÜBER ANTHROPIC
Die Mission von Anthropic ist es, zuverlässige, interpretierbare und steuerbare KI-Systeme zu entwickeln. Wir möchten, dass KI sicher und vorteilhaft für unsere Nutzer sowie für die Gesellschaft als Ganzes ist. Unser Team ist eine schnell wachsende Gruppe engagierter Forscher, Ingenieure, Politikexperten und Führungskräfte, die gemeinsam daran arbeiten, vorteilhafte KI-Systeme zu entwickeln.
ÜBER DIE TEAMS
Unsere Reinforcement Learning (RL)-Teams leiten die RL-Forschung und -Entwicklung bei Anthropic und spielen eine entscheidende Rolle bei der Weiterentwicklung unserer KI-Systeme. Wir haben zu allen Claude-Modellen beigetragen, mit erheblichen Auswirkungen auf die Autonomie- und Codierungsfähigkeiten von Claude Sonnet 4.5 und Opus 4.5. Unsere Arbeit umfasst mehrere Schlüsselbereiche:
- Entwicklung von Systemen, die es Modellen ermöglichen, Computer effektiv zu nutzen
- Weiterentwicklung der Code-Generierung durch Reinforcement Learning
- Pionierarbeit in der grundlegenden RL-Forschung für große Sprachmodelle
- Aufbau skalierbarer RL-Infrastruktur und Trainingsmethoden
- Verbesserung der Modellierungsfähigkeiten
Wir arbeiten eng mit den Alignment- und Frontier-Red-Teams von Anthropic zusammen, um sicherzustellen, dass unsere Systeme sowohl leistungsfähig als auch sicher sind. Wir arbeiten mit dem Applied Production Training Team zusammen, um Forschungsinnovationen in eingesetzte Modelle zu bringen, und sind bestrebt, unsere Forschung im großen Maßstab zu implementieren. Unsere RL-Teams stehen an der Schnittstelle von Spitzenforschung und technischer Exzellenz, mit einem tiefen Engagement für den Aufbau hochwertiger, skalierbarer Systeme, die die Grenzen dessen, was KI leisten kann, verschieben.
ÜBER DIE ROLLE
Als Research Engineer im Bereich Reinforcement Learning arbeiten Sie mit einer vielfältigen Gruppe von Forschern und Ingenieuren zusammen, um die Fähigkeiten und die Sicherheit großer Sprachmodelle zu verbessern. Diese Rolle kombiniert Forschungs- und Ingenieurverantwortlichkeiten, was von Ihnen verlangt, sowohl neuartige Ansätze zu implementieren als auch zur Forschungsrichtung beizutragen. Sie werden an grundlegender Forschung im Bereich Reinforcement Learning arbeiten, 'agentische' Modelle durch Werkzeugnutzung für offene Aufgaben wie Computernutzung und autonome Softwaregenerierung erstellen, die Fähigkeit zur Problemlösung in Bereichen wie Mathematik verbessern und Prototypen für den internen Gebrauch, die Produktivität und die Evaluierung entwickeln.
WAS UNS UNTERSCHEIDET
Wir glauben, dass die wirkungsvollste KI-Forschung 'Big Science' sein wird. Bei Anthropic arbeiten wir als ein einziges, zusammenhängendes Team an nur wenigen groß angelegten Forschungsinitiativen. Und wir schätzen Wirkung – die Weiterentwicklung unserer langfristigen Ziele für steuerbare, vertrauenswürdige KI – anstatt an kleineren und spezifischeren Problemen zu arbeiten. Wir betrachten KI-Forschung als empirische Wissenschaft, die ebenso viel mit Physik und Biologie gemeinsam hat wie mit traditionellen Ansätzen der Informatik. Wir sind eine äußerst kollaborative Gruppe und veranstalten häufige Forschungsdiskussionen, um sicherzustellen, dass wir jederzeit die wirkungsvollste Arbeit verfolgen. Daher schätzen wir Kommunikationsfähigkeiten sehr.
Der einfachste Weg, unsere Forschungsrichtungen zu verstehen, ist die Lektüre unserer aktuellen Forschung. Diese Forschung setzt viele der Richtungen fort, an denen unser Team vor Anthropic gearbeitet hat, darunter: GPT-3, Circuit-Based Interpretability, Multimodal Neurons, Scaling Laws, AI & Compute, Concrete Problems in AI Safety und Learning from Human Preferences.
BEISPIELHAFTE PROJEKTE
- Entwerfen und Optimieren der Kern-RL-Infrastruktur, von sauberen Trainingsabstraktionen bis hin zum verteilten Experimentenmanagement über GPU-Cluster hinweg. Helfen Sie beim Skalieren unserer Systeme, um zunehmend komplexe Forschungsabläufe zu bewältigen.
- Entwerfen, Implementieren und Testen neuartiger Trainingsumgebungen, Auswertungen und Methoden für RL-Agenten, die den Stand der Technik für die nächste Generation von Modellen vorantreiben.
- Steigerung der Leistung über unseren gesamten Stack durch Profiling, Optimierung und Benchmarking. Implementieren Sie effiziente Caching-Lösungen und debuggen Sie verteilte Systeme, um sowohl Trainings- als auch Auswertungsabläufe zu beschleunigen.
- Zusammenarbeit mit Forschungs- und Ingenieurteams zur Entwicklung automatisierter Testframeworks, zum Entwurf sauberer APIs und zum Aufbau skalierbarer Infrastruktur, die die KI-Forschung beschleunigt.
Mindestanforderungen
SIE KÖNNTEN GUT PASSEN, WENN SIE
- Versiert in Python und asynchroner/konkurrierender Programmierung mit Frameworks wie Trio sind
- Erfahrung mit machine learning Frameworks (PyTorch, TensorFlow, JAX) haben
- Branchenerfahrung in der machine learning-Forschung haben
- Forschungsexploration mit technischer Implementierung in Einklang bringen können
- Freude am Pair Programming haben (wir lieben es!)
- Wert auf Codequalität, Tests und Leistung legen
- Starke Fähigkeiten im Systemdesign und in der Kommunikation besitzen
- Leidenschaft für das Potenzial von KI haben und sich für die Entwicklung sicherer und vorteilhafter Systeme engagieren
STARKE KANDIDATEN KÖNNTEN HABEN
- Vertrautheit mit LLM Architekturen und Trainingsmethoden
- Erfahrung mit Reinforcement Learning Techniken und Umgebungen
- Erfahrung mit Virtualisierungs- und Sandbox-Codeausführungsumgebungen
- Erfahrung mit Kubernetes
- Erfahrung mit verteilten Systemen oder Hochleistungsrechnen
- Erfahrung mit Rust und/oder C++
STARKE KANDIDATEN MÜSSEN NICHT HABEN
- Formale Zertifizierungen oder Bildungsnachweise
- Akademische Forschungserfahrung oder Publikationshistorie
Bewerbungsfrist: Keine. Bewerbungen werden fortlaufend geprüft.
Die unten aufgeführte Gehaltsspanne gilt für diese Position. Bei Vertriebspositionen ist die angegebene Spanne die OTE-Spanne (On Target Earnings) der Position, d. h. die Spanne umfasst sowohl die Zielprovisionen/Verkaufsboni als auch das jährliche Grundgehalt für die Position.
Jahresgehalt: £260,000—£630,000 GBP
LOGISTIK
Mindestbildung: Bachelor-Abschluss oder eine gleichwertige Kombination aus Bildung, Schulung und/oder Erfahrung
Erforderlicher Studienbereich: Ein für die Rolle relevanter Bereich, nachgewiesen durch Kurse, Schulungen oder Berufserfahrung
Mindestjahre an Erfahrung: Die erforderliche Berufserfahrung korreliert mit den internen Anforderungsstufen für die Position
Standortbasierte Hybridrichtlinie: Derzeit erwarten wir, dass alle Mitarbeiter mindestens 25% der Zeit in einem unserer Büros anwesend sind. Einige Rollen erfordern jedoch möglicherweise mehr Zeit in unseren Büros.
Visumsponsorship: Wir sponsern Visa! Wir können jedoch nicht für jede Rolle und jeden Kandidaten erfolgreich Visa sponsern. Wenn wir Ihnen jedoch ein Angebot machen, werden wir alle zumutbaren Anstrengungen unternehmen, um Ihnen ein Visum zu besorgen, und wir beauftragen einen Einwanderungsanwalt, um dabei zu helfen.
Wir ermutigen Sie zur Bewerbung, auch wenn Sie nicht glauben, jede einzelne Qualifikation zu erfüllen. Nicht alle starken Kandidaten erfüllen jede einzelne aufgeführte Qualifikation. Recherchen zeigen, dass Menschen, die sich als Angehörige unterrepräsentierter Gruppen identifizieren, eher unter dem Impostor-Syndrom leiden und an ihrer Kandidatur zweifeln. Daher bitten wir Sie dringend, sich nicht vorzeitig auszuschließen und sich zu bewerben, wenn Sie an dieser Arbeit interessiert sind. Wir glauben, dass KI-Systeme wie die, die wir entwickeln, enorme soziale und ethische Auswirkungen haben. Wir glauben, dass dies die Repräsentation noch wichtiger macht, und wir bemühen uns, eine Vielfalt von Perspektiven in unserem Team zu vereinen.
Ihre Sicherheit ist uns wichtig. Um sich vor möglichen Betrügereien zu schützen, denken Sie daran, dass Anthropic-Recruiter Sie nur von E-Mail-Adressen mit der Endung @anthropic.com kontaktieren. In einigen Fällen arbeiten wir möglicherweise mit geprüften Personalvermittlungsagenturen zusammen, die sich als im Auftrag von Anthropic arbeitend ausweisen. Seien Sie vorsichtig bei E-Mails von anderen Domains. Legitime Anthropic-Recruiter werden Sie niemals vor Ihrem ersten Tag nach Geld, Gebühren oder Bankdaten fragen. Wenn Sie jemals unsicher über eine Kommunikation sind, klicken Sie nicht auf Links – besuchen Sie anthropic.com/careers anthropic.com/careers direkt, um bestätigte Stellenangebote zu finden.
KOMMEN SIE ZU UNS!
Anthropic ist eine Public Benefit Corporation mit Hauptsitz in San Francisco. Wir bieten wettbewerbsfähige Gehälter und Sozialleistungen, optionale Zuordnung von Eigenkapitalspenden, großzügigen Urlaub und Elternurlaub, flexible Arbeitszeiten und einen schönen Büroraum für die Zusammenarbeit mit Kollegen. Leitfaden zur KI-Nutzung durch Kandidaten: Erfahren Sie mehr über unsere Richtlinie anthropic.com/candidate-ai-guidance zur Nutzung von KI in unserem Bewerbungsprozess.
