Roku
Minerva
Data Scientist
Über uns
Minerva Minerva entwickelt KI für Marketingleiter. Unsere Plattform ermöglicht es Marketern, sich auf die Erzählung der Geschichte ihrer Marke zu konzentrieren, indem sie operativ intensive Aufgaben an unsere KI-Agenten delegieren, die Datenverwaltung, Analysen, Kampagnengenerierung, Messung und Berichterstattung übernehmen.
Alles basiert auf dem proprietären Consumer Graph von Minerva, einer Identitäts- und Attributschicht, die über 270 Mio. US-Verbraucher mit über 1,000 temporalen Attributen abdeckt. Wir haben zwei agentische Systeme, die in Partnerschaft mit OpenAI entwickelt wurden: einen Agentic Data Engineer, der die First-Party-Daten einer Marke in Stunden vereinheitlicht und standardisiert, und einen Agentic Data Scientist, der robuste Targeting-Modelle in großem Maßstab trainiert. Zusammen verbessern diese Systeme die Qualität von First-Party-Daten, steigern die Kampagnenleistung und geben Marketingteams ihre Zeit zurück.
Zu unseren Kunden gehören führende Konsumgütermarken aus verschiedenen Kategorien: die NBA, Ramp, Capital One, Hard Rock Stadium Group / Miami Dolphins, Wander und Trust & Will.
Wir haben 20 Mio. US-Dollar von The General Partnership, 8VC, Lingotto, NBA Investments, Topology Ventures, Future Positive, Background Capital und anderen eingesammelt.
Über die Rolle
Als Data Scientist bei Minerva entwickeln Sie die Modelle und Features, die unseren Consumer Graph und die darauf laufenden Agenten antreiben. Sie befinden sich an der Schnittstelle von intensivem Data Engineering und angewandter Modellierung: Sie entwerfen Feature-Engineering-Pipelines, die über Terabytes von Daten berechnet werden, trainieren und schärfen die Modelle, die Targeting und Vorhersage steuern, und stellen sicher, dass die Ergebnisse robust genug sind, um autonom von unseren Minerva Agents und unseren erstklassigen modellierten Attributen (d. h. Einkommen/Vermögen) konsumiert zu werden.
Dies ist eine Rolle, die ständig in die Produktion überführt wird. Die von Ihnen entwickelten Modelle werden nicht an jemand anderen zur Bereitstellung übergeben, Sie verantworten den Weg von Rohdaten zu einem Feature oder Modell, das ein Agent zuverlässig in großem Maßstab aufrufen kann. Mit unserem Wachstum wird Ihre Arbeit zur Grundlage, auf der andere Systeme aufgebaut werden.
Was Sie tun werden
- Erstellen Sie neue Features für Modelle und Agenten, erweitern Sie die prädiktive Oberfläche unseres Consumer Data Lakes und bauen Sie die Pipelines, die Rohsignale in vertrauenswürdige Attribute verwandeln.
- Verbessern Sie bestehende Modelle durch rigoroses Feature Engineering, einschließlich unserer Modelle für Einkommen/Vermögen, Hauskäufer und Hausverkäufer.
- Spielen Sie eine Schlüsselrolle beim Aufbau unseres erstklassigen Data Lakes und gestalten Sie, wie Terabytes von Konsumentendaten gespeichert, transformiert und sowohl für Menschen als auch für Agenten abfragbar gemacht werden.
- Erstellen Sie Feature-Engineering-Pipelines, die im Terabyte-Maßstab effizient laufen, mit der Data-Engineering-Rigorosität, um sie in der Produktion zuverlässig zu machen. Dies ist eine 70/30 geteilte DS/DE-Rolle.
- Stellen Sie sicher, dass Modell- und Feature-Ausgaben zuverlässig genug sind, um agentisch konsumiert zu werden, und schreiben Sie die Validierungen und Schutzmaßnahmen, die es unseren Agenten ermöglichen, auf Ihrer Arbeit ohne menschliches Eingreifen zu agieren.
Unser Daten-Stack
- Dagster für alle Orchestrierungsaufgaben
- dbt-core innerhalb von Dagster als primäre Datentransformationsfläche
- Spark, Iceberg, Trino, AWS Glue für Lakehouse-Workloads
- Modal für ML-Engineering
- Frontier + OSS-Modelle & Agent SDKs. Wir sind intensive Nutzer von OpenAI/Anthropic Batch APIs.
Qualifikationen
- 2-4+ Jahre Berufserfahrung als Data Scientist, angewandter machine learning-fokussierter Data Engineer oder Software Engineer in einem datenintensiven Umfeld. Einfach ausgedrückt: Sie leben und atmen Daten.
- Sehr gute Kenntnisse in Python und SQL.
- Sie sind von First-Principles-Denken geprägt und ein Macher. Sie überlegen, welche Datensätze und Features zur Lösung eines Modellierungsproblems notwendig sind, und sind findig und clever genug, um diese umzusetzen.
- Starkes Gespür für Data-Engineering-Prinzipien, insbesondere in Bezug auf Datenbereinigung/-aufnahme und Datenmodellierung. Wir bevorzugen es, wenn diese Kernkompetenzen selbstverständlich sind, um den Kopf für die Architektur und Umsetzung von groß angelegten Dateninitiativen freizuhalten, insbesondere angesichts der Fortschritte bei KI-Codierungswerkzeugen.
- Starker technischer Hintergrund. Sie sind mit der Bereitstellung komplexer Produktions-Pipelines und der Arbeit innerhalb größerer Produktionssysteme vertraut, nicht nur in Sandbox- oder Forschungsumgebungen.
- Bereitschaft zur Arbeit im Büro in NYC (wir bieten ein Relocation-Paket).
- Flexibilität und Offenheit, mehrere Hüte zu tragen. Wir sind schlank aufgestellt und die Dinge ändern sich ständig.
- Lernbereitschaft und Wachstum mit dem Unternehmen und Ihren Kollegen.
Bevorzugt
- Erfahrung im Aufbau und Training von prädiktiven Modellen (z. B. Lead Scoring, LTV, Propensity, Lookalike Modeling).
- Erfahrung mit Orchestrierungstools wie Dagster, Airflow, Prefect und SQL-Transformationstools wie dbt, SQLMesh.
- Erfahrung mit transaktionalen Datenbanken (z. B. Postgres, MySQL) und analytischen Datenbanken (z. B. Snowflake, Redshift), mit einer Präferenz für letztere.
- Vertrautheit mit einem Cloud-Ressourcenanbieter (z. B. AWS, GCP).
- Vertrautheit mit backend und ML/AI-Engineering.
- Erfahrung mit KI-Codierungswerkzeugen (z. B. Cursor, Claude Code, OpenCode) als Multiplikator.
- Frühere Tätigkeit in einem Startup in der Frühphase.
Sie müssen nicht alle Kriterien erfüllen. Wenn Sie im technischen Bereich stark sind und unbedingt Modelle entwickeln möchten, die etwas bewirken, möchten wir von Ihnen hören.
Leistungen
Grundgehalt: $200,000 bis $225,000, je nach Erfahrung. Wettbewerbsfähige Aktienoptionen und ein erstklassiges Leistungspaket.
