NOS
Bjak
Machine Learning Platform Engineer
Über ActAI
Es gibt heute über 5 Milliarden Nutzer, die grundlegende Anwendungen wie E-Mail, Notizen, Aufgaben und Kalender verwenden, die nicht KI-nativ sind. Unsere Mission ist es, proaktive Anwendungen für jeden auf der Welt zu entwickeln, der keine komplexen Prompts gewohnt ist. Wir wollen Intelligenz in Gespräche, Erledigungen, Organisation und Arbeitsabläufe bringen, mit minimalem bis gar keinem Prompting.
Unser Produkt konzentriert sich auf die Erzielung hoher Zuverlässigkeit für langlaufende Workflows, persistenten Kontext und die Erledigung realer Aufgaben. Wir glauben, dass Produkte Halluzinationen stark reduzieren werden.
Unser Ziel ist es, das Leben jedes Einzelnen zu organisieren, damit wir alle Zeit für wertvolle und bedeutungsvolle Dinge haben.
Über die Rolle
Als ML Platform Engineer bauen Sie die Infrastruktur und Systeme, die die KI-Fähigkeiten von ActAI antreiben.
Schwerpunkte
Sie entwerfen und betreiben die Systeme hinter dem KI-Stack, vom Modelltraining und der -bewertung bis hin zu Deployment, Inferenz, Beobachtbarkeit und kontinuierlicher Verbesserung.
Sie arbeiten eng mit KI-Ingenieuren, Forschern und Produktentwicklern zusammen, um Modelle in zuverlässige, skalierbare und kosteneffiziente Produktionssysteme zu verwandeln. Sie bauen die Plattformen, Tools und Infrastrukturen, die es dem Team ermöglichen, schnell zu experimentieren und KI-Fähigkeiten mit Zuversicht in die Produktion zu bringen.
- Aufbau und Betrieb der ML-Infrastruktur und -Plattformen, die die KI-Produkte von A1 antreiben
- Entwurf von Systemen für Modelltraining, -bewertung, -deployment, -inferencing und -experimente
- Aufbau und Optimierung von Model Serving- und Inferenzinfrastrukturen für Workloads mit hohem Durchsatz und geringer Latenz
- Verbesserung der Zuverlässigkeit, Skalierbarkeit, Latenz und Kosteneffizienz von KI-Systemen
- Entwicklung zuverlässiger Pipelines für Datenaufbereitung, Training, Bewertung, Modellfreigabe und kontinuierliche Verbesserung
- Aufbau von Plattformen und Tools, die es KI-Ingenieuren und Forschern ermöglichen, Modelle schneller zu experimentieren, zu bewerten und auszuliefern
- Entwicklung von Bewertungs- und Benchmark-Infrastrukturen zur Messung von Modellqualität, Leistung und Regressionen
- Aufbau von Produktions-Observability, Monitoring, Tracing und Alerting für KI/ML-Workloads
- Verbesserung von KI-Systemen in Bezug auf Zuverlässigkeit, Skalierbarkeit, Latenz, Durchsatz und Kosten
- Identifizierung von Engpässen im gesamten ML-Stack und kontinuierliche Verbesserung der Systemleistung
- Enge Zusammenarbeit mit KI-Ingenieuren, Forschern und Produktteams, um sich entwickelnde Modellanforderungen in produktionsreife Infrastrukturen umzusetzen
Technologie-Stack
- Python
- PyTorch / JAX
- LLM und ML Serving-Infrastrukturen wie vLLM, SGLang oder TensorRT-LLM
- Cloud-Infrastruktur
- Verteilte Systeme
- ML/Daten-Pipelines und Workflow-Orchestrierung
- GPU-Infrastruktur und Performance-Tools
- Vektordatenbanken und Retrieval-Infrastruktur
Ideale Erfahrung
- Starke Grundlagen in Software Engineering und Erfahrung im Aufbau von Produktionssystemen
- Erfahrung im Aufbau von ML-Infrastrukturen, -Plattformen oder produktiven machine learning-Systemen
- Erfahrung mit Model Deployment, Inferenz, Bewertung oder Daten-Pipelines
- Starkes Verständnis von verteilten Systemen und Systemzuverlässigkeit
- Fähigkeit, sauberen, wartbaren Code in Produktionsqualität zu schreiben
- Komfortable Arbeit in mehrdeutigen, sich schnell entwickelnden Umgebungen
- Tendenz zu Ownership, Experimentierfreude und kontinuierlicher Verbesserung
Ergebnisse
- KI-Infrastruktur unterstützt Produktions-Workloads zuverlässig im großen Maßstab
- Modelle können effizient trainiert, bewertet, bereitgestellt und verbessert werden
- Inferenzsysteme liefern starke Latenz-, Durchsatz-, Zuverlässigkeits- und Kosteneffizienz
- ML-Pipelines sind reproduzierbar, beobachtbar, wartbar und robust
- Modell- und Infrastruktur-Regressionen werden schnell erkannt und effizient diagnostiziert
- Gemeinsame ML-Infrastrukturfähigkeiten werden zu wiederverwendbaren Plattform-Primitiven, anstatt für jedes KI-Produkt neu erstellt zu werden
- Der KI-Stack kann sich schnell weiterentwickeln, wenn neue Modelle, Architekturen und Inferenztechniken aufkommen
