Nominal
Figure
Staff Engineer für KI-Inferenz und Beschleunigung
Über die Stelle
Figure ist ein KI-Robotikunternehmen, das autonome Allzweck-Humanoide Roboter entwickelt. Ziel des Unternehmens ist es, Humanoide Roboter mit menschenähnlicher Intelligenz auszuliefern. Seine Roboter sind dafür konstruiert, eine Vielzahl von Aufgaben im häuslichen und kommerziellen Markt zu erfüllen.
Figure hat seinen Hauptsitz in San Jose, CA.
Wir suchen einen Staff AI Inference & Acceleration Engineer für das Platform Software Team, der die On-Board-Inferenzarchitektur für die Humanoide Roboter von Figure verantwortet. Sie werden die technische Autorität dafür sein, wie KI-Workloads auf der Computerhardware des Roboters abgebildet, optimiert und ausgeführt werden – und dabei den Stromverbrauch und die Kosten senken, während die strengen Latenz- und Zuverlässigkeitsanforderungen eines autonomen Echtzeitsystems erfüllt werden.
Aufgaben
- Verantwortung für die On-Board-Inferenzarchitektur – Abbildung von Modellen auf verfügbare Beschleuniger (NPU, GPU, DSP, CPU) basierend auf Latenz-, Stromverbrauchs- und Speicherbudgets.
- Aufteilung von Inferenz-Workloads über heterogene Computerressourcen, wobei die Echtzeit-Performance mit Stromverbrauchs- und thermischen Einschränkungen in Einklang gebracht wird.
- Definition und Pflege eines systemweiten Computerbudgets für alle auf dem Roboter laufenden Inferenzaufgaben.
- Bewertung von Beschleuniger-Hardware der nächsten Generation und Beitrag zur Definition zukünftiger Anforderungen an die Computerplattform.
- End-to-End-Optimierung von Inferenz-Toolchains – vom Modell-Export bis zur Laufzeitausführung – für die Zielhardware.
- Anwendung von Quantisierung (INT8, INT4, Mixed-Precision), Pruning, Operator Fusion und anderen Kompressionstechniken zur Reduzierung des Rechen-, Speicher- und Stromverbrauchs.
- Profiling von Inferenz-Pipelines zur Identifizierung und Beseitigung von Engpässen bei Latenz, Speicherbandbreite und Stromverbrauch.
- Optimierung von Kernel-Scheduling, Speicherlayout und Datenbewegungen über die Computerhierarchie hinweg.
- Enge Zusammenarbeit mit dem KI/ML-Team zur Definition von Modellarchitektur-Beschränkungen, die von Anfang an hardwarefreundlich sind.
- Zusammenarbeit mit dem Platform Software Team bei Laufzeitintegration, Scheduling und Energiemanagement.
- Austausch mit Halbleiterherstellern und Forschungsteams, um die Landschaft der Beschleuniger zu verfolgen und Hardware-Roadmaps zu beeinflussen.
Anforderungen
- M.S. oder Ph.D. in Computer Engineering, Electrical Engineering, Computer Science oder einem verwandten Fachgebiet – oder gleichwertige Branchenerfahrung.
- Mindestens 8 Jahre Berufserfahrung in den Bereichen Hardwarebeschleunigung, ML-Systeme oder Computerarchitektur.
- Tiefes Verständnis von KI/ML-Inferenz – Modellformate (ONNX, TFLite, etc.), Inferenz-Runtimes und Deployment-Pipelines.
- Praktische Erfahrung in der Optimierung von Modellen für Edge- oder Embedded-Hardware unter Verwendung von Quantisierung, Pruning und Tuning auf Operator-Ebene.
- Starkes Verständnis der Computerarchitektur – Speicherhierarchien, Datenbewegungen und heterogene Berechnungen.
- Erfahrung im Profiling und Benchmarking von Inferenz-Workloads über CPU, GPU, NPU, DSP.
- Vertrautheit mit Low-Level-Toolchains und Kompilierungsframeworks (z. B. TVM, MLIR, TensorRT, Torch, SNPE/QNN, JAX, CUDA, ROCm).
- Solide Software-Engineering-Kenntnisse in C++ und Python.
- Starke funktionsübergreifende Kommunikationsfähigkeiten – Fähigkeit zur effektiven Zusammenarbeit mit Hardware-, Software- und KI/ML-Teams.
Bonusqualifikationen
- Kenntnisse von Echtzeit-Betriebseinschränkungen und deren Auswirkungen auf die Inferenzplanung.
- Nachgewiesene Erfolgsbilanz bei der Mitgestaltung von Modellarchitekturen mit ML-Teams zur Erfüllung von Hardware-Beschränkungen.
Die Gehaltsspanne für diese Vollzeitstelle liegt in den USA bei $180,000 - $275,000 jährlich.
Die für diese Position angebotene Vergütung kann je nach mehreren individuellen Faktoren variieren, einschließlich berufsbezogenem Wissen, Fähigkeiten und Erfahrung. Das gesamte Vergütungspaket kann je nach spezifischer Rolle auch zusätzliche Komponenten/Leistungen umfassen. Diese Informationen werden weitergegeben, wenn ein Stellenangebot unterbreitet wird.
