JFrog
Fractile
Infrastructure Software Engineering – Plattform & Build
Infrastructure Software Engineering – Plattform & Build
Standort: London
Exportkontrollen
Unsere Arbeit beinhaltet Technologien, die britischen, US-amerikanischen und anderen internationalen Exportkontrollvorschriften unterliegen. Bestimmte Rollen erfordern möglicherweise zusätzliche Eignungsprüfungen, um die Einhaltung des geltenden Rechts sicherzustellen. Wir werden während des gesamten Einstellungsprozesses transparent darüber informieren.
Über Fractile
Fractile wurde im Jahr 2022 mit der Wette gegründet, dass die weltweit fähigsten KI-Systeme letztendlich durch die Zeit begrenzt würden, die benötigt wird, um nützliche Ergebnisse zu erzielen. Wir haben alles auf die logische Schlussfolgerung gesetzt: dass der einzige Weg, diesen latenten Wert wirklich freizusetzen und Geschwindigkeit in großem Maßstab rentabel zu machen, darin bestand, die Hardware, auf der wir unsere modernsten KI-Modelle ausführen, radikal neu zu erfinden. Seitdem bauen wir Chips und Systeme, die dieses Problem angehen: Wie können wir effizient Ausgaben mit Tausenden von Tokens pro Sekunde generieren und gleichzeitig die Komplexitäts- und Kapazitätsherausforderungen des Betriebs großer Modelle mit sehr langen Kontexten bewältigen.
Die Workloads, die die Grenzen des aktuellen Stands der Technik ausreizen, sind bereits transformativ; es sind die technischen und wirtschaftlichen Grenzen der Inferenzgeschwindigkeit, die den Fortschritt einschränken. Die bestimmende Arbeit des 21. Jahrhunderts wird durch die Inferenz-Engine gekennzeichnet sein, die immense und diffuse Ketten intellektueller Forschung liefert, in der Medikamentenentwicklung, in der Softwareentwicklung, in der Materialforschung, in jedem Bereich, in dem der Fortschritt durch tiefes Denken und Intelligenz zur Lösung komplexer Probleme angetrieben wird.
Fractile strebt danach, die Taktfrequenz des globalen Fortschritts zu erhöhen, ein Chip nach dem anderen. Wir haben kürzlich 220 Mio. $ von Founders Fund und Accel eingesammelt, und die wichtigste Arbeit liegt noch vor uns. Kommen Sie und schließen Sie sich der Mission an!
Über das Team und die Rolle
Über Sie
Sie bringen tiefgreifende Expertise in Infrastruktur und Build-Systemen sowie eine SRE-Mentalität mit. Sie gehen systematisch bei der Fehlerisolierung und Ursachenanalyse vor und wenden Metriken-gesteuertes Denken an, um Zuverlässigkeit und Entwicklerproduktivität aufzubauen. Sie gedeihen bei Vielfalt (ML, Compiler, Kernel-Treiber, Simulatoren, Hardware-Verifizierung) und verstehen, dass Ihre Arbeit die Grundlage bildet, auf der jeder Ingenieur bei Fractile aufbaut. Sie nehmen diese Verantwortung ernst.
Die Rolle
Als Infrastructure Platform Engineer werden Sie ein Kernbestandteil unseres technischen Teams sein und eng mit den Hardware-, Software- und Forschungsteams zusammenarbeiten, um hochmoderne Probleme in der KI-Hardware zu lösen, von der Verifizierung bis zur Simulation, zusammen mit den Besten der Besten (DeepMind, Apple, Meta…).
Das Infrastructure-Team ist verantwortlich für die Kernplattform und die Systeme bei Fractile. Wir bauen, skalieren und optimieren die geschäftskritischen Systeme, die unsere gesamte Engineering-Organisation antreiben, einschließlich unseres mehrsprachigen Bazel-Monorepos und unserer CI-Pipelines. Von Hardware-Design und Verifizierung über Kernel-Entwicklung bis hin zu ML-Compilern ermöglichen wir allen Ingenieuren von Fractile, schnell und zuverlässig zu liefern.
Das Team bringt sowohl tiefes Fachwissen im Build-System als auch eine SRE-Mentalität mit: Zuverlässigkeit, Build-Performance, systematische Fehlersuche bei CI-Ausfällen und klare Sichtbarkeit für die Engineering-Organisation, wie unsere Infrastruktur performt.
Als Infrastructure Platform Engineer werden Sie:
- Die CI-Infrastruktur End-to-End verantworten: reproduzierbare, mehrsprachige CI-Pipelines erstellen, warten und debuggen sowie die CI-Performance über große Compute-Cluster hinweg optimieren.
- Infrastruktur-Observability, Alerting, Runbooks und Incident-Response-Workflows für die Infrastruktur von Fractile aufbauen und pflegen.
- Unsere Infrastruktur als Code verantworten und die Bereitstellung von Hybrid-Cloud- und On-Premise-Ressourcen aus einer einzigen Quelle der Wahrheit automatisieren.
- Das Bazel-Monorepo von Fractile skalieren und pflegen, während wir weiter wachsen in Python, C++, Rust, SystemVerilog und ML-Workloads.
- Die Infrastruktur- und Plattformerfahrung für jeden Ingenieur bei Fractile gestalten.
Über die Softwareorganisation bei Fractile
Infrastructure ist Teil der Softwareorganisation bei Fractile, die für die Entwicklung eines vollständigen Software-Stacks für unsere bahnbrechenden KI-Inferenzsysteme verantwortlich ist. Das umfasst alles von ML-Compilern, Gerätetreibern und System-Firmware, Laufzeitumgebungen auf Anwendungsebene und Ökosystem-Integrationen, ML- und Rechenbibliotheken, großartigen Entwickler-Tools und einem vollständigen Portfolio von Simulatoren bis hin zu Lösungen für die Bereitstellung von Workloads im Rechenzentrumsmaßstab. Bei Fractile wissen wir, dass ein fantastischer Software-Stack ein kritischer und zentraler Bestandteil jeder KI-Inferenzlösung ist und im Mittelpunkt von allem steht, was wir tun.
Schlüsselanforderungen
- 5+ Jahre Erfahrung in Software-, Plattform- oder Infrastruktur-Engineering
- 5+ Jahre praktische Erfahrung mit CI/CD für Produkte im großen Maßstab, einschließlich Überwachung, Leistungs-Debugging und Behebung von Pipeline-Fehlern im großen Maßstab
- 3+ Jahre Erfahrung mit Build-Systemen, vorzugsweise modernen, sprachübergreifenden Build-Systemen mit Schwerpunkt auf Korrektheit, hoher Leistung und Erweiterbarkeit, wie Bazel, Buck, Pants, Please usw.
- Erfahrung mit Infrastructure as Code (Terraform / OpenTofu oder Pulumi)
- Erfahrung mit Monitoring- und Observability-Tools (Prometheus, Grafana oder ähnlich)
- Praktische Kenntnisse und Anwendung von DevOps / SRE-Prinzipien: SLOs, Alerting-Design, Incident Management und On-Call-Praxis
- Starke Kenntnisse in mindestens einer System- oder Skriptsprache für Tooling (Python bevorzugt; Go oder Rust ebenfalls relevant), mit einer Erfolgsbilanz bei der Bereitstellung gut getesteter, wartbarer Entwickler-Tools, auf die sich andere Ingenieure verlassen: CLIs, CI-Integrationen, Build- und Release-Automatisierung
Was wir bieten
- Wettbewerbsfähiges Gehalt: Ein wettbewerbsfähiges Gehalt, das Ihre Erfahrung und die Spezialisierung der Rolle widerspiegelt
- Equity & Ownership: Bedeutende Beteiligung am Unternehmen, damit alle am Wertzuwachs teilhaben
- Leistungen: Private Kranken-, Zahn- und Augenversicherung, betriebliche Altersvorsorge, 25 Tage Urlaub plus Feiertage und Lebens-/Berufsunfähigkeitsversicherung
- Vielfältiges und unterhaltsames Büro: Wir glauben, dass die schwierigsten Probleme von den breitesten Köpfen gelöst werden. Wir verpflichten uns zur Chancengleichheit durch die Gewinnung und Bindung eines vielfältigen Teams und den Aufbau einer integrativen Umgebung
