Lightning AI

Infrastructure Engineer (Storage)

Python
Automatische Übersetzung. Prüfe das Original.

WER WIR SIND

Lightning AI ist das Unternehmen hinter PyTorch Lightning. Gegründet im Jahr 2019, entwickeln wir eine End-to-End-Plattform für die Entwicklung, das Training und die Bereitstellung von KI-Systemen – konzipiert, um Ideen mit weniger Reibungsverlusten von der Forschung in die Produktion zu bringen. Durch unsere Fusion mit Voltage Park, einem Neocloud und einer KI-Fabrik, kombiniert Lightning AI Entwickler-Software mit kosteneffizienter, skalierbarer Rechenleistung. Teams erhalten die Werkzeuge, die sie für Experimente, Training und Produktions-Inferenz benötigen, mit integrierter Sicherheit, Beobachtbarkeit und Kontrolle. Wir bedienen einzelne Forscher, Start-ups und große Unternehmen. Lightning AI operiert weltweit mit Büros in New York City, San Francisco, Seattle und London und wird von Coatue, Index Ventures, Bain Capital Ventures und Firstminute unterstützt.

WIE WIR ARBEITEN

Die Menschen, die hier erfolgreich sind, sind Macher, die schnell handeln, offen kommunizieren, Verantwortung übernehmen und sich selbst, ihre Teams und unser Unternehmen kontinuierlich verbessern. So sieht das in der Praxis aus:

  • Mit Dringlichkeit handeln: Wir agieren schnell, treffen durchdachte Entscheidungen und halten den Schwung aufrecht. Wir schätzen Handeln mehr als Perfektion und lernen durch Veröffentlichen.
  • Verantwortung übernehmen: Wir sind für die Ergebnisse verantwortlich, nicht nur für unsere individuelle Arbeit. Wir treffen Entscheidungen, die das Unternehmen voranbringen, und setzen sie um.
  • Offen kommunizieren: Wir kommunizieren direkt, bemühen uns um Verständnis und schaffen Klarheit für andere. Ehrliche Gespräche helfen uns, gemeinsam schneller voranzukommen.
  • Großartige Teams aufbauen: Wir gehen mit gutem Beispiel voran, befähigen andere und schaffen gesunde Teams, in denen Menschen ihre beste Arbeit leisten können.
  • Den Standard erhöhen: Wir verbessern uns ständig. Wir lernen aus Feedback, fordern uns konsequent heraus, uns weiterzuentwickeln, und konzentrieren uns auf die Arbeit, die am wichtigsten ist.
  • Langfristig denken: Wir gestalten für das, was als Nächstes kommt. Wir schaffen skalierbare Systeme, vereinfachen Komplexität und nutzen KI und Automatisierung, um unsere Wirkung zu verstärken.

WAS WIR SUCHEN

Lightning AI sucht einen Storage Infrastructure Engineer, der unser Infrastructure Engineering Team verstärkt.

WAS SIE TUN WERDEN

In dieser Rolle konzentrieren Sie sich auf den Aufbau und Betrieb der Speichersysteme, die groß angelegte KI/ML-Trainings-, Inferenz- und HPC-Workloads ermöglichen. Sie arbeiten an der Schnittstelle von Software, Hardware und Betrieb – entwickeln Automatisierung, verbessern die Zuverlässigkeit und skalieren verteilte Speichersysteme über unsere Bare-Metal-Infrastruktur.

Sie werden eine Schlüsselrolle bei der Verwaltung der Datenebene unserer Speicherinfrastruktur übernehmen und hochdurchsatzstarken, latenzarmen Datenzugriff für einige der anspruchsvollsten KI-Workloads unterstützen. Sie werden eine Schlüsselrolle bei der Verwaltung und Weiterentwicklung unseres Speicher-Stacks (einschließlich VAST und S3-kompatibler Systeme wie Ceph) spielen und Leistung, Zuverlässigkeit und Effizienz in großem Maßstab gewährleisten.

SPEICHERSYSTEME & INFRASTRUKTUR

  1. Betrieb und Skalierung verteilter Speichersysteme, einschließlich VAST und S3-kompatiblem Objektspeicher (z. B. Ceph)
  1. Verbesserung von Leistung, Zuverlässigkeit und Effizienz von Speichersystemen, die groß angelegte KI/ML-Workloads unterstützen
  1. Fehlerbehebung bei komplexen Speicher- und Datenpfadproblemen über Hardware- und Software-Ebenen hinweg
  1. Optimierung der Speicherleistung zur Unterstützung von High-Throughput-, Low-Latency-KI-Trainings- und Inferenz-Workloads

AUTOMATISIERUNG & TOOLING

  1. Aufbau und Wartung von Automatisierung für die Bereitstellung, Verwaltung und Überwachung der Speicherinfrastruktur
  1. Entwicklung von Python-basierten Tools und Workflows zur Reduzierung manueller operativer Aufwände
  1. Verbesserung des Lebenszyklusmanagements von Speicherclustern, von der Bereitstellung über die Wartung bis zur Skalierung

SYSTEME & BETRIEB

  1. Verwaltung und Betrieb von Linux-basierten Systemen in der Produktion, einschließlich Bare-Metal-Umgebungen
  1. Zusammenarbeit mit Infrastruktur- und Rechenzentrums-Teams bei Hardware-Inbetriebnahme, Upgrades und Fehlerbehebung
  1. Unterstützung der Kapazitätsplanung, Auslastungsverfolgung und Prognose für Speichersysteme
  1. Nutzung von Überwachung und Telemetrie zur Diagnose von Problemen und zur Verbesserung der Systemleistung und Zuverlässigkeit

FUNKTIONSÜBERGREIFENDE ZUSAMMENARBEIT

  1. Enge Zusammenarbeit mit Infrastructure Engineering, Network Engineering und Platform Teams zur Integration von Speicher in die breitere Plattform
  1. Beitrag zu Design-Diskussionen über neue Infrastruktur-Bereitstellungen und Skalierungsstrategien
  1. Mitgestaltung von Best Practices für den Betrieb von Speichersystemen in High-Performance-Computing-Umgebungen

Diese Position kann vollständig remote innerhalb der USA oder hybrid von einem unserer Büro-Hubs (NYC, SF, Seattle oder London) aus besetzt werden, mit gelegentlichen Team- und Firmen-Offsites. Wir können derzeit kein Visum-Sponsoring für diese Position anbieten.

Bei Lightning AI verpflichten wir uns, ein integratives und vielfältiges Arbeitsumfeld zu fördern. Wir glauben, dass vielfältige Teams Innovationen vorantreiben und bessere Produkte schaffen. Wir bieten allen Mitarbeitern und Bewerbern gleiche Beschäftigungsmöglichkeiten, unabhängig von Rasse, Hautfarbe, Religion, Geschlecht, sexueller Orientierung, Geschlechtsidentität, nationaler Herkunft, Alter, Behinderung, Veteranenstatus oder anderen geschützten Merkmalen. Wir sind bestrebt, eine Kultur aufzubauen, in der jeder erfolgreich sein und sein volles Potenzial entfalten kann.

WAS SIE MITBRINGEN

ERFORDERLICHE QUALIFIKATIONEN

  1. 5+ Jahre Erfahrung im Infrastruktur-Engineering, System-Engineering oder verwandten Bereichen
  1. Praktische Erfahrung im Betrieb verteilter Speichersysteme (z. B. VAST, Ceph oder ähnliche)
  1. Fundierte Linux-Systemerfahrung in Produktionsumgebungen
  1. Beherrschung von Python oder ähnlichen Skript-/Programmiersprachen für die Automatisierung
  1. Erfahrung mit Bare-Metal-Infrastruktur und hardwareorientierten Systemen
  1. Fähigkeit zur Fehlersuche bei komplexen Problemen über Systemgrenzen hinweg (Speicher, Betriebssystem, Hardware, Netzwerk)
  1. Erfahrung mit Speicher-Netzwerkprotokollen (z. B. NFS oder ähnliche)
  1. Erfahrung mit Kapazitätsplanung, Überwachung und Leistungsoptimierung

IDEALE ERFAHRUNG

  1. Erfahrung mit VAST-Speichersystemen in Produktionsumgebungen
  1. Erfahrung im Betrieb von S3-kompatiblem Objektspeicher in großem Maßstab
  1. Erfahrung im Rechenzentrumsbetrieb, einschließlich der Arbeit mit physischer Hardware
  1. Vertrautheit mit KI/ML- oder HPC-Workloads und deren Speicheranforderungen
  1. Hintergrund in Hochleistungs- oder Low-Latency-verteilten Systemen
  1. Vertrautheit mit Hochleistungs-Datentransfertechnologien (z. B. RDMA, GPU Direct Storage)
  1. Erfahrung in der Unterstützung von GPU-basierten Workloads oder groß angelegten Rechenclustern

VERGÜTUNG

Wir sind bestrebt, eine wettbewerbsfähige Vergütung anzubieten, die den Wert widerspiegelt, den jedes Teammitglied in unsere Mission einbringt. Die endgültigen Angebote basieren auf Faktoren wie Erfahrung, Fähigkeiten, geografischem Standort und Rollenerwartungen. Zusätzlich zum Grundgehalt umfasst unser Gesamtvergütungspaket für berechtigte Rollen einen diskretionären Bonus, eine aussagekräftige Aktienkomponente und umfassende Leistungen.

Die voraussichtliche jährliche Gehaltsspanne für diese Position beträgt: $180,000—$220,000 USD

LEISTUNGEN UND VORTEILE

Wir bieten ein umfassendes und wettbewerbsfähiges Leistungspaket, das darauf ausgelegt ist, die Gesundheit, das Wohlbefinden und den langfristigen Erfolg unserer Mitarbeiter zu unterstützen:

  • Umfassende Gesundheitsabdeckung: Kranken-, Zahn- und Sehversicherung für Mitarbeiter und berechtigte Angehörige.
  • Bedeutende Aktienoptionen: RSUs, die den Mitarbeitern eine Beteiligung am langfristigen Unternehmenserfolg ermöglichen.
  • Altersvorsorge: 401(k)-Zuschuss (USA) und Rentenbeiträge (UK).
  • Flexible Urlaubszeit: Unbegrenzte PTO, Feiertage und Gleittage zur Unterstützung der Work-Life-Balance.
  • Unternehmensweiter Winterurlaub: Zwei Wochen Betriebsruhe über den Winter, um abzuschalten und sich zu erholen.
  • Bezahlter Eltern- und Familienurlaub: Bezahlter Urlaub zur Unterstützung von Ihnen und Ihrer Familie in wichtigen Lebensmomenten.
  • Berufliche Weiterentwicklung: Jährliches Budget für Lern- und Entwicklungsmaßnahmen zur Unterstützung Ihres beruflichen Wachstums.
  • Wellness-Leistungen: Zuschüsse für Wellness und Homeoffice zur Unterstützung Ihres körperlichen und geistigen Wohlbefindens.
  • Sabbatical-Programm: Vier Wochen bezahlter Sabbatical-Urlaub nach vier Dienstjahren.
  • Flexibles Arbeiten: Flexible Arbeitszeiten und ein hybrides Arbeitsmodell für unsere Büroteams.
  • Mahlzeiten im Büro: Kostenlose Mahlzeiten in unseren Büro-Hubs.

Leistungen können je nach Standort, Team und Rolle variieren.

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026