ComTec Solutions LLC
Lightning AI
Senior Infrastructure Operations Engineer
WER WIR SIND
Lightning AI ist das Unternehmen hinter PyTorch Lightning. Gegründet im Jahr 2019, entwickeln wir eine End-to-End-Plattform für die Entwicklung, das Training und die Bereitstellung von KI-Systemen – konzipiert, um Ideen mit weniger Reibungsverlusten von der Forschung in die Produktion zu bringen.
Durch unsere Fusion mit Voltage Park, einem Neocloud und einer KI-Fabrik, kombiniert Lightning AI Entwickler-zentrierte Software mit kosteneffizientem, skalierbarem Computing. Teams erhalten die Werkzeuge, die sie für Experimente, Training und Produktions-Inferenz benötigen, mit integrierter Sicherheit, Beobachtbarkeit und Kontrolle.
Wir bedienen Einzel-Forscher, Start-ups und große Unternehmen. Lightning AI operiert weltweit mit Büros in New York City, San Francisco, Seattle und London und wird von Coatue, Index Ventures, Bain Capital Ventures und Firstminute unterstützt.
DIE ART UND WEISE, WIE WIR ARBEITEN
Die Menschen, die hier erfolgreich sind, sind Macher, die schnell handeln, offen kommunizieren, Verantwortung übernehmen und sich selbst, ihre Teams und unser Unternehmen kontinuierlich verbessern. So sieht das in der Praxis aus: *
- Mit Dringlichkeit handeln: Wir bewegen uns schnell, treffen durchdachte Entscheidungen und halten den Schwung aufrecht. Wir schätzen Handeln mehr als Perfektion und lernen durch Veröffentlichen. *
- Verantwortung übernehmen: Wir tragen die Verantwortung für Ergebnisse, nicht nur für unsere individuelle Arbeit. Wir treffen Entscheidungen, die das Unternehmen voranbringen, und setzen sie um. *
- Offen kommunizieren: Wir kommunizieren direkt, bemühen uns um Verständnis und schaffen Klarheit für andere. Ehrliche Gespräche helfen uns, gemeinsam schneller voranzukommen. *
- Großartige Teams aufbauen: Wir gehen mit gutem Beispiel voran, befähigen andere und schaffen gesunde Teams, in denen Menschen ihre beste Arbeit leisten können. *
- Den Standard erhöhen: Wir verbessern uns ständig. Wir lernen aus Feedback, fordern uns konsequent heraus, uns weiterzuentwickeln, und konzentrieren uns auf die Arbeit, die am wichtigsten ist. *
- Langfristig denken: Wir gestalten für das, was als Nächstes kommt. Wir entwickeln skalierbare Systeme, vereinfachen Komplexität und nutzen KI und Automatisierung, um unsere Wirkung zu verstärken.
WAS WIR SUCHEN
Lightning AI sucht einen erfahrenen Senior Infrastructure Operations Engineer, der uns hilft, die Infrastruktur hinter einer der weltweit größten GPU-Flotten zu betreiben und zu skalieren.
Unser Infrastructure Operations Team steht im Zentrum der Produktionszuverlässigkeit für die KI-Infrastruktur von Lightning. Das Team arbeitet mit Linux, Bare-Metal-Servern, GPUs, Netzwerken, Speicher, Provisionierung und Cluster-Orchestrierung und dient als kritischer technischer Eskalationspunkt bei komplexen Infrastrukturproblemen.
Dies ist keine traditionelle Systemadministrations- oder Ticket-gesteuerte Betriebsposition. Sie werden Probleme im gesamten Infrastruktur-Stack beheben, Probleme bis zur Lösung verfolgen und Möglichkeiten zur Automatisierung wiederkehrender Arbeiten identifizieren. Sie werden auch zu längerfristigen Engineering-Projekten beitragen, die die Zuverlässigkeit verbessern, den Betrieb standardisieren und es unserer Infrastruktur ermöglichen, effizient zu skalieren.
Wir suchen einen Infrastruktur-Generalisten, der sich wohlfühlt, wenn etwas kaputt geht, aber auch zurücktreten und fragen kann, wie wir dasselbe Problem verhindern können.
Diese Position kann vollständig remote innerhalb der USA oder hybrid von einem unserer US-Büro-Hubs (NYC, SF oder Seattle) mit gelegentlichen Team- und Firmen-Offsites besetzt werden. Wir können derzeit kein Visum-Sponsoring für diese Position anbieten.
WAS SIE TUN WERDEN *
- Betrieb und Fehlerbehebung von groß angelegter GPU- und Bare-Metal-Infrastruktur über Linux, Computing, Netzwerke, Speicher und Cluster-Orchestrierung. *
- Als technischer Eskalationspunkt für komplexe Infrastrukturprobleme fungieren und Probleme von der anfänglichen Untersuchung bis zur Lösung und Ursachenanalyse verfolgen. *
- Betriebsabläufe über den gesamten Infrastruktur-Lebenszyklus hinweg verantworten, einschließlich Provisionierung, Konfiguration, Validierung, Wartung, Behebung und Stilllegung. *
- Automatisierungs- und interne Tools entwickeln, die repetitive operative Arbeiten eliminieren und es der Infrastrukturflotte ermöglichen, effizient zu skalieren. *
- Wiederkehrende Ausfallmodi identifizieren und mit dem Infrastructure Engineering zusammenarbeiten, um zuverlässigere, wiederholbare und automatisierte Systeme zu entwickeln. *
- Provisionierung, Überwachung, Diagnose und operative Prozesse über eine schnell wachsende Infrastruktur-Basis verbessern. *
- Eng mit Infrastructure Engineering, Network Engineering, Data Center Operations, Customer Experience und Platform Engineering zusammenarbeiten, um Probleme zu lösen, die Team- oder Systemgrenzen überschreiten. *
- An einer verteilten Primär-/Sekundär-On-Call-Rotation zur Unterstützung der Produktionsinfrastruktur teilnehmen.
WAS SIE MITBRINGEN SOLLTEN
ERFORDERLICHE QUALIFIKATIONEN *
- Umfangreiche Erfahrung im Betrieb und in der Fehlerbehebung von Linux-basierter Produktionsinfrastruktur im großen Maßstab. *
- Erfahrung in der Fehlerbehebung komplexer Infrastrukturprobleme über Computing, Netzwerke, Speicher und Betriebssysteme hinweg. *
- Starke Automatisierungs- und Skripting-Fähigkeiten mit Python, Go, Bash, Ansible oder ähnlichen Werkzeugen. *
- Erfahrung mit Kubernetes, Slurm oder anderen Cluster- und Workload-Orchestrierungssystemen. *
- Erfahrung mit Überwachungs-, Beobachtbarkeits- und Telemetriesystemen zur Diagnose und Fehlerbehebung von Produktionsinfrastruktur. *
- Starke System- und Netzwerk-Grundlagen mit einer Erfolgsbilanz bei der Behebung von Produktionsproblemen bis zur Lösung. *
- Komfort in mehrdeutigen Umgebungen und Zusammenarbeit mit Engineering-, Betriebs- und kundenorientierten Teams.
BONUSPUNKTE *
- Erfahrung in der Fehlerbehebung, Provisionierung oder im Betrieb von Bare-Metal-Server-Infrastruktur. *
- Erfahrung im Betrieb oder in der Fehlerbehebung von GPU-, HPC- oder anderer Hochleistungs-Computing-Infrastruktur. *
- Vertrautheit mit NVIDIA GPUs, DCGM, InfiniBand, RoCE/RDMA, NVLink oder Hochgeschwindigkeits-Rechenzentrumsnetzwerken. *
- Erfahrung mit Hardware-Management- und Provisionierungs-Technologien wie PXE, BMC, IPMI, Redfish oder iDRAC. *
- Erfahrung mit verteilten oder Hochleistungs-Speichersystemen wie VAST, Ceph, GPFS oder WEKA. *
- Erfahrung mit Infrastructure-as-Code, Konfigurationsmanagement oder GitOps-Workflows.
VERGÜTUNG
Wir sind bestrebt, eine wettbewerbsfähige Vergütung anzubieten, die den Wert widerspiegelt, den jedes Teammitglied in unsere Mission einbringt. Endgültige Angebote basieren auf Faktoren wie Erfahrung, Fähigkeiten, geografischem Standort und Rollenerwartungen. Zusätzlich zum Grundgehalt umfasst unser Gesamtvergütungspaket für berechtigte Rollen einen diskretionären Bonus, eine bedeutende Aktienkomponente und umfassende Leistungen.
Die voraussichtliche jährliche Grundgehaltsspanne für diese Rolle beträgt: $175,000—$200,000 USD
Bei Lightning AI verpflichten wir uns, ein integratives und vielfältiges Arbeitsumfeld zu fördern. Wir glauben, dass vielfältige Teams Innovationen vorantreiben und bessere Produkte schaffen. Wir bieten allen Mitarbeitern und Bewerbern gleiche Beschäftigungsmöglichkeiten, unabhängig von Rasse, Hautfarbe, Religion, Geschlecht, sexueller Orientierung, Geschlechtsidentität, nationaler Herkunft, Alter, Behinderung, Veteranenstatus oder anderen geschützten Merkmalen. Wir sind bestrebt, eine Kultur aufzubauen, in der jeder gedeihen und sein volles Potenzial entfalten kann.
LEISTUNGEN UND VORTEILE
Wir bieten ein umfassendes und wettbewerbsfähiges Leistungspaket, das darauf ausgelegt ist, die Gesundheit, das Wohlbefinden und den langfristigen Erfolg unserer Mitarbeiter zu unterstützen: *
- Umfassende Gesundheitsabdeckung: Kranken-, Zahn- und Sehkraftversicherung für Mitarbeiter und berechtigte Angehörige. *
- Bedeutende Aktienoptionen: RSUs, die den Mitarbeitern eine Beteiligung am langfristigen Erfolg des Unternehmens ermöglichen. *
- Altersvorsorge: 401(k) Matching (USA) und Pensionsbeiträge (UK). *
- Flexible Urlaubszeit: Unbegrenzte PTO, Feiertage und Gleittage zur Unterstützung der Work-Life-Balance. *
- Betriebsweite Winterpause: Zwei Wochen Betriebsschließung jedes Winters, um abzuschalten und sich zu erholen. *
- Bezahlter Eltern- und Familienurlaub: Bezahlter Urlaub zur Unterstützung von Ihnen und Ihrer Familie in wichtigen Lebensmomenten. *
- Professionelle Entwicklung: Jährliches Budget für Lern- und Entwicklungsmaßnahmen zur Unterstützung Ihres beruflichen Wachstums. *
- Wellness-Leistungen: Zuschüsse für Wellness und Homeoffice zur Unterstützung Ihres körperlichen und geistigen Wohlbefindens. *
- Sabbatical-Programm: Vier Wochen bezahlter Sabbatical-Urlaub nach vier Dienstjahren. *
- Flexibles Arbeiten: Flexible Arbeitszeiten und ein hybrides Arbeitsmodell für unsere Büroteams. *
- Mahlzeiten im Büro: Kostenlose Mahlzeiten in unseren Büro-Hubs.
Leistungen können je nach Standort, Team und Rolle variieren.
