Astreya
Verda
Data Center Operations Manager - Liverpool
Über die Rolle
Bei Verda bauen wir eine full-stack KI-Cloud auf, die alles umfasst, von Rechenzentren und Hardware bis hin zu unserer eigenen Cloud-Plattform, die die weltweit führenden KI-Teams für ernsthafte KI-Arbeit nutzen.
Wir bemühen uns, durch die von uns gebauten Infrastrukturen einen positiven Beitrag zur Welt zu leisten und führenden Teams einen Service zu bieten, auf den sie sich wirklich verlassen können. Mit Hauptsitz in Helsinki sind wir global tätig und haben Büros in London und San Francisco.
Schließen Sie sich Verda an, während es noch aufgebaut wird – nicht erst, wenn es fertig ist.
Verda betreibt hochdichte GPU-Infrastrukturen an seinen Rechenzentrumsstandorten und wir suchen einen praxisorientierten Data Center Operations Manager, der unser schichtbasiertes Technikteam leitet und die Verantwortung für den täglichen Betrieb des Standorts und den gesamten Hardware-Lebenszyklus übernimmt. Sie werden hohe operative Standards bei Bereitstellungen, Fehlerbehebung, Verkabelung, Inventarisierung und Incident Response aufrechterhalten und gleichzeitig zukünftige Installationen, Upgrades und Ausbauten planen, während der Standort wächst. Sie werden auch starke Arbeitsbeziehungen zu unseren Facility-Partnern aufbauen, um sicherzustellen, dass Probleme, die die Infrastruktur von Verda betreffen, effektiv kommuniziert, eskaliert und gelöst werden. Und während der Standort skaliert, sind Sie möglicherweise derjenige, der das Team um Sie herum einstellt und aufbaut.
Warum Verda
- Bargeld- und Aktienvergütung sowie verschiedene Nebenleistungen.
- Profitabler Betrieb mit schnellem, nachhaltigem Wachstum.
- 40+ Nationalitäten, mit 6 verschiedenen auf der Management-Ebene.
- Eine echte Chance, etwas zu bewirken und mit Weltklasse-Ingenieuren, Forschern und Partnern im globalen KI-Ökosystem zusammenzuarbeiten.
Praktische Informationen
Arbeitsmodus: Vor Ort in Liverpool, UK
Level: Manager
Anstellungsart: Vollzeit und unbefristet
Arbeitserlaubnis: Bitte beachten Sie, dass wir derzeit keine Visabeschaffung anbieten und eine bestehende Arbeitserlaubnis für das Vereinigte Königreich erforderlich ist.
Was kommt als Nächstes
Wir bauen schnell und diese Rolle braucht die richtige Person dahinter. Es gibt keine künstliche Frist, aber wenn wir jemanden finden, den wir suchen, machen wir weiter. Wenn dies Ihr nächster Schritt zu sein scheint, bewerben Sie sich jetzt.
Bitte reichen Sie Ihre Bewerbung über unsere Karriereseite ein. Wir akzeptieren keine per E-Mail gesendeten Bewerbungen.
Ihre Verantwortlichkeiten
- Leiten, unterstützen und entwickeln Sie ein schichtbasiertes Team von Rechenzentrumstechnikern.
- Organisieren Sie Schichtabdeckung, Arbeitslast, Prioritäten, Übergaben und tägliche operative Aktivitäten.
- Übernehmen Sie die Verantwortung für den Hardware-Lebenszyklus von Verda, einschließlich Wareneingang, Inventarisierung, Bereitstellung, Fehlerbehebung, Austausch, Umzug, RMA und Stilllegung.
- Stellen Sie sicher, dass Rack-and-Stack, Komponentenaustausch, Kupfer- und Glasfaserverkabelung sowie Fehlerbehebung auf Link-Ebene sicher und auf hohem Niveau durchgeführt werden.
- Koordinieren Sie Cluster-Bereitstellungen, Kapazitätserweiterungen, Hardware-Erneuerungen und andere Vor-Ort-Projekte.
- Leiten Sie die Vor-Ort-Reaktion auf Hardware- und Konnektivitätsvorfälle und stellen Sie klare Dokumentation, Eskalation und Kommunikation sicher.
- Bauen und verbessern Sie Betriebsverfahren, Runbooks, Sicherheitspraktiken und Eskalationspfade.
- Führen Sie genaue Aufzeichnungen über Vermögenswerte, Inventar, Vorfälle, Wartungsaktivitäten und abgeschlossene Arbeiten.
- Stellen Sie Techniker ein, arbeiten Sie sie ein, coachen Sie sie und führen Sie Leistungsmanagement durch, während der Betrieb wächst.
- Überwachen Sie die Kommunikation des Anbieters bezüglich Strom-, Kühlungs-, Sicherheits- und standortbezogener Ereignisse und bewerten Sie die potenziellen Auswirkungen auf die Infrastruktur von Verda.
- Eskalieren Sie Service-, Sicherheits- oder operative Bedenken an den Colocation-Anbieter und relevante Stakeholder von Verda.
- Nehmen Sie an einer Rufbereitschaft teil und leisten Sie bei dringenden Vorfällen außerhalb der regulären Arbeitszeiten bei Bedarf Führungsunterstützung.
Ihre Schlüsselkompetenzen
Wir suchen einen operativ starken People Manager, der physische Rechenzentrumsarbeit versteht und ein Team in einem sich schnell entwickelnden Umfeld führen kann.
- Praktische Erfahrung im Rechenzentrumsbetrieb oder in einer vergleichbaren kritischen Infrastrukturumgebung.
- Erfahrung in der Leitung schichtbasierter technischer Teams mit fundierten Kenntnissen von Server-Hardware, Rack-and-Stack, Komponentenaustausch und strukturierter Verkabelung.
- Praktische Kenntnisse in der Installation von Kupfer- und Glasfaserkabeln, Optiken und Fehlerbehebung auf Link-Ebene.
- Erfahrung in der Verwaltung von Hardware-Bereitstellungen, Vorfällen, Inventar und operativen Prioritäten.
- Starkes operatives Urteilsvermögen, einschließlich des Wissens, wann die Arbeit eingestellt, die Situation dokumentiert und eskaliert werden muss.
- Komfort bei der Arbeit in einem mehrdeutigen, sich schnell entwickelnden Umfeld mit der Fähigkeit, klare Prozesse für einen breiten Arbeitsbereich zu etablieren.
- Starke Führungsqualitäten, einschließlich Coaching, Leistungsmanagement, Rekrutierung und Teamentwicklung.
Nice to have
- Erfahrung im Betrieb von hochdichten GPU-Infrastrukturen oder praktische Erfahrung mit Enterprise-GPU-Plattformen auf Basis der NVIDIA Ampere-, Hopper- oder Blackwell-Generationen.
- Erfahrung mit Flüssigkeitskühlung, einschließlich Direct-to-Chip-Flüssigkeitskühlsystemen.
- Erfahrung in der Leitung von Cluster-Bereitstellungen, Rechenzentrums-Erweiterungen oder großen Hardware-Erneuerungsprojekten.
- Erfahrung im Aufbau eines neuen Standorts, Aufbau eines Technik-Teams oder Erstellung von Betriebsverfahren von Grund auf.
- Erfahrung in der Arbeit sowohl in großen, strukturierten Organisationen als auch in schnell wachsenden oder weniger definierten Umgebungen.
- Vertrautheit mit Colocation-Serviceverträgen, Eskalationsverfahren von Anbietern und operativen Leistungsüberprüfungen.
