Launch Legends
Meta
Produktionssystemingenieur (Global)
Über die Stelle
Meta sucht einen zukunftsorientierten, erfahrenen Produktionssystemingenieur für das Data Center Operations Team. Unsere Rechenzentren und die dort installierten Zehntausende von Servern bilden die Grundlage, auf der unsere schnell skalierende Infrastruktur effizient arbeitet und unsere innovativen Dienste bereitgestellt werden. Meta steht an der Spitze der globalen Rechenzentrumsbranche, sowohl in Bezug auf das Design als auch auf den Betrieb von Rechenzentren.
Diese Rolle erfordert die Priorisierung konkurrierender Arbeitsströme basierend auf operativen Auswirkungen und die Anpassung von Plänen, wenn sich die Infrastrukturanforderungen weiterentwickeln. Der gesuchte Kandidat ist ein zukunftsorientierter IT-Profi mit tiefgreifender Erfahrung im Einsatz vielfältiger Software-Tools zur Identifizierung von Automatisierungslösungen, die darauf abzielen, komplexe operative Probleme zu lösen. Diese Rolle ist stark funktionsübergreifend und berücksichtigt die technischen Bedürfnisse von Frontline-Benutzern, um Automatisierungswerkzeuge für die Diagnose zu identifizieren und zu automatisieren, was eine qualitativ hochwertige und effiziente Bereitstellung von Produktionsservern ermöglicht. Er sollte in der Lage sein, tiefgreifende Datenanalysen durchzuführen, um Entscheidungen über die Top-Prioritäten für die Automatisierung von Reparaturen an Servern in einer Hyperscale-Umgebung zu treffen. Diese Rolle erfordert die Umsetzung von Lösungen durch Code und eine effektive Zusammenarbeit mit global verteilten Teams durch klare schriftliche und mündliche Kommunikation. Erfahrung in der Verwaltung von Servern, der Programmierung in Skriptsprachen und der Administration von Linux-Systemen ist erforderlich.
Aufgaben
- Identifizierung von systemischen Problemen in der Flotte und deren Ursachenanalyse sowie Steuerung der Lösungsfindung.
- Maximierung der Server-Flottenverfügbarkeit und Auslastungsraten durch Nutzung von Daten zur Ermittlung von Hardware-Ausfallbedingungen und deren Ursachen.
- Schreiben und Überprüfen von Code, Erstellen von Dokumentationen und Debuggen der schwierigsten Probleme live in einigen der größten und komplexesten Systeme der Welt.
- Verantwortung für und Entwicklung von Anforderungen an Diagnosewerkzeuge für den Betrieb der Flotte.
- Verantwortung für und Steuerung des Eskalationsprozesses für Data Center Operations zur Identifizierung, Ursachenanalyse und Lösung komplexer Tooling- und Hardwareprobleme, die die Flotte betreffen.
- Durchführung von operativen Validierungs- und Verifizierungsaktivitäten für die Integration neuer Produkte.
- Durch konsequente Zusammenarbeit mit funktionsübergreifenden Tooling-Teams wird die Ursache ermittelt und Input in deren Entwicklungsprozess gegeben, mit einer operationszentrierten Sichtweise darauf, wie offene Probleme die Flotte beeinflussen.
- Aufbau funktionsübergreifender Beziehungen und Fähigkeit zur Beeinflussung von Richtlinien und Verfahren zur Verbesserung des globalen Rechenzentriebsbetriebs.
- Mentoring von Teammitgliedern zur Bewertung und Identifizierung besserer Wege zur Lösung von Problemen und zur Definition von Updates für Tools und Prozesse.
- Reisebereitschaft bis zu 25% zur Unterstützung des globalen Rechenzentriebsbetriebs.
Mindestanforderungen
- Bachelor-Abschluss in Informatik, Computertechnik, einem relevanten technischen Bereich oder gleichwertige praktische Erfahrung.
- 6+ Jahre Erfahrung in Produktionssystemtechnik, Infrastrukturtechnik oder Systemsoftwareentwicklung für große Hardwareumgebungen.
- 6+ Jahre Erfahrung mit Hardware-Lifecycle-Management, Flottenautomatisierung oder Rechenzentrumsbetriebssystemen, die Compute-, Speicher- oder Netzwerkinfrastruktur umfassen.
- Erfahrung in der Entwicklung von Systemsoftware oder Tooling in Python, PHP, C oder C++ für Linux-basierte Produktionsumgebungen im großen Maßstab.
- Erfahrung in der Konfiguration und Wartung von Anwendungen wie Webservern, Load Balancern, relationalen Datenbanken, Speichersystemen und Nachrichtensystemen.
- Erfahrung in der Kommunikation technischer Designs und Infrastrukturentscheidungen durch schriftliche Dokumentation und funktionsübergreifende Abstimmung mit Stakeholdern aus Engineering- und Betriebsteams.
Bevorzugte Qualifikationen
- Erfahrung im Design oder Betrieb von Konfigurationsmanagement- und Infrastructure-as-Code-Systemen für große heterogene Hardwareflotten.
- Erfahrung in der Unterstützung globaler, standortübergreifender Rechenzentrums-Infrastruktur-Implementierungen, einschließlich Hardwarequalifizierung und Koordination von Rollouts in verschiedenen Regionen.
- Kenntnisse von verteilten Systemüberwachungs-, Alarmierungs- und automatisierten Behebungs-Pipelines im Hyperscale-Bereich.
144.000 $/Jahr bis 204.000 $/Jahr + Bonus + Aktienoptionen + Sozialleistungen
