Coralogix
IPSY
SRE Engineer Contractor
ÜBER UNS
Inspiriere mit uns jeden, seine einzigartige Schönheit auszudrücken.
IPSY ist die leistungsstärkste Plattform der Beauty-Branche und vereint Marken, Kreative und hyper-engagierte Konsumenten mit beispiellosem Zugang zueinander durch die ultimative Beauty-Mitgliedschaft. Als Heimat des Abo-Modells mit Probiergrößen IPSY Original, des Abo-Modells mit Vollgrößen IPSY Extra und der vierteljährlichen, limitierten Kollektion IPSY Ultimate kuratieren wir Beauty für Millionen von Mitgliedern, damit sie täglich ihre einzigartige Schönheit spielen, entdecken und ausdrücken können.
Wir glauben, dass Selbstfindung, Selbstausdruck und Selbstvertrauen schön sind. Stimmst du zu? Dann mach mit! Entdecke Karrieren und erfahre mehr über unsere Werte, Kultur und Benefits über alle unsere Marken hinweg: IPSY Careers.
Wir sind stolz darauf, ein Remote-First-Unternehmen zu sein. Unsere vollständig remote arbeitenden Teammitglieder haben die Möglichkeit, dort zu leben und zu arbeiten, wo sie möchten, denn wir glauben, dass die Arbeit in dein Leben passen sollte – nicht umgekehrt. Wir bieten monatliche virtuelle Aktivitäten, unternehmensweite Offsites sowie berufliche Weiterbildungs- und Lernveranstaltungen, um unseren Teammitgliedern zu helfen, auch bei virtueller Arbeit verbunden, engagiert und wirkungsvoll zu bleiben.
Über die Rolle
Wir suchen einen Site Reliability Engineer Contractor für unser Foundation / SREIQ-Team, der uns hilft, IPSY für Millionen von Beauty-Community-Mitgliedern schnell, verfügbar und resilient zu halten. Du wirst im Zentrum dessen stehen, wie wir Vorfälle erkennen, darauf reagieren und daraus lernen, und mit Engineering, Produkt und der breiteren Tech-Organisation zusammenarbeiten, um die kritischen Abläufe zu schützen, auf die sich unsere Mitglieder täglich verlassen.
Dies ist eine hands-on Zuverlässigkeitsrolle. Du wirst die Observability und das Alerting in Datadog verantworten, an unserer Bereitschaftsrotation teilnehmen, als SRE Partner bei Vorfällen fungieren, zu Ursachenanalysen beitragen und unermüdlich den Aufwand aus unserem Betrieb automatisieren. Wir sind ein Automatisierungs-orientiertes, KI-umarmendes Team: Wir erwarten, dass du moderne KI-Tools nutzt, um schneller zu debuggen, Runbooks und RCAs zu erstellen und intelligentere Automatisierung zu entwickeln.
Der SRE Engineer berichtet an den Infrastructure Engineering Manager und wird vollständig remote aus Mexiko oder Kolumbien arbeiten und die PST-Zeitzone abdecken.
Remote in den Vereinigten Staaten: Remote-Positionen, die in jedem der Bundesstaaten ausgeübt werden können, in denen IPSY eine Geschäftspräsenz hat: Arizona, Kalifornien, Connecticut, Florida, Illinois, Kansas, Massachusetts, Missouri, North Carolina, New York, New Jersey, Nevada, Ohio, Pennsylvania, Texas und Washington. California Privacy Notice
Vorsicht vor Job-Betrug! IPSY-Recruiter verwenden ausschließlich E-Mail-Adressen von @ipsy.com. Wir führen keine Interviews per Text/Nachricht/Teams. Wir bitten nicht um Software-Downloads (außer Zoom) und werden niemals sensible Informationen (wie Sozialversicherungsnummern/Bankdaten) abfragen. Betrugsverdacht? Melde ihn den Strafverfolgungsbehörden und [email protected].
EEO-Erklärung: Wir feiern Vielfalt und sind ein Arbeitgeber, der Chancengleichheit fördert. Wir diskriminieren nicht aufgrund von Rasse, Religion, Hautfarbe, nationaler Herkunft, Geschlecht, sexueller Orientierung, Alter, Familienstand, Veteranenstatus, Behindertenstatus oder einer anderen geschützten Eigenschaft.
Wenn du angemessene Vorkehrungen im Bewerbungs- oder Beschäftigungsverfahren benötigst, kontaktiere uns bitte.
IPSY hat seinen Sitz in den USA und um die Einhaltung der länderspezifischen Arbeitsgesetze zu gewährleisten, arbeiten wir mit DEEL zusammen, das uns bei der Rekrutierung und Gehaltsabrechnung von Mitarbeitern unterstützt.
#LI-CF1 #LI-Remote
Was du tun wirst
- Aufbau und Pflege der Observability über unsere Plattform in Datadog: Dashboards, Monitore, APM, Log-Pipelines und aussagekräftige, rauschfreie Alarme, die mit den Auswirkungen auf den Benutzer verknüpft sind.
- Definition und Verfolgung von SLIs, SLOs und Fehlertoleranzen für bestimmte Dienste und deren Nutzung zur Steuerung von Zuverlässigkeitsgesprächen mit Service-Eigentümern.
- Teilnahme an der Bereitschaftsrotation und Funktion als SRE Partner bei Vorfällen: Triage, Priorisierungseinstufung (P1-P6), Validierung von Hypothesen und Unterstützung bei der Lösungsfindung mit Anleitung in komplexen Situationen.
- Steuerung der Vorfallreaktion gemäß unserem Framework, Einhaltung der Ziel-Reaktionszeiten (P1 innerhalb von ca. 15 Minuten) und Führung klarer Echtzeit-Dokumentation von Status, Erkenntnissen, Entscheidungen und nächsten Schritten.
- Verwaltung von Eskalationen und Alarmen über Opsgenie und Veröffentlichung strukturierter Updates in Slack-Incident-Kanälen im erwarteten Rhythmus.
- Verantwortung für saubere Schichtübergaben und RCA-Kontinuität, um sicherzustellen, dass Notizen vollständig sind und die Vorfallverantwortung sauber über Schichten und Zeitzonen hinweg übertragen wird.
- Aktive Beteiligung an blameless Post-Incident-Reviews (RCAs), Identifizierung von Ursachen und Maßnahmen zur Verhinderung von Wiederholungen.
- Automatisierung von Routineaufgaben: Erstellung von Skripten, Tools und Self-Healing-/automatisierten Behebungsmaßnahmen zur Reduzierung manueller operativer Arbeit und Beschleunigung der Wiederherstellung.
- Nutzung von KI-Tools (z. B. Claude, Cursor), um das Debugging zu beschleunigen, Runbooks zu erstellen und zu pflegen, RCAs zu entwerfen und Automatisierung zu entwickeln.
- Mithilfe bei der Verbesserung der Zuverlässigkeit unseres Cloud- und Drittanbieter-Stacks (z. B. AWS, Netlify, CommerceTools, Auth0, Contentful).
- Beitrag zur CI/CD-Zuverlässigkeit, Bereitstellungssicherheit und Infrastructure-as-Code-Praktiken.
- Pflege und Verbesserung von SRE-Runbooks und Triage-Workflows, damit die gesamte Organisation konsistent reagiert.
Mindestanforderungen
Wonach wir suchen
- Eine großartige Einstellung, starkes Verantwortungsbewusstsein und eine echte Bereitschaft zu lernen, zu testen und neue Dinge auszuprobieren.
- Ein natürlicher Drang zur Automatisierung: Du suchst instinktiv nach Wegen, Routineaufgaben zu beseitigen, repetitive Arbeiten zu skripten und dich durch Tools zu skalieren.
- Komfort und Neugier mit KI-Tools und der Wunsch, sie für Debugging, Dokumentation, RCAs und alltägliche Zuverlässigkeits-Workflows anzuwenden.
- Praktische Erfahrung mit Observability- und Monitoring-Tools, idealerweise Datadog (Dashboards, Monitore, APM, Logs); Erfahrung mit anderen Plattformen (z. B. Grafana, Prometheus, New Relic, CloudWatch) ist übertragbar.
- Erfahrung in der Teilnahme an Bereitschaftsdiensten und der Vorfallreaktion, einschließlich Triage, Priorisierung, Eskalation und Post-Incident-Reviews.
- Praktisches Verständnis der SRE-Grundlagen: SLIs / SLOs / Fehlertoleranzen, Reduzierung von Routineaufgaben und Abwägung von Zuverlässigkeit mit Liefergeschwindigkeit.
- Praktische Kenntnisse von Cloud-Infrastrukturen (AWS bevorzugt) und modernen verteilten / Microservice- und API-Gateway-Architekturen.
- Skripting- und Automatisierungsfähigkeiten (z. B. Python, Bash oder ähnlich); Komfort beim Lesen und Verstehen von Code über verschiedene Dienste hinweg.
- Vertrautheit mit CI/CD-Pipelines und Infrastructure-as-Code (z. B. Terraform).
- Starke, ruhige Kommunikation: Fähigkeit, an einem Incident-Kanal teilzunehmen, klare Status-Updates zu geben und zu einer lesbaren RCA beizutragen.
- Eine kollaborative Denkweise und die Fähigkeit, effektiv in einem verteilten Team über verschiedene Zeitzonen hinweg zusammenzuarbeiten.
Bonus, wenn du hast
- Erfahrung im Betrieb von High-Traffic-Konsum- oder E-Commerce-Plattformen, insbesondere bei Spitzenereignissen (Flash Sales, Produkt-Drops).
- Erfahrung mit Opsgenie (oder PagerDuty / Ähnlichem) für Alarmierung und Eskalation.
- Erfahrung mit E-Commerce-/Abonnementplattformen wie CommerceTools und Identitätsanbietern wie Auth0.
- Erfahrung mit Produktanalysen und Monitoring (z. B. Amplitude), um die Zuverlässigkeit mit dem Nutzerverhalten zu verknüpfen.
Was wir bieten
- Wettbewerbsfähiges Gehalt (USD)
- Bezahlte Freizeit und Flexibilität beim Arbeiten von zu Hause
