ISS
Intermedia Intelligent Communications
Site Reliability Engineer
Über die Stelle
Site Reliability Engineer
Über die Rolle
Wir suchen einen Site Reliability Engineer (SRE), um die Zuverlässigkeit unserer KI- und Analyseplattformen und der von ihnen abhängigen Dienste zu verbessern. Da Intermedia seine globalen Produktbereitstellungen erweitert, wird diese Rolle die SRE-Praktiken in der Produktionsinfrastruktur, den Datenpipelines, machine-learning-Diensten, kundenorientierten Analysen und KI-gestützten Sprach- und Unified-Communications-Funktionen stärken. Sie werden mit KI-, Daten-, Produkt- und Plattformteams zusammenarbeiten, um skalierbare, beobachtbare Systeme aufzubauen, die zuverlässige Einblicke und widerstandsfähige Kundenerlebnisse liefern.
Abteilung: Dev & Engineering
Anstellungsart: Vollzeit
Standort: Portugal
Obwohl diese Rolle hauptsächlich remote ist, erfordert sie gelegentliche Besuche im Büro in Coimbra oder Aveiro. Wir planen, in Zukunft ein Büro in Porto zu eröffnen. Dieser Ansatz bietet den Teammitgliedern die Flexibilität, remote zu arbeiten und gleichzeitig für Zusammenarbeit und Teamwork im Büro zusammenzukommen.
Sind Sie bereit, Ihre Spuren zu hinterlassen?
Vielfalt, Inklusion und Chancengleichheit
Wir stellen ein, befördern und vergüten Mitarbeiter basierend auf ihrer Fähigkeit, ihre beruflichen Pflichten zu erfüllen, unabhängig von Rasse, Hautfarbe, Glauben, Religion, Geschlecht, Geschlechtsidentität, Familienstand, nationaler Herkunft, Abstammung, Alter, Staatsbürgerschaft, körperlicher oder geistiger Behinderung, sexueller Orientierung oder einer anderen durch geltendes Recht geschützten Grundlage (gemeinsam in unserem Verhaltenskodex als „geschützte Klassen“ bezeichnet).
Wir dulden keine Diskriminierung am Arbeitsplatz und sind bestrebt, angemessene Vorkehrungen für festgestellte Behinderungen oder andere Einschränkungen zu treffen, wie es alle geltenden Gesetze vorschreiben.
Wir sind ein Arbeitgeber, der Chancengleichheit fördert und Vielfalt in unserem Unternehmen schätzt.
Wir diskriminieren nicht aufgrund von Rasse, Religion, Hautfarbe, nationaler Herkunft, Geschlecht, sexueller Orientierung, Alter, Familienstand, Veteranenstatus oder Behindertenstatus.
Beschreibung
*ALLE KANDIDATEN MÜSSEN SICH IN PORTUGAL BEFINDEN*
Was Sie in die Rolle einbringen
- Bachelor-Abschluss in Informatik, Data Engineering, Software Engineering oder einer anderen technischen oder wissenschaftlichen Disziplin oder gleichwertige praktische Erfahrung.
- 4-7 Jahre Erfahrung in Produktionsbetrieb, Systemtechnik, SRE oder DevOps, Softwarebereitstellung und Wartung verteilter Produktionssysteme.
- Erfahrung mit Cloud-Infrastruktur, Containern, Kubernetes, verteilten Systemen und skalierbaren Compute- und Speicher-Services.
- Erfahrung im Betrieb von Datenverarbeitungs-, Orchestrierungs-, Speicher- oder Analysetechnologien wie Kafka, Spark, Airflow, dbt, Data Warehouses oder vergleichbaren Cloud-Diensten.
- Fähigkeit, Metriken, Protokolle, Traces, Datenqualitätsprüfungen, Aktualitätsindikatoren, Lineage und Service-Level-Indikatoren zur Diagnose komplexer Produktionsprobleme zu verwenden.
- Erfahrung mit CI/CD, DataOps oder MLOps-Praktiken, automatisierten Tests, kontrollierten Rollouts und Rollbacks von Daten- und KI-Serviceänderungen.
- Starke Fehlerbehebungsfähigkeiten über Linux, Anwendungen, Netzwerke, APIs, Datenpipelines und verteilte Serviceabhängigkeiten hinweg, mit Fokus auf Sicherheit und Zugriffskontrollen.
- Starke analytische Problemlösungs- und funktionsübergreifende Kommunikationsfähigkeiten mit einem proaktiven Ansatz für Zuverlässigkeit, Leistung und kontinuierliche Verbesserung.
Über Intermedia
Suchen Sie ein Unternehmen, in dem IHRE STIMME gehört wird? Wo Sie ETWAS BEWIRKEN können? Gedeihen Sie in einem UMBRUCHREICHEN Arbeitsumfeld? Stehen Sie jeden Morgen AUFGEDREGT auf, um mit GROSSARTIGEN LEUTEN zusammenzuarbeiten und GEMEINSAM ERFOLG zu schaffen? Dann ist Intermedia der richtige Ort für Sie.
Intermedia hat sich als führender Anbieter von Cloud-Kommunikations- und Kollaborationstechnologien etabliert, die es Unternehmen ermöglichen, besser zu kommunizieren. Wir haben eine starke Erfolgsbilanz in Bezug auf Wachstum, Rentabilität und die Schaffung einer Umgebung, in der jeder zählt. Jeder. Obwohl wir schnelllebig und zugegebenermaßen etwas intensiv sind, versprechen wir Ihnen, dass es Ihnen nicht langweilig wird. Sie werden feststellen, dass Intermedia ein Ort ist, an dem Sie Ihrer Leidenschaft für die Schaffung und Unterstützung grossartiger Cloud-Technologie nachgehen können. Darüber hinaus streben wir immer danach, von innen heraus zu fördern, und viele unserer Mitarbeiter sind seit 10, 15 und 20+ Jahren bei uns!
Die Kultur bei Intermedia basiert auf Teamwork und Transparenz. Wir fordern uns gegenseitig und halten uns immer den Rücken frei!
Was Sie tun werden
- Betreiben und verbessern Sie Produktionsumgebungen, die KI- und KI-Workloads, Datenpipelines, Analyseanwendungen und kundenorientierte Dienste unterstützen.
- Erstellen Sie Software und Automatisierung zur Verwaltung von Cloud-Infrastruktur, Datenplattformen, Model-Serving-Infrastruktur und Anwendungsdiensten.
- Definieren und messen Sie Service Level Indicators, Service Level Objectives und Fehlertoleranzen für KI- und Analysedienste, einschliesslich Verfügbarkeit, Datenaktualität, Pipeline-Abschluss und Inferenzlatenz.
- Erstellen Sie End-to-End-Observability, die Metriken, Protokolle und Traces mit Signalen zur Datenqualität, KI-Dienstleistung und Kundenauswirkungen korreliert.
- Überwachen und optimieren Sie die Zuverlässigkeit, Leistung, Kapazität und Kosten von Batch- und Streaming-Workloads, Analyseabfragen und Inferenzdiensten.
- Arbeiten Sie mit Data Engineering und machine-learning-Teams zusammen, um Ingestions-, Transformations-, Feature-, Trainings-, Bereitstellungs- und Reporting-Workflows produktionsreif zu machen.
- Automatisieren Sie CI/CD- und Produktionsbereitschaftsprüfungen für Datenpipelines, Modell- und Prompt-Releases, Schemaänderungen, Analyseanwendungen und Dashboards.
- Erkennen und beheben Sie Datenqualitätsvorfälle im Zusammenhang mit fehlenden, veralteten, verspäteten oder anomalen Daten, Schema-Drift und fehlerhaften Abhängigkeiten oder Verknüpfungen.
- Entwerfen und testen Sie graceful degradation, Abhängigkeitsisolierung, Retry- und Fallback-Muster sowie Wiederherstellungsverfahren für beeinträchtigte KI-, Daten- oder nachgelagerte Dienste.
- Verbessern Sie die Zuverlässigkeit von KI-gestützten Sprach- und Unified-Communications-Funktionen wie Spracherkennung, Transkription, Zusammenfassung, intelligente Weiterleitung, konversationelle Unterstützung und Text-to-Speech.
- Richten Sie operative Überwachung für Modell- und KI-Dienstverhalten ein, einschliesslich Latenz, Durchsatz, Fehlerraten, Driftindikatoren und Änderungen der Ausgabequalität.
- Planen Sie Kapazitäten und führen Sie Leistungs-, Last- und Resilienztests für rechenintensive KI-Workloads, verteilte Datenverarbeitung und Analysedienste durch.
- Leiten Sie Incident Response und Post-Incident-Verbesserungen für KI- und Analysedienste, indem Sie messbare Massnahmen ergreifen, um Wiederholungen und Wiederherstellungszeiten zu reduzieren.
- Unterstützen Sie den sicheren und zuverlässigen Zugriff auf Cloud-Speicher-, Verarbeitungs- und Abfragedienste, die von Analyseprodukten und der internen Entscheidungsfindung genutzt werden.
- Reduzieren Sie operative Belastungen und verbessern Sie die Ingenieursleistung durch Plattform-Tools, Runbooks, Self-Service-Automatisierung und klare operative Standards.
