Nscale

Staff Observability Platform Engineer

PythonKubernetesGoTerraform
Automatische Übersetzung. Prüfe das Original.

ÜBER NSCALE

Nscale ist die GPU-Cloud, die für KI entwickelt wurde. Wir bieten kosteneffiziente, leistungsstarke Infrastruktur für KI-Start-ups und große Unternehmenskunden. Nscale vereinfacht die KI-Entwicklung und ermöglicht gleichzeitig überragende Ergebnisse, wobei strategische Geschäftsziele wie Kostenmanagement, schnelle Innovation und ökologische Verantwortung unterstützt werden.

Wir leben eine Kultur der unermüdlichen Innovation, Eigenverantwortung und Rechenschaftspflicht, in der jedes Teammitglied stolz auf seine Arbeit ist und diese mit Exzellenz und Dringlichkeit vorantreibt. Als Nscaler bauen Sie Vertrauen durch Offenheit und Transparenz auf und tragen gleichzeitig zu der Technologie bei, die die Zukunft antreibt.

ÜBER DIE ROLLE

Als Staff Observability Platform Engineer spielen Sie eine entscheidende Rolle beim Aufbau und der Weiterentwicklung der Observability-Plattform von Nscale, die tiefe Einblicke in GPU-Cluster, KI-Workloads und die zugrunde liegende Infrastruktur ermöglicht. Sie betrachten Observability als Produkt und nicht nur als Ansammlung von Tools. Sie helfen dabei, skalierbare und zuverlässige Observability-Lösungen zu definieren und zu implementieren, die es Engineering-Teams ermöglichen, das Systemverhalten zu verstehen, Probleme schnell zu diagnostizieren und komplexe verteilte Systeme sicher zu betreiben. Sie kombinieren technische Führung mit praktischer Engineering-Arbeit und arbeiten eng mit SRE-, Infrastruktur-, Plattform- sowie KI/ML-Teams zusammen, um Zuverlässigkeit, betriebliche Effizienz und die Entwicklererfahrung zu verbessern. Sie beeinflussen architektonische Entscheidungen, etablieren Best Practices im Engineering und treiben die Entwicklung der Observability-Fähigkeiten im gesamten Unternehmen voran. Dies ist eine Rolle für jemanden, der Freude daran hat, schwierige Infrastrukturprobleme zu lösen, skalierbare Plattformen aufzubauen und Engineering-Teams durch bessere Sichtbarkeit und operative Einblicke zum Erfolg zu verhelfen.

IHRE AUFGABEN

  1. Konzeption, Aufbau und Weiterentwicklung von Observability-Plattformen für Metriken, Logs, Traces, Alerting und Telemetrie-Pipelines.
  1. Leitung der Implementierung skalierbarer Observability-Lösungen zur Unterstützung der wachsenden GPU- und KI-Infrastruktur von Nscale.
  1. Zusammenarbeit mit SRE-, Infrastruktur-, Plattform- sowie KI/ML-Teams, um sicherzustellen, dass Observability über den gesamten Software- und Infrastruktur-Lebenszyklus hinweg integriert ist.
  1. Vorantreiben von Verbesserungen bei der Monitoring-Abdeckung, der Qualität von Alerts, der Sichtbarkeit des Systemzustands und der Effektivität der Incident-Reaktion.
  1. Entwicklung von Standards, Frameworks und wiederverwendbaren Mustern, die die Einführung von Observability in den Engineering-Teams vereinfachen.
  1. Identifizierung von Zuverlässigkeitsrisiken und operativen blinden Flecken, um Teams dabei zu unterstützen, diese proaktiv anzugehen, bevor sie sich auf Kunden auswirken.
  1. Beitrag zu architektonischen Entscheidungen in Bezug auf Telemetrie-Erfassung, Speicherung, Aufbewahrung, Kardinalitätsmanagement und Leistungsoptimierung.
  1. Leitung technischer Initiativen und Projekte zur Verbesserung der Skalierbarkeit, Zuverlässigkeit und betrieblichen Effizienz der Plattform.
  1. Mentoring von Ingenieuren und Bereitstellung technischer Beratung durch Design-Reviews, Code-Reviews und Wissensaustausch.
  1. Teilnahme an Incident-Untersuchungen und Postmortems, um operative Erkenntnisse in dauerhafte Plattformverbesserungen zu übersetzen.
  1. Evaluierung neuer Observability-Technologien und -Praktiken unter Abwägung von Innovation mit operativer Einfachheit und langfristiger Wartbarkeit.

ÜBER SIE

  1. 6+ Jahre Erfahrung in SRE, Platform Engineering, Infrastructure Engineering, Observability Engineering oder verwandten Disziplinen.
  1. Fundierte Erfahrung im Aufbau und Betrieb von Observability-Plattformen in Cloud-nativen, verteilten Umgebungen.
  1. Tiefgreifende praktische Erfahrung mit mehreren der folgenden Technologien: Prometheus, Thanos, VictoriaMetrics, Grafana, Loki, Tempo, OpenTelemetry, ClickHouse, Elastic oder ähnlichen Plattformen.
  1. Starke Software-Engineering-Fähigkeiten mit fundierten Kenntnissen in Go, Python oder gleichwertigen Sprachen.
  1. Erfahrung im Betrieb und bei der Fehlerbehebung von Kubernetes-basierten Plattformen im großen Maßstab.
  1. Fundiertes Verständnis von Monitoring, Logging, Tracing, Telemetrie-Pipelines und modernen Observability-Praktiken.
  1. Erfahrung im Entwurf von Systemen unter Berücksichtigung von Skalierbarkeit, Zuverlässigkeit, Leistung und operativer Einfachheit.
  1. Sicherer Umgang mit Infrastructure-as-Code-Tools wie Terraform, Ansible oder gleichwertigen.
  1. Fähigkeit, technische Initiativen zu leiten und Engineering-Entscheidungen über mehrere Teams hinweg zu beeinflussen.
  1. Exzellente Kommunikationsfähigkeiten mit der Fähigkeit, technische Kompromisse zu erklären und Stakeholder auf pragmatische Lösungen auszurichten.

WÜNSCHENSWERT

  1. Erfahrung im Betrieb von Observability-Systemen in GPU-, KI/ML-, HPC- oder großskaligen Compute-Umgebungen.
  1. Vertrautheit mit Slurm, Kubernetes GPU-Scheduling oder KI-Infrastrukturplattformen.
  1. Erfahrung mit hochvolumigen Telemetrie-Pipelines und Streaming-Technologien wie Kafka, Vector oder Fluent Bit.
  1. Kenntnisse über Observability-Herausforderungen im Zusammenhang mit Modelltraining, Inferenz-Workloads, GPU-Auslastung und verteilten KI-Systemen.
  1. Erfahrung im Mentoring von Ingenieuren und beim Ausbau technischer Fähigkeiten in Teams.

ERKLÄRUNG ZUR CHANCENGLEICHHEIT

Wir ermutigen ausdrücklich Bewerbungen von People of Color, der LGBTQ+-Community, Menschen mit Behinderungen, neurodivergenten Personen, Eltern, pflegenden Angehörigen und Menschen aus sozioökonomisch benachteiligten Verhältnissen.

Wenn wir etwas tun können, um Ihre spezifische Situation zu berücksichtigen, lassen Sie es uns bitte wissen.

Hinweis: Die aufgeführten Verantwortlichkeiten sind nicht erschöpfend und können sich mit den geschäftlichen Anforderungen ändern.

Informationen darüber, wie Nscale mit personenbezogenen Daten von Bewerbern umgeht, finden Sie in unserem Datenschutzhinweis für Mitarbeiter & Bewerber: Hier. drive.google.com/file/d/1QK5Yg04WHD9K9IAtJgQWubJZC9oLvatK/view?usp=sharing

Nscale akzeptiert keine unaufgeforderten Bewerbungen von Personalvermittlungsagenturen.

Die unten angegebene Spanne spiegelt das Grundgehalt für die Position wider. Die tatsächliche Vergütung kann je nach berufsbezogenen Faktoren wie Qualifikation, Erfahrung, Ausbildung und Standort variieren. Zusätzlich zum Grundgehalt kann diese Rolle für Bonus-, Aktien- und/oder Provisionsprogramme in Frage kommen. Nscale bietet möglicherweise ein wettbewerbsfähiges Leistungspaket, einschließlich Kranken-, Zahn-, Augenversicherung, flexibler bezahlter Freistellung, Elternzeit und Teilnahme an Altersvorsorgeplänen.

Gehaltsspanne

$190,000—$260,000 USD

Mehr Möglichkeiten mit einem Profil

Für mehr Stellen berücksichtigt werden, ohne den ganzen Prozess zu wiederholen? Erstellen Sie Ihr Profil, damit Unternehmen auf Nort Sie finden.

Profil erstellen

Dein nächster Jobsucht schon nach dir.

Nort

Reverse-Recruiting- Plattform für Entwickler

RechtlichesNutzungsbedingungenDatenschutznortjobs © 2026