Nscale

Ingénieur Principal Plateforme d'Observabilité

PythonKubernetesGoTerraform
Traduction automatique. Consultez l’original.

À propos du poste

INGÉNIEUR PRINCIPAL PLATEFORME D'OBSERVABILITÉ – NSCALE

En tant qu'Ingénieur Principal/Staff Plateforme d'Observabilité, vous serez responsable de la direction technique de la plateforme d'observabilité de Nscale : les systèmes qui nous offrent une visibilité approfondie sur les clusters GPU, les charges de travail IA et l'infrastructure qui les exécute.

Vous considérez l'observabilité comme un produit et une discipline, et non comme un simple exercice d'outillage.

Vous définirez la feuille de route architecturale, élèverez le niveau d'ingénierie au sein des équipes et veillerez à ce que notre plateforme évolue en avance sur l'entreprise, et non en retard.

Vous comprenez que la complexité a un coût. Les solutions qui nécessitent une maintenance constante ne sont pas évolutives, tout comme la charge opérationnelle. Les plateformes que vous construisez doivent être simples à exploiter, faciles à comprendre et manifestement correctes lorsqu'un problème survient.

Il ne s'agit pas d'un rôle de « maintenance et exploitation ». C'est un rôle de « définition, construction et leadership ».

À PROPOS DE NSCALE

Nscale est le cloud GPU conçu pour l'IA. Nous fournissons une infrastructure haute performance et rentable aux start-ups spécialisées dans l'IA ainsi qu'aux grandes entreprises. Nscale simplifie le développement de l'IA tout en permettant d'obtenir des résultats supérieurs, en soutenant des objectifs commerciaux stratégiques tels que la gestion des coûts, l'innovation rapide et la responsabilité environnementale.

Nous nous épanouissons au sein d'une culture d'innovation constante, de prise d'initiative et de responsabilité, où chaque membre de l'équipe est fier de son travail et le mène avec excellence et urgence. En tant que Nscaler, vous instaurerez la confiance par l'ouverture et la transparence tout en contribuant à la technologie qui alimente l'avenir.

DÉCLARATION D'ÉGALITÉ DES CHANCES

pastedGraphic.png

Nous encourageons vivement les candidatures de personnes de couleur, de la communauté LGBTQ+, de personnes en situation de handicap, de personnes neurodivergentes, de parents, d'aidants et de personnes issues de milieux socio-économiques défavorisés.

S'il y a quoi que ce soit que nous puissions faire pour accommoder votre situation spécifique, veuillez nous en informer.

Note : Les responsabilités décrites ne sont pas exhaustives et peuvent évoluer en fonction des besoins de l'entreprise.

Fourchette salariale

190,000—300,000 USD

Pour plus d'informations sur la manière dont Nscale traite les données personnelles des candidats, veuillez consulter notre Avis de confidentialité pour les employés et candidats : Ici. drive.google.com/file/d/1QK5Yg04WHD9K9IAtJgQWubJZC9oLvatK/view?usp=sharing

Nscale n'accepte pas les candidatures spontanées provenant d'agences de recrutement.

Vos missions

  1. Assumer la responsabilité de la stratégie technique et de l'architecture pour l'observabilité au sein des métriques, des logs, des traces et des alertes à grande échelle.
  1. Piloter les décisions relatives à la plateforme ayant un impact pluriannuel : outillage, modèles de données, modèles d'ingestion, rétention, gestion de la cardinalité.
  1. Identifier les lacunes systémiques avant qu'elles ne deviennent des incidents ; concevoir des plateformes qui rendent les défaillances visibles et rapides à diagnostiquer.
  1. Collaborer avec les équipes SRE, infrastructure et IA/ML pour intégrer l'observabilité nativement dans la manière dont Nscale construit et opère.
  1. Définir des normes et des modèles que les autres ingénieurs adopteront, non par obligation, mais parce qu'ils sont manifestement meilleurs.
  1. Encadrer et faire progresser techniquement l'équipe d'observabilité ; élever le plafond de ce que l'équipe peut construire et prendre en charge.
  1. Diriger les post-mortems d'incidents et les utiliser pour favoriser des améliorations durables de la plateforme.
  1. Évaluer et introduire des outils qui améliorent significativement la qualité du signal, l'efficacité opérationnelle ou l'évolutivité, et retirer ceux qui ne le font pas.

Profil recherché

  1. 8+ années d'expérience dans des rôles de SRE, ingénierie d'infrastructure, ingénierie de plateforme ou axés sur l'observabilité.
  1. Vous avez exploité une infrastructure d'observabilité à grande échelle. Vous savez ce qui casse à 10x et vous concevez en conséquence.
  1. Vous avez un fort penchant pour la simplicité. Vous avez vu des piles d'observabilité sur-conçues s'effondrer sous leur propre poids et vous construisez en conséquence.
  1. Expérience pratique approfondie avec un sous-ensemble significatif de : Prometheus, Thanos, VictoriaMetrics, Grafana, Loki, Tempo, OpenTelemetry, ClickHouse, Elastic.
  1. Solides fondamentaux en ingénierie, maîtrise de Python, Go ou similaire ; à l'aise avec la prise en charge de systèmes complexes de bout en bout.
  1. Expérience avec Kubernetes à grande échelle ; une familiarité avec l'infrastructure GPU ou les environnements HPC (Slurm) est un atout majeur.
  1. Vous êtes capable d'architecturer des systèmes, d'écrire le code, de réviser le travail des autres et d'expliquer clairement les compromis, tout cela au cours de la même semaine.
  1. L'Infrastructure-as-Code est la norme, pas une option (Terraform, Ansible ou équivalent).
  1. Vous influencez sans autorité hiérarchique. Les équipes veulent votre avis car il améliore leur travail.

Apprécié

  1. Expérience avec des pipelines de streaming à haut volume pour les données d'observabilité (Kafka, Vector, Fluent Bit, etc.).
  1. Expérience en observabilité de l'infrastructure IA/ML : utilisation des GPU, visibilité des tâches d'entraînement, latence d'inférence.
  1. Expérience préalable dans la définition d'une stratégie d'observabilité au niveau de l'organisation.

La fourchette ci-dessous reflète le salaire de base pour le poste. La rémunération réelle peut varier en fonction de facteurs liés au poste tels que les compétences, l'expérience, l'éducation et le lieu. En plus du salaire de base, ce rôle peut être éligible à des programmes de bonus, d'actions et/ou de commission. Nscale peut offrir un ensemble d'avantages sociaux compétitifs incluant une couverture médicale, dentaire, optique, des congés payés flexibles, un congé parental et une participation à un plan de retraite.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter