Roku
Nscale
Ingénieur Principal Plateforme d'Observabilité
À propos du poste
INGÉNIEUR PRINCIPAL PLATEFORME D'OBSERVABILITÉ – NSCALE
En tant qu'Ingénieur Principal/Staff Plateforme d'Observabilité, vous serez responsable de la direction technique de la plateforme d'observabilité de Nscale : les systèmes qui nous offrent une visibilité approfondie sur les clusters GPU, les charges de travail IA et l'infrastructure qui les exécute.
Vous considérez l'observabilité comme un produit et une discipline, et non comme un simple exercice d'outillage.
Vous définirez la feuille de route architecturale, élèverez le niveau d'ingénierie au sein des équipes et veillerez à ce que notre plateforme évolue en avance sur l'entreprise, et non en retard.
Vous comprenez que la complexité a un coût. Les solutions qui nécessitent une maintenance constante ne sont pas évolutives, tout comme la charge opérationnelle. Les plateformes que vous construisez doivent être simples à exploiter, faciles à comprendre et manifestement correctes lorsqu'un problème survient.
Il ne s'agit pas d'un rôle de « maintenance et exploitation ». C'est un rôle de « définition, construction et leadership ».
À PROPOS DE NSCALE
Nscale est le cloud GPU conçu pour l'IA. Nous fournissons une infrastructure haute performance et rentable aux start-ups spécialisées dans l'IA ainsi qu'aux grandes entreprises. Nscale simplifie le développement de l'IA tout en permettant d'obtenir des résultats supérieurs, en soutenant des objectifs commerciaux stratégiques tels que la gestion des coûts, l'innovation rapide et la responsabilité environnementale.
Nous nous épanouissons au sein d'une culture d'innovation constante, de prise d'initiative et de responsabilité, où chaque membre de l'équipe est fier de son travail et le mène avec excellence et urgence. En tant que Nscaler, vous instaurerez la confiance par l'ouverture et la transparence tout en contribuant à la technologie qui alimente l'avenir.
DÉCLARATION D'ÉGALITÉ DES CHANCES
pastedGraphic.png
Nous encourageons vivement les candidatures de personnes de couleur, de la communauté LGBTQ+, de personnes en situation de handicap, de personnes neurodivergentes, de parents, d'aidants et de personnes issues de milieux socio-économiques défavorisés.
S'il y a quoi que ce soit que nous puissions faire pour accommoder votre situation spécifique, veuillez nous en informer.
Note : Les responsabilités décrites ne sont pas exhaustives et peuvent évoluer en fonction des besoins de l'entreprise.
Fourchette salariale
190,000—300,000 USD
Pour plus d'informations sur la manière dont Nscale traite les données personnelles des candidats, veuillez consulter notre Avis de confidentialité pour les employés et candidats : Ici. drive.google.com/file/d/1QK5Yg04WHD9K9IAtJgQWubJZC9oLvatK/view?usp=sharing
Nscale n'accepte pas les candidatures spontanées provenant d'agences de recrutement.
Vos missions
- Assumer la responsabilité de la stratégie technique et de l'architecture pour l'observabilité au sein des métriques, des logs, des traces et des alertes à grande échelle.
- Piloter les décisions relatives à la plateforme ayant un impact pluriannuel : outillage, modèles de données, modèles d'ingestion, rétention, gestion de la cardinalité.
- Identifier les lacunes systémiques avant qu'elles ne deviennent des incidents ; concevoir des plateformes qui rendent les défaillances visibles et rapides à diagnostiquer.
- Collaborer avec les équipes SRE, infrastructure et IA/ML pour intégrer l'observabilité nativement dans la manière dont Nscale construit et opère.
- Définir des normes et des modèles que les autres ingénieurs adopteront, non par obligation, mais parce qu'ils sont manifestement meilleurs.
- Encadrer et faire progresser techniquement l'équipe d'observabilité ; élever le plafond de ce que l'équipe peut construire et prendre en charge.
- Diriger les post-mortems d'incidents et les utiliser pour favoriser des améliorations durables de la plateforme.
- Évaluer et introduire des outils qui améliorent significativement la qualité du signal, l'efficacité opérationnelle ou l'évolutivité, et retirer ceux qui ne le font pas.
Profil recherché
- 8+ années d'expérience dans des rôles de SRE, ingénierie d'infrastructure, ingénierie de plateforme ou axés sur l'observabilité.
- Vous avez exploité une infrastructure d'observabilité à grande échelle. Vous savez ce qui casse à 10x et vous concevez en conséquence.
- Vous avez un fort penchant pour la simplicité. Vous avez vu des piles d'observabilité sur-conçues s'effondrer sous leur propre poids et vous construisez en conséquence.
- Expérience pratique approfondie avec un sous-ensemble significatif de : Prometheus, Thanos, VictoriaMetrics, Grafana, Loki, Tempo, OpenTelemetry, ClickHouse, Elastic.
- Solides fondamentaux en ingénierie, maîtrise de Python, Go ou similaire ; à l'aise avec la prise en charge de systèmes complexes de bout en bout.
- Expérience avec Kubernetes à grande échelle ; une familiarité avec l'infrastructure GPU ou les environnements HPC (Slurm) est un atout majeur.
- Vous êtes capable d'architecturer des systèmes, d'écrire le code, de réviser le travail des autres et d'expliquer clairement les compromis, tout cela au cours de la même semaine.
- L'Infrastructure-as-Code est la norme, pas une option (Terraform, Ansible ou équivalent).
- Vous influencez sans autorité hiérarchique. Les équipes veulent votre avis car il améliore leur travail.
Apprécié
- Expérience avec des pipelines de streaming à haut volume pour les données d'observabilité (Kafka, Vector, Fluent Bit, etc.).
- Expérience en observabilité de l'infrastructure IA/ML : utilisation des GPU, visibilité des tâches d'entraînement, latence d'inférence.
- Expérience préalable dans la définition d'une stratégie d'observabilité au niveau de l'organisation.
La fourchette ci-dessous reflète le salaire de base pour le poste. La rémunération réelle peut varier en fonction de facteurs liés au poste tels que les compétences, l'expérience, l'éducation et le lieu. En plus du salaire de base, ce rôle peut être éligible à des programmes de bonus, d'actions et/ou de commission. Nscale peut offrir un ensemble d'avantages sociaux compétitifs incluant une couverture médicale, dentaire, optique, des congés payés flexibles, un congé parental et une participation à un plan de retraite.
