Launch Legends
Nscale
Ingénieur Plateforme d'Observabilité Staff
À PROPOS DE NSCALE
Nscale est le cloud GPU conçu pour l'IA. Nous fournissons une infrastructure rentable et haute performance pour les startups d'IA et les clients de grandes entreprises. Nscale simplifie le développement de l'IA tout en permettant des résultats supérieurs, soutenant des résultats commerciaux stratégiques tels que la gestion des coûts, l'innovation rapide et la responsabilité environnementale.
Nous prospérons dans une culture d'innovation, de propriété et de responsabilité implacables, où chaque membre de l'équipe est fier de son travail et le mène avec excellence et urgence. En tant que Nscaler, vous établirez la confiance par l'ouverture et la transparence tout en contribuant à la technologie qui alimente l'avenir.
À PROPOS DU POSTE
En tant qu'Ingénieur Plateforme d'Observabilité Staff, vous jouerez un rôle essentiel dans la construction et l'évolution de la plateforme d'observabilité de Nscale, permettant une visibilité approfondie sur les clusters GPU, les charges de travail IA et l'infrastructure qui les alimente. Vous considérez l'observabilité comme un produit, pas simplement une collection d'outils. Vous aiderez à définir et à mettre en œuvre des solutions d'observabilité évolutives et fiables qui permettent aux équipes d'ingénierie de comprendre le comportement du système, de diagnostiquer rapidement les problèmes et d'exploiter des systèmes distribués complexes en toute confiance. Vous combinerez leadership technique et ingénierie pratique, en collaborant avec les équipes SRE, infrastructure, plateforme et IA/ML pour améliorer la fiabilité, l'efficacité opérationnelle et l'expérience développeur. Vous influencerez les décisions architecturales, établirez les meilleures pratiques d'ingénierie et aiderez à piloter l'évolution des capacités d'observabilité au sein de l'organisation. C'est un poste pour quelqu'un qui aime résoudre des problèmes d'infrastructure difficiles, construire des plateformes évolutives et aider les équipes d'ingénierie à réussir grâce à une meilleure visibilité et une meilleure compréhension opérationnelle.
CE QUE VOUS FEREZ
- Concevoir, construire et faire évoluer les plateformes d'observabilité (métriques, logs, traces, alertes et pipelines de télémétrie).
- Diriger la mise en œuvre de solutions d'observabilité évolutives qui prennent en charge l'infrastructure GPU et IA croissante de Nscale.
- Collaborer avec les équipes SRE, infrastructure, plateforme et IA/ML pour garantir que l'observabilité est intégrée tout au long du cycle de vie du logiciel et de l'infrastructure.
- Piloter les améliorations de la couverture de surveillance, de la qualité des alertes, de la visibilité de l'état des services et de l'efficacité de la réponse aux incidents.
- Développer des normes, des cadres et des modèles réutilisables qui simplifient l'adoption de l'observabilité par les équipes d'ingénierie.
- Identifier les risques de fiabilité et les angles morts opérationnels, en aidant les équipes à les résoudre de manière proactive avant qu'ils n'affectent les clients.
- Contribuer aux décisions architecturales concernant la collecte de télémétrie, le stockage, la rétention, la gestion de la cardinalité et l'optimisation des performances.
- Diriger des initiatives et des projets techniques qui améliorent l'évolutivité, la fiabilité et l'efficacité opérationnelle de la plateforme.
- Mentorer les ingénieurs et fournir des conseils techniques par le biais de revues de conception, de revues de code et de partage de connaissances.
- Participer aux enquêtes sur les incidents et aux post-mortems, en traduisant les apprentissages opérationnels en améliorations durables de la plateforme.
- Évaluer les nouvelles technologies et pratiques d'observabilité, en équilibrant l'innovation avec la simplicité opérationnelle et la maintenabilité à long terme.
PROFIL RECHERCHÉ
- 6+ années d'expérience en SRE, ingénierie de plateforme, ingénierie d'infrastructure, ingénierie d'observabilité ou disciplines connexes.
- Solide expérience dans la construction et l'exploitation de plateformes d'observabilité dans des environnements cloud natifs et distribués.
- Expérience pratique approfondie avec plusieurs des technologies suivantes : Prometheus, Thanos, VictoriaMetrics, Grafana, Loki, Tempo, OpenTelemetry, ClickHouse, Elastic, ou des plateformes similaires.
- Solides compétences en ingénierie logicielle avec une maîtrise de Go, Python, ou des langages équivalents.
- Expérience dans l'exploitation et le dépannage de plateformes basées sur Kubernetes à grande échelle.
- Compréhension approfondie de la surveillance, de la journalisation, du traçage, des pipelines de télémétrie et des pratiques modernes d'observabilité.
- Expérience dans la conception de systèmes en tenant compte de l'évolutivité, de la fiabilité, des performances et de la simplicité opérationnelle.
- Maîtrise des outils d'Infrastructure-as-Code tels que Terraform, Ansible, ou équivalents.
- Capacité à diriger des initiatives techniques et à influencer les décisions d'ingénierie dans plusieurs équipes.
- Excellentes compétences en communication avec la capacité d'expliquer les compromis techniques et d'aligner les parties prenantes sur des solutions pragmatiques.
PRÉFÉRENCES
- Expérience dans l'exploitation de systèmes d'observabilité dans des environnements GPU, IA/ML, HPC ou de calcul à grande échelle.
- Familiarité avec Slurm, la planification GPU Kubernetes, ou les plateformes d'infrastructure IA.
- Expérience avec des pipelines de télémétrie à haut volume et des technologies de streaming telles que Kafka, Vector ou Fluent Bit.
- Connaissance des défis d'observabilité liés à l'entraînement de modèles, aux charges de travail d'inférence, à l'utilisation des GPU et aux systèmes IA distribués.
- Expérience dans le mentorat d'ingénieurs et l'aide au développement des capacités techniques au sein des équipes.
DÉCLARATION SUR L'ÉGALITÉ DES CHANCES
Nous encourageons vivement les candidatures des personnes de couleur, de la communauté LGBTQ+, des personnes handicapées, des personnes neurodivergentes, des parents, des aidants et des personnes issues de milieux socio-économiques moins avantagés.
S'il y a quoi que ce soit que nous puissions faire pour répondre à votre situation spécifique, veuillez nous le faire savoir.
Remarque : Les responsabilités décrites ne sont pas exhaustives et peuvent évoluer selon les besoins de l'entreprise.
Pour plus d'informations sur la manière dont Nscale traite les données personnelles des candidats, veuillez consulter notre Avis de confidentialité pour les employés et les candidats : Ici. drive.google.com/file/d/1QK5Yg04WHD9K9IAtJgQWubJZC9oLvatK/view?usp=sharing
Nscale n'accepte pas les soumissions de candidats non sollicitées de la part des agences de recrutement.
La fourchette ci-dessous reflète le salaire de base pour le poste. La rémunération réelle peut varier en fonction de facteurs liés au poste tels que les compétences, l'expérience, la formation et la localisation. En plus du salaire de base, ce poste peut être éligible à des programmes de bonus, d'actions et/ou de commission. Nscale peut offrir un ensemble d'avantages concurrentiels, comprenant une couverture médicale, dentaire, optique, des congés payés flexibles, un congé parental et la participation à un régime de retraite.
Fourchette de salaire
$190,000—$260,000 USD
