TensorWave

Ingénieur Infrastructure Senior Staff – Plateforme Kubernetes

Kubernetes
Traduction automatique. Consultez l’original.

À propos

TensorWave

Notre mission est simple : fournir une puissance de calcul IA transparente, sécurisée, fiable et résiliente à grande échelle. Nous avons construit une plateforme cloud polyvalente qui élimine les barrières d'infrastructure, permettant aux développeurs de se concentrer sur l'innovation plutôt que de lutter contre leur stack. Parce que l'IA de rupture doit avancer à la vitesse des idées, pas de l'infrastructure.

À propos du

Rôle Nous recherchons un Ingénieur Infrastructure Staff spécialisé dans les plateformes Kubernetes pour rejoindre notre équipe durant une phase de croissance passionnante. Dans ce rôle, vous serez responsable de la conception, de l'évolution et de la fiabilité opérationnelle de notre architecture de plan de contrôle Kubernetes, en travaillant en étroite collaboration avec des partenaires interfonctionnels pour soutenir les objectifs commerciaux tout en respectant nos normes d'excellence, de collaboration et d'impact.

Ce que vous ferez

Architecture et stratégie de la plateforme

  1. Concevoir et faire évoluer l'architecture du plan de contrôle Kubernetes à travers les régions
  1. Définir et implémenter des modèles de clusters multi-locataires, y compris des plans de contrôle partagés, des approches de clusters virtuels (par exemple, vcluster, Kamaji)
  1. Piloter la transition des clusters autonomes vers des modèles de plateformes gérés régionalement
  1. Définir les normes pour les limites d'isolation, la segmentation des ressources, l'application des politiques

Propriété et exploitation de la plateforme

  1. Être responsable de la fiabilité et du comportement des plateformes Kubernetes en production
  1. Participer à la rotation des gardes et diriger la réponse aux incidents
  1. Diagnostiquer et résoudre l'instabilité du plan de contrôle, la saturation du serveur API, les problèmes de planification et de contention de ressources
  1. Assurer une gestion cohérente du cycle de vie entre les clusters - provisionnement, mises à niveau, mise à l'échelle

Mise à l'échelle multi-régions

  1. Concevoir et mettre en œuvre des stratégies de mise à l'échelle régionale, de déploiements de clusters multi-centres de données
  1. Assurer un comportement et une fiabilité cohérents entre les environnements
  1. Définir la topologie des clusters et les stratégies de domaines de défaillance

Intégration réseau et plan de données

  1. Concevoir des architectures d'entrée et de sortie au niveau du cluster et au niveau régional
  1. Dépanner et optimiser le réseau pod-à-pod, les flux de trafic nord-sud, le comportement du CNI (Cilium de préférence)
  1. Collaborer avec l'ingénierie réseau sur l'intégration réseau haute performance

Observabilité et fiabilité

  1. Améliorer l'observabilité des composants du plan de contrôle, de la santé et des performances du cluster
  1. Définir et mettre en œuvre des stratégies de résilience alignées sur les objectifs de la plateforme
  1. Diriger l'analyse des causes profondes des incidents de production

Collaboration inter-équipes

  1. Travailler en étroite collaboration avec les ingénieurs DevOps (automatisation et CI/CD) et les équipes d'infrastructure (calcul, stockage, réseau)
  1. Aligner la conception de la plateforme Kubernetes avec les capacités d'infrastructure sous-jacentes

Qui vous êtes

Qualifications requises

  1. 7+ années d'expérience en infrastructure, ingénierie de plateforme ou systèmes distribués
  1. Expérience approfondie dans l'exploitation de Kubernetes à grande échelle dans des environnements de production
  1. Expérience dans un CSP, un hyperscaler ou un environnement équivalent à grande échelle fortement préférée
  1. Expérience avérée dans la mise à l'échelle de Kubernetes sur :
  1. Plusieurs clusters
  1. Plusieurs régions ou centres de données
  1. Solide compréhension des internes de Kubernetes :
  1. Serveur API
  1. Ordonnanceur
  1. Gestionnaire de contrôleurs
  1. etcd
  1. Expérience dans la conception ou l'évolution de :
  1. Architectures de plan de contrôle
  1. Modèles de clusters multi-locataires

Profondeur technique

  1. Solide expertise des systèmes Linux
  1. Capacité de dépannage approfondie sur :
  1. Kubernetes
  1. Runtime de conteneur
  1. Pile réseau
  1. Expérience avec les plugins CNI (Cilium de préférence)
  1. Solide compréhension de :
  1. Réseaux et modèles de trafic
  1. Isolation des ressources et planification

Qualifications préférées

  1. Expérience avec les technologies de clusters virtuels (vcluster, Kamaji ou similaire)
  1. Expérience dans le support des charges de travail GPU dans Kubernetes
  1. Connaissance de :
  1. Planification consciente de NUMA
  1. Charges de travail conscientes de la topologie
  1. Connaissance de RDMA et des environnements réseau à haut débit
  1. Expérience avec les plateformes d'observabilité (Prometheus, Grafana, etc.)

Ce que nous offrons

  • Options d'achat d'actions
  • Assurance médicale, dentaire et vision payée à 100%% pour les employés
  • Contributions de l'entreprise au compte d'épargne santé
  • Assurance invalidité de courte et longue durée payée à 100%% pour les employés
  • Options d'assurance vie et d'assurance complémentaire volontaire
  • Autres options d'assurance, telles que l'assurance animaux de compagnie et juridique
  • Divers avantages de santé supplémentaires, tels que des rendez-vous de télémédecine virtuels à prix réduit et un soutien en cas de maladie grave
  • Compte de dépenses flexibles
  • 401(k)
  • Programme d'aide aux employés
  • Congés payés flexibles
  • Jours fériés payés
  • Congé parental
  • Autres avantages sur site

Égalité des chances en matière d'emploi

TensorWave est un employeur garantissant l'égalité des chances. Nous célébrons la diversité et nous nous engageons à créer un environnement inclusif pour tous les employés. Nous ne faisons aucune discrimination fondée sur un statut protégé en vertu de la loi applicable.

Accommodements raisonnables

TensorWave fournit des aménagements raisonnables conformément aux lois applicables. Si vous avez besoin d'un aménagement pendant le processus d'embauche, veuillez contacter [email protected].

Éligibilité à l'emploi

Toutes les offres d'emploi sont conditionnelles à la vérification de l'identité et de l'autorisation de travailler aux États-Unis, comme requis par la loi.

Vérifications des antécédents

Lorsque la loi le permet, l'emploi peut être conditionné à la réussite d'une vérification des antécédents liée au poste.

Avis de confidentialité des données

En soumettant une candidature, vous reconnaissez que TensorWave peut collecter, utiliser et conserver vos informations personnelles à des fins de recrutement et d'emploi conformément aux lois applicables en matière de confidentialité des données.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter