Roku
TensorWave
Ingénieur Infrastructure Senior Staff – Plateforme Kubernetes
À propos
TensorWave
Notre mission est simple : fournir une puissance de calcul IA transparente, sécurisée, fiable et résiliente à grande échelle. Nous avons construit une plateforme cloud polyvalente qui élimine les barrières d'infrastructure, permettant aux développeurs de se concentrer sur l'innovation plutôt que de lutter contre leur stack. Parce que l'IA de rupture doit avancer à la vitesse des idées, pas de l'infrastructure.
À propos du
Rôle Nous recherchons un Ingénieur Infrastructure Staff spécialisé dans les plateformes Kubernetes pour rejoindre notre équipe durant une phase de croissance passionnante. Dans ce rôle, vous serez responsable de la conception, de l'évolution et de la fiabilité opérationnelle de notre architecture de plan de contrôle Kubernetes, en travaillant en étroite collaboration avec des partenaires interfonctionnels pour soutenir les objectifs commerciaux tout en respectant nos normes d'excellence, de collaboration et d'impact.
Ce que vous ferez
Architecture et stratégie de la plateforme
- Concevoir et faire évoluer l'architecture du plan de contrôle Kubernetes à travers les régions
- Définir et implémenter des modèles de clusters multi-locataires, y compris des plans de contrôle partagés, des approches de clusters virtuels (par exemple, vcluster, Kamaji)
- Piloter la transition des clusters autonomes vers des modèles de plateformes gérés régionalement
- Définir les normes pour les limites d'isolation, la segmentation des ressources, l'application des politiques
Propriété et exploitation de la plateforme
- Être responsable de la fiabilité et du comportement des plateformes Kubernetes en production
- Participer à la rotation des gardes et diriger la réponse aux incidents
- Diagnostiquer et résoudre l'instabilité du plan de contrôle, la saturation du serveur API, les problèmes de planification et de contention de ressources
- Assurer une gestion cohérente du cycle de vie entre les clusters - provisionnement, mises à niveau, mise à l'échelle
Mise à l'échelle multi-régions
- Concevoir et mettre en œuvre des stratégies de mise à l'échelle régionale, de déploiements de clusters multi-centres de données
- Assurer un comportement et une fiabilité cohérents entre les environnements
- Définir la topologie des clusters et les stratégies de domaines de défaillance
Intégration réseau et plan de données
- Concevoir des architectures d'entrée et de sortie au niveau du cluster et au niveau régional
- Dépanner et optimiser le réseau pod-à-pod, les flux de trafic nord-sud, le comportement du CNI (Cilium de préférence)
- Collaborer avec l'ingénierie réseau sur l'intégration réseau haute performance
Observabilité et fiabilité
- Améliorer l'observabilité des composants du plan de contrôle, de la santé et des performances du cluster
- Définir et mettre en œuvre des stratégies de résilience alignées sur les objectifs de la plateforme
- Diriger l'analyse des causes profondes des incidents de production
Collaboration inter-équipes
- Travailler en étroite collaboration avec les ingénieurs DevOps (automatisation et CI/CD) et les équipes d'infrastructure (calcul, stockage, réseau)
- Aligner la conception de la plateforme Kubernetes avec les capacités d'infrastructure sous-jacentes
Qui vous êtes
Qualifications requises
- 7+ années d'expérience en infrastructure, ingénierie de plateforme ou systèmes distribués
- Expérience approfondie dans l'exploitation de Kubernetes à grande échelle dans des environnements de production
- Expérience dans un CSP, un hyperscaler ou un environnement équivalent à grande échelle fortement préférée
- Expérience avérée dans la mise à l'échelle de Kubernetes sur :
- Plusieurs clusters
- Plusieurs régions ou centres de données
- Solide compréhension des internes de Kubernetes :
- Serveur API
- Ordonnanceur
- Gestionnaire de contrôleurs
- etcd
- Expérience dans la conception ou l'évolution de :
- Architectures de plan de contrôle
- Modèles de clusters multi-locataires
Profondeur technique
- Solide expertise des systèmes Linux
- Capacité de dépannage approfondie sur :
- Kubernetes
- Runtime de conteneur
- Pile réseau
- Expérience avec les plugins CNI (Cilium de préférence)
- Solide compréhension de :
- Réseaux et modèles de trafic
- Isolation des ressources et planification
Qualifications préférées
- Expérience avec les technologies de clusters virtuels (vcluster, Kamaji ou similaire)
- Expérience dans le support des charges de travail GPU dans Kubernetes
- Connaissance de :
- Planification consciente de NUMA
- Charges de travail conscientes de la topologie
- Connaissance de RDMA et des environnements réseau à haut débit
- Expérience avec les plateformes d'observabilité (Prometheus, Grafana, etc.)
Ce que nous offrons
- Options d'achat d'actions
- Assurance médicale, dentaire et vision payée à 100%% pour les employés
- Contributions de l'entreprise au compte d'épargne santé
- Assurance invalidité de courte et longue durée payée à 100%% pour les employés
- Options d'assurance vie et d'assurance complémentaire volontaire
- Autres options d'assurance, telles que l'assurance animaux de compagnie et juridique
- Divers avantages de santé supplémentaires, tels que des rendez-vous de télémédecine virtuels à prix réduit et un soutien en cas de maladie grave
- Compte de dépenses flexibles
- 401(k)
- Programme d'aide aux employés
- Congés payés flexibles
- Jours fériés payés
- Congé parental
- Autres avantages sur site
Égalité des chances en matière d'emploi
TensorWave est un employeur garantissant l'égalité des chances. Nous célébrons la diversité et nous nous engageons à créer un environnement inclusif pour tous les employés. Nous ne faisons aucune discrimination fondée sur un statut protégé en vertu de la loi applicable.
Accommodements raisonnables
TensorWave fournit des aménagements raisonnables conformément aux lois applicables. Si vous avez besoin d'un aménagement pendant le processus d'embauche, veuillez contacter [email protected].
Éligibilité à l'emploi
Toutes les offres d'emploi sont conditionnelles à la vérification de l'identité et de l'autorisation de travailler aux États-Unis, comme requis par la loi.
Vérifications des antécédents
Lorsque la loi le permet, l'emploi peut être conditionné à la réussite d'une vérification des antécédents liée au poste.
Avis de confidentialité des données
En soumettant une candidature, vous reconnaissez que TensorWave peut collecter, utiliser et conserver vos informations personnelles à des fins de recrutement et d'emploi conformément aux lois applicables en matière de confidentialité des données.
