Oracle

Ingénieur Logiciel Principal Principal, Infrastructure de Base

JavaAWSGCPKubernetesGoTerraform
Traduction automatique. Consultez l’original.

À propos du poste

L'équipe Oracle Cloud Infrastructure (OCI) offre l'opportunité de construire et d'exploiter des services cloud intégrés à grande échelle dans un environnement cloud multi-locataire largement distribué. OCI construit des produits cloud pour les clients qui relèvent certains des plus grands défis techniques et commerciaux du monde.

Oracle Kubernetes Engine (OKE) est le service Kubernetes géré par OCI. OKE permet aux clients de créer, exécuter, faire évoluer, sécuriser et exploiter des clusters Kubernetes sur OCI, en intégrant Kubernetes avec le calcul, le réseau, le stockage, l'identité, l'observabilité, la sécurité et l'automatisation d'OCI. L'équipe OKE possède un service cloud hautement disponible 24x7 et étend la plateforme pour prendre en charge des clusters plus importants, une échelle plus élevée, une meilleure opérabilité, des intégrations OCI plus approfondies, et des charges de travail cloud natives, IA et GPU de plus en plus exigeantes.

Nous recherchons un ingénieur logiciel IC5 expérimenté avec une expertise approfondie en Kubernetes, une expérience requise en infrastructure cloud et une solide expérience en systèmes distribués. Il s'agit d'un rôle de leadership technique à fort impact pour un ingénieur capable de définir l'architecture, de piloter l'exécution inter-équipes, de résoudre des problèmes de production et de plateforme ambigus, et de livrer des systèmes durables qui améliorent l'expérience client et l'excellence opérationnelle.

Vous travaillerez sur les capacités de base de la plateforme OKE, y compris la gestion du cycle de vie des clusters, l'orchestration, la scalabilité, la fiabilité, les performances, l'automatisation, l'observabilité, la sécurité et l'intégration avec les services d'infrastructure OCI. Le candidat idéal possède une expérience pratique dans la conception, la construction, l'exploitation ou le débogage approfondi de services cloud de production, de plateformes d'infrastructure ou de systèmes basés sur Kubernetes à une échelle significative.

Ce rôle nécessite une expérience avancée de Kubernetes, y compris le comportement du plan de contrôle Kubernetes, les contrôleurs et opérateurs, la planification, la mise à l'échelle automatique, le réseau, le stockage, la découverte de services, les runtimes de conteneurs, le cycle de vie des nœuds, les Kubernetes APIs, et etcd. Une expérience avec les technologies réseau et de stockage Kubernetes telles que CNI, Cilium, Calico, Flannel, d'autres implémentations de réseau de conteneurs, les pilotes CSI et les intégrations de fournisseurs cloud est très pertinente.

OKE s'étend également pour prendre en charge des cas d'utilisation exigeants en IA et en calcul accéléré. Une expérience avec l'infrastructure IA/ML, les clusters GPU multi-nœuds, le calcul accéléré, les plateformes d'entraînement ou d'inférence de modèles, la planification GPU, les plugins de périphériques, Karpenter, la mise à l'échelle automatique des clusters, CUDA, NCCL, RoCE, InfiniBand, RDMA, la décharge SmartNIC/DPU, ou les réseaux IA/HPC haute performance est un plus significatif.

Ce rôle nécessite également un ingénieur prêt à utiliser de manière responsable les pratiques d'ingénierie agentiques modernes. Nous attendons des ingénieurs expérimentés qu'ils appliquent des flux de travail assistés par IA et agentiques pour accélérer l'exploration de conception, l'implémentation, les tests, le débogage, la documentation, l'analyse opérationnelle et la productivité des développeurs, tout en maintenant une forte responsabilité, un jugement en matière de sécurité, une qualité de code et une responsabilité de production.

Responsabilités

En tant que membre de la division d'ingénierie logicielle, vous jouerez un rôle actif dans la définition et l'évolution des pratiques et procédures standard. Vous définirez les spécifications pour des projets majeurs et spécifierez, concevrez, développerez, dépannerez et déboguerez des logiciels pour le service Kubernetes géré par OCI.

Les responsabilités incluent :

  1. Fournir un leadership technique pour les initiatives majeures de la plateforme OKE, de l'architecture à l'exploitation en production.
  1. Concevoir et construire des systèmes distribués qui créent, mettent à jour, font évoluer, réparent et exploitent des clusters Kubernetes dans les régions OCI.
  1. Améliorer la fiabilité, la scalabilité, les performances, la sécurité des mises à niveau, la gestion du cycle de vie, l'observabilité, l'automatisation et les outils opérationnels d'OKE.
  1. Travailler en profondeur avec les technologies Kubernetes, y compris les composants du plan de contrôle, les contrôleurs/opérateurs, la planification, la mise à l'échelle automatique, les Kubernetes APIs, les runtimes de conteneurs, le comportement des nœuds et etcd.
  1. Concevoir, déboguer et améliorer les intégrations réseau et de stockage Kubernetes, y compris le réseau basé sur CNI, Cilium, Calico, Flannel, d'autres implémentations de réseau de conteneurs, les pilotes CSI et les intégrations d'infrastructure OCI.
  1. Construire une automatisation pour la validation des clusters, les vérifications de santé, les tests de préparation, la détection des pannes, la récupération à distance et la réduction des problèmes opérationnels post-déploiement.
  1. Diriger les revues de conception technique, les revues de code, les revues d'incidents et les revues de préparation à la production pour les changements de service complexes.
  1. Déboguer des problèmes de production difficiles à travers les limites des services, y compris Kubernetes, Linux, le réseau, le calcul, le stockage, l'identité, la télémétrie et les dépendances d'infrastructure OCI.
  1. Appliquer des pratiques d'ingénierie des performances, y compris le profilage, le traçage, l'analyse de latence, l'optimisation du débit et le diagnostic de production à travers les systèmes distribués.
  1. Construire une automatisation qui réduit les opérations manuelles, améliore la santé de la flotte, accélère le diagnostic et élève la barre de qualité pour l'ingénierie OKE.
  1. Collaborer avec les équipes de services OCI pour fournir des capacités de plateforme de bout en bout, quelles que soient les frontières organisationnelles.
  1. Appliquer des flux de travail d'ingénierie assistés par IA et agentiques pour améliorer la vélocité d'ingénierie, la couverture des tests, le débogage, l'analyse opérationnelle et la documentation, tout en garantissant la correction, la sécurité et la maintenabilité.
  1. Mentorer les ingénieurs, influencer la direction technique et aider à établir des modèles qui s'étendent à l'organisation OKE.
  1. Participer à l'exploitation d'un service cloud 24x7 et utiliser les retours clients, les données de production et l'expérience opérationnelle pour prioriser les améliorations.

Qualifications requises

  1. 10+ années d'expérience en ingénierie logicielle, ou expérience équivalente dans la construction et l'exploitation de systèmes logiciels de production.
  1. Une expérience pratique de l'infrastructure cloud est requise, idéalement dans la conception, la construction, l'exploitation ou le débogage de services ou de plateformes de production sur OCI, AWS, Azure, GCP, ou un cloud privé à grande échelle.
  1. Une solide expertise pratique de Kubernetes est requise, y compris l'architecture Kubernetes, les APIs, le comportement du plan de contrôle, les contrôleurs/opérateurs, la planification, la mise à l'échelle automatique, le réseau, le stockage, les nœuds, la gestion du cycle de vie des clusters ou l'exploitation de clusters de production.
  1. Connaissances avancées de Kubernetes, y compris CNI, CSI, etcd, découverte de services, runtimes de conteneurs, cycle de vie des nœuds et modes de défaillance de Kubernetes.
  1. Expérience avec les technologies réseau Kubernetes telles que Cilium, Calico, Flannel, ou d'autres implémentations CNI.
  1. Expérience avec les intégrations de stockage Kubernetes, y compris les pilotes CSI ou les intégrations de stockage cloud.
  1. Solides fondamentaux des systèmes distribués, y compris la disponibilité, la gestion des pannes, les performances, la scalabilité et les compromis opérationnels.
  1. Expérience dans la construction de services d'infrastructure hautement disponibles, de services de plateforme ou de systèmes cloud natifs utilisés en production.
  1. Une solide expérience de développement à la fois en Go/Golang et en Java est requise.
  1. Solides compétences en Linux, réseau, débogage et exploitation de production.
  1. Capacité démontrée à diriger des projets techniques ambigus, à influencer les équipes et à livrer par l'intermédiaire d'autres ingénieurs sans s'appuyer sur l'autorité formelle.
  1. Solides compétences en communication, sens de la responsabilité, jugement et capacité à faire des compromis pragmatiques dans les systèmes de production.

Qualifications préférées

  1. Expérience avec l'infrastructure IA/ML, les charges de travail GPU, les clusters GPU multi-nœuds, le calcul accéléré, les plateformes d'entraînement ou d'inférence de modèles, la planification GPU, les plugins de périphériques, Karpenter, la mise à l'échelle automatique des clusters, CUDA, NCCL, les réseaux haute performance ou les systèmes d'entraînement distribués.
  1. Expérience avec les réseaux basés sur eBPF, la politique réseau Kubernetes, le service mesh, l'ingress, l'équilibrage de charge, les overlays/underlays, BGP, VXLAN, la décharge SmartNIC/DPU, RoCE, InfiniBand, RDMA, ou les réseaux multi-clusters.
  1. Expérience avec l'infrastructure en tant que code et les outils de provisionnement cloud tels que Terraform, Packer, cloud-init, IAM, le réseau VCN/VPC, VPN, FastConnect/Direct Connect, ou les primitives cloud équivalentes.
  1. Expérience dans la création de flux de travail d'ingénierie assistés par IA et agentiques pour la productivité des développeurs, l'automatisation opérationnelle ou responsable.
  1. Expérience avec les systèmes d'observabilité, la réponse aux incidents, les pratiques de déploiement sécurisées, l'analyse canary, les stratégies de rollback, l'automatisation de la santé des services et l'exploitation de grandes flottes.
  1. Expérience de contribution open-source ou upstream dans Kubernetes, l'infrastructure cloud native, l'observabilité, le réseau, ou les systèmes associés.

Autres qualifications

Avis de non-responsabilité :

Certains postes basés aux États-Unis ou orientés client/client américain peuvent être tenus de se conformer aux exigences applicables, telles que les mandats de vaccination/santé au travail, et/ou les exigences de dépistage de drogues.

Les informations sur la fourchette de salaire et les avantages sociaux fournies dans cette annonce sont spécifiques aux emplacements indiqués uniquement.

US : Fourchette de salaire d'embauche en USD de : $135,200 à $306,400 par an. Peut être éligible à une prime, des actions et un report de rémunération.

Oracle maintient de larges fourchettes salariales pour ses postes afin de tenir compte des variations de connaissances, de compétences, d'expérience, des conditions du marché et des lieux, ainsi que pour refléter les différents produits, industries et secteurs d'activité de Oracle.

Les candidats sont généralement placés dans la fourchette en fonction des facteurs précédents ainsi que de l'équité interne entre pairs.

Le poste acceptera généralement les candidatures pendant au moins trois jours civils à compter de la date de publication ou tant que le poste restera affiché.

Niveau de carrière - IC5

Nous nous engageons à inclure les personnes handicapées à toutes les étapes du processus d'emploi. Si vous avez besoin d'une assistance en matière d'accessibilité ou d'un aménagement pour un handicap à tout moment, faites-le nous savoir en envoyant un e-mail à [email protected] ou en appelant le 1-888-404-2494 aux États-Unis.

Oracle est un employeur garantissant l'égalité des chances en matière d'emploi. Tous les candidats qualifiés recevront une considération pour l'emploi sans distinction de race, de couleur, de religion, de sexe, d'origine nationale, d'orientation sexuelle, d'identité de genre, de handicap et de statut de vétéran protégé, ou de toute autre caractéristique protégée par la loi. Oracle examinera pour l'emploi les candidats qualifiés ayant des antécédents d'arrestation et de condamnation conformément à la loi applicable.

Oracle US propose un ensemble complet d'avantages sociaux qui comprend les éléments suivants :

  • Assurance médicale, dentaire et optique, y compris un avis médical d'expert.
  • Assurance invalidité de courte et longue durée.
  • Assurance vie et assurance décès et mutilation accidentels.
  • Assurance vie supplémentaire (Employé/Conjoint/Enfant).
  • Comptes d'épargne flexibles pour les frais de soins de santé et de dépendants.
  • Avantages pré-imposition pour les transports et le stationnement.
  • Plan d'épargne et d'investissement 401(k) avec contribution de l'employeur.
  • Congés payés : des vacances flexibles sont offertes à tous les employés éligibles affectés à un poste salarié (non éligible aux heures supplémentaires). Les vacances accumulées sont fournies à tous les autres employés éligibles aux avantages de vacances. Pour les employés travaillant au moins 35 heures par semaine, le taux d'accumulation des vacances est de 13 jours par an pour les trois premières années d'emploi et de 18 jours par an pour les années suivantes. L'accumulation des vacances est calculée au prorata pour les employés travaillant entre 20 et 34 heures par semaine. Les employés travaillant moins de 20 heures par semaine ne sont pas éligibles aux vacances.
  • 11 jours fériés payés.
  • Congés maladie payés : 72 heures de congés maladie payés à la date d'embauche. Se renouvelle chaque année civile. Le solde non utilisé sera reporté chaque année jusqu'à un maximum de 112 heures.
  • Congés parentaux payés.
  • Aide à l'adoption.
  • Plan d'achat d'actions pour les employés.
  • Planification financière et services juridiques de groupe.
  • Avantages volontaires incluant l'assurance automobile, habitation et animaux de compagnie.

Seul Oracle rassemble les données, l'infrastructure, les applications et l'expertise nécessaires pour alimenter tout, des innovations industrielles aux soins qui sauvent des vies. Et avec l'IA intégrée dans nos produits et services, nous aidons les clients à transformer cette promesse en un avenir meilleur pour tous. Découvrez votre potentiel dans une entreprise leader dans les solutions d'IA et de cloud qui ont un impact sur des milliards de vies.

La véritable innovation commence lorsque chacun est habilité à contribuer. C'est pourquoi nous nous engageons à développer une main-d'œuvre qui promeut des opportunités pour tous, avec des avantages compétitifs qui soutiennent nos employés avec des options flexibles en matière d'assurance médicale, de vie et de retraite. Nous encourageons également les employés à redonner à leurs communautés par le biais de nos programmes de bénévolat.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter