Cadence Design Systems

Architecte TI Senior

PythonGCPDockerKubernetes
Traduction automatique. Consultez l’original.

À propos du poste

CHEZ CADENCE, NOUS RECRUTONS ET DÉVELOPPONS DES LEADERS ET DES INNOVATEURS QUI VEULENT AVOIR UN IMPACT SUR LE MONDE DE LA TECHNOLOGIE.

Nous recherchons un Ingénieur Systèmes IA hautement qualifié et expérimenté pour rejoindre notre équipe. Il s'agit d'un rôle concret de contributeur individuel senior qui sera essentiel pour diriger le développement, les opérations et le support de notre infrastructure IA complète. Vous serez responsable de l'ensemble du cycle de vie de nos systèmes IA, de l'architecture et de la construction de clusters GPU haute performance au déploiement et à l'optimisation de nos modèles IA et services d'agents les plus avancés.

NOUS FAISONS UN TRAVAIL QUI COMPTE. AIDEZ-NOUS À RÉSOUDRE CE QUE D'AUTRES NE PEUVENT PAS.

Responsabilités

  1. Architecture et Stratégie d'Infrastructure IA : Diriger la conception et la mise en œuvre de notre infrastructure IA de nouvelle génération pour soutenir nos initiatives d'IA Agentique. Vous définirez la stratégie technique de nos clusters GPU sur site, de nos solutions de stockage et de notre réseau pour garantir des performances optimales, une évolutivité et une fiabilité pour toutes nos charges de travail IA.
  1. Intégration des Services IA Cloud : Soutenir et sécuriser l'utilisation des services IA cloud publics, y compris les services Azure OpenAI et les services de la plateforme Google Cloud (GCP) tels que Gemini. Cela inclut la gestion de l'accès sécurisé, le suivi de l'utilisation et la facturation pour garantir la rentabilité. Vous aurez également une expérience pratique du support du calcul, des GPU et des services IA sur GCP et Azure.
  1. Gestion pratique des clusters GPU : Jouer un rôle de leader dans la configuration, l'installation et l'optimisation des clusters de serveurs GPU. Cela comprend le dépannage avancé du matériel et des logiciels, l'optimisation des performances et la mise en œuvre des meilleures pratiques pour l'utilisation des clusters et la gestion des ressources. Vous serez un expert dans l'administration des planificateurs de tâches tels que LSF dans un environnement de production, y compris l'intégration avec Docker pour la soumission de tâches conteneurisées.
  1. Développement et Opérations de la Pile Technologique IA Full-Stack : Concevoir et déployer une pile technologique IA robuste et évolutive. Vous serez responsable du cycle de vie opérationnel de bout en bout, y compris la configuration et la gestion des frameworks de deep learning (PyTorch, TensorFlow), la conteneurisation avec Docker et Kubernetes, et la mise en œuvre de pipelines CI/CD pour le développement de modèles IA.
  1. Déploiement et Optimisation avancés de LLM : Diriger le déploiement, le service et l'optimisation des grands modèles de langage (LLMs). Vous serez un expert des techniques telles que la quantification de modèles, la distillation et l'utilisation de frameworks de service haute performance (par exemple, vLLM, TGI, TensorRT-LLM) pour maximiser le débit d'inférence et minimiser la latence.
  1. Ingénierie des Flux de Travail et Services IA Agentiques : Concevoir et construire des flux de travail et services IA Agentiques de qualité production. Vous serez responsable de la conception technique et de la mise en œuvre de systèmes qui intègrent les LLMs avec des outils externes, des APIs et des bases de données, et vous encadrerez d'autres ingénieurs dans la construction d'applications d'agents IA robustes et évolutives.
  1. Automatisation et Surveillance : Développer et maintenir des scripts d'automatisation à l'aide de langages tels que Python, Bash ou Perl pour rationaliser la maintenance des systèmes, le déploiement et le reporting. Mettre en œuvre et gérer des solutions de surveillance pour la santé du système, les statuts des tâches, l'utilisation des GPU et les performances des conteneurs afin d'identifier et de résoudre proactivement les problèmes.
  1. Support et Mentorat des Systèmes IA : Agir comme dernier point d'escalade pour les problèmes techniques les plus complexes liés à notre infrastructure IA. Vous servirez également de leader technique et de mentor pour les autres ingénieurs, en fournissant des conseils sur les meilleures pratiques en matière d'ingénierie des systèmes IA, d'optimisation des performances et d'excellence opérationnelle.
  1. Sécurité et Conformité : Développer et mettre en œuvre les meilleures pratiques de sécurité pour nos systèmes et données IA, en garantissant la conformité avec les réglementations pertinentes et en protégeant notre propriété intellectuelle.

Compétences et Qualifications Requises

  1. 12+ années d'expérience dans un rôle technique senior, dont au moins 5 années axées sur la construction et l'exploitation d'une infrastructure informatique haute performance ou IA. Expérience avérée en tant qu'Ingénieur Principal ou Senior Staff.
  1. Connaissance experte de l'architecture GPU NVIDIA et des technologies telles que CUDA et cuDNN. Expérience approfondie de l'entraînement et de l'inférence multi-GPU et multi-nœuds.
  1. Expérience avérée avec les services IA cloud publics, en particulier la gestion de l'accès, de l'utilisation et de la facturation pour les services Azure OpenAI et la plateforme Google Cloud (GCP).
  1. Expérience pratique approfondie avec Docker : gestion des images, orchestration de conteneurs et dépannages.
  1. Maîtrise des langages de script tels que Python, Bash ou Perl.
  1. Expertise approfondie en administration système Linux (RHEL de préférence), y compris le réseau, le stockage et l'optimisation des performances.
  1. Familiarité avec l'authentification utilisateur et l'intégration à l'aide de systèmes tels que LDAP ou Active Directory.
  1. Solides compétences en résolution de problèmes et en communication, avec la capacité de travailler dans une équipe multiplateforme, interfonctionnelle et géographiquement distribuée.

Compétences Bonus/Préférées

  1. Compréhension du profilage et de l'optimisation des tâches IA (mémoire, GPU, I/O).
  1. Expérience dans l'administration de clusters LSF dans un environnement de production ou de recherche. La familiarité avec d'autres planificateurs de tâches comme Slurm est un plus.
  1. Expérience avec l'intégration LSF Docker et la soumission de tâches à l'aide d'images conteneurisées.
  1. Expérience avec les tâches d'administration système macOS/AppleSilicon et le dépannage.

La fourchette de salaire annuel pour la Californie est de $168,000 à $312,000. Vous pourriez également être éligible à une rémunération incitative : bonus, actions et avantages sociaux. Les postes de vente offrent généralement une structure de rémunération incitative compétitive sur la base des objectifs fixés (OTE). Veuillez noter que la fourchette de salaire est indicative et que la rémunération peut varier en fonction de facteurs tels que les qualifications, le niveau de compétence, les compétences et le lieu de travail.

Nos programmes d'avantages sociaux comprennent : des congés payés et des jours fériés payés, un plan 401(k) avec abondement de l'employeur, un plan d'achat d'actions pour les employés, une variété d'options de plans médicaux, dentaires et de vision, et plus encore.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter