Cadence Design Systems

Arquiteto(a) Sênior de TI

PythonGCPDockerKubernetes
Tradução automática. Consulte o original.

Sobre a oportunidade

NA CADENCE, CONTRATAMOS E DESENVOLVEMOS LÍDERES E INOVADORES QUE QUEREM CAUSAR UM IMPACTO NO MUNDO DA TECNOLOGIA.

Estamos buscando um(a) Engenheiro(a) de Sistemas de IA altamente qualificado(a) e experiente para se juntar à nossa equipe. Esta é uma função prática de contribuidor individual sênior que será fundamental para liderar o desenvolvimento, as operações e o suporte de toda a nossa infraestrutura de IA. Você será responsável por todo o ciclo de vida de nossos sistemas de IA, desde a arquitetura e construção de clusters de GPU de alto desempenho até a implantação e otimização de nossos modelos de IA mais avançados e serviços de agente.

ESTAMOS FAZENDO UM TRABALHO QUE IMPORTA. AJUDE-NOS A RESOLVER O QUE OUTROS NÃO PODEM.

Responsabilidades

  1. Arquitetura e Estratégia de Infraestrutura de IA: Liderar o projeto e a implementação de nossa infraestrutura de IA de próxima geração para suportar nossas iniciativas de IA de Agente. Você definirá a estratégia técnica para nossos clusters de GPU on-premise, soluções de armazenamento e rede para garantir desempenho ideal, escalabilidade e confiabilidade para todas as nossas cargas de trabalho de IA.
  1. Integração de Serviços de IA na Nuvem: Suportar e proteger o uso de serviços de IA na nuvem pública, incluindo serviços Azure OpenAI e serviços da Plataforma Google Cloud (GCP) como Gemini. Isso inclui gerenciar acesso seguro, monitorar o uso e rastrear faturamento para garantir a relação custo-benefício. Você também terá experiência prática no suporte a computação, GPUs e serviços de IA tanto em GCP quanto em Azure.
  1. Gerenciamento Prático de Clusters de GPU: Assumir um papel de liderança na configuração, instalação e otimização de clusters de servidores GPU. Isso inclui solução avançada de problemas de hardware e software, ajuste de desempenho e implementação de melhores práticas para utilização de cluster e gerenciamento de recursos. Você será um especialista em administrar agendadores de jobs como LSF em um ambiente de produção, incluindo integração com Docker para submissão de jobs em contêineres.
  1. Desenvolvimento e Operações de Stack de Tecnologia de IA Full-Stack: Projetar e implantar uma stack de tecnologia de IA robusta e escalável. Você será responsável pelo ciclo de vida operacional de ponta a ponta, incluindo configuração e gerenciamento de frameworks de deep learning (PyTorch, TensorFlow), contêinerização com Docker e Kubernetes, e implementação de pipelines de CI/CD para desenvolvimento de modelos de IA.
  1. Implantação e Otimização Avançada de LLM: Liderar a implantação, o serviço e a otimização de Modelos de Linguagem Grandes (LLMs). Você será um especialista em técnicas como quantização de modelos, destilação e uso de frameworks de serviço de alto desempenho (por exemplo, vLLM, TGI, TensorRT-LLM) para maximizar a taxa de transferência de inferência e minimizar a latência.
  1. Engenharia de Fluxos de Trabalho e Serviços de IA de Agente: Projetar e construir fluxos de trabalho e serviços de IA de Agente de nível de produção. Você será responsável pelo projeto técnico e implementação de sistemas que integram LLMs com ferramentas externas, APIs e bancos de dados, e orientará outros engenheiros na construção de aplicações de agente de IA robustas e escaláveis.
  1. Automação e Monitoramento: Desenvolver e manter scripts de automação usando linguagens como Python, Bash ou Perl para otimizar a manutenção do sistema, implantação e relatórios. Implementar e gerenciar soluções de monitoramento para saúde do sistema, status de jobs, utilização de GPU e desempenho de contêineres para identificar e resolver problemas proativamente.
  1. Suporte e Mentoria de Sistemas de IA: Atuar como ponto final de escalonamento para os problemas técnicos mais complexos relacionados à nossa infraestrutura de IA. Você também servirá como líder técnico e mentor para outros engenheiros, fornecendo orientação sobre melhores práticas em engenharia de sistemas de IA, ajuste de desempenho e excelência operacional.
  1. Segurança e Conformidade: Desenvolver e implementar melhores práticas de segurança para nossos sistemas e dados de IA, garantindo a conformidade com regulamentações relevantes e protegendo nossa propriedade intelectual.

Habilidades e Qualificações Exigidas

  1. 12+ anos de experiência em uma função técnica sênior, com pelo menos 5 anos focados na construção e operação de infraestrutura de computação de alto desempenho ou IA. Histórico comprovado como Engenheiro(a) Principal ou Sênior.
  1. Conhecimento em nível de especialista da arquitetura de GPU NVIDIA e tecnologias como CUDA e cuDNN. Experiência extensiva com treinamento e inferência multi-GPU e multi-nó.
  1. Experiência comprovada com serviços de IA na nuvem pública, especificamente gerenciando acesso, uso e faturamento para serviços Azure OpenAI e Plataforma Google Cloud (GCP).
  1. Experiência prática extensiva com Docker: gerenciamento de imagens, orquestração de contêineres e solução de problemas.
  1. Proficiência em linguagens de script como Python, Bash ou Perl.
  1. Profundo conhecimento em administração de sistemas Linux (RHEL preferencial), incluindo rede, armazenamento e ajuste de desempenho.
  1. Familiaridade com autenticação de usuário e integração usando sistemas como LDAP ou Active Directory.
  1. Fortes habilidades de resolução de problemas e comunicação com a capacidade de trabalhar em uma equipe multiplataforma, multifuncional e geograficamente distribuída.

Habilidades Preferenciais/Bônus

  1. Compreensão de perfil e ajuste de jobs de IA (memória, GPU, I/O).
  1. Experiência administrando clusters LSF em um ambiente de produção ou pesquisa. Familiaridade com outros agendadores de jobs como Slurm é um diferencial.
  1. Experiência com integração LSF Docker e submissão de jobs usando imagens de contêiner.
  1. Experiência com tarefas de administração de sistemas macOS/AppleSilicon e solução de problemas.

A faixa salarial anual para a Califórnia é de US$ 168,000 a US$ 312,000. Você também pode ser elegível para receber remuneração variável: bônus, ações e benefícios. Posições de vendas geralmente oferecem uma estrutura de remuneração variável competitiva On Target Earnings (OTE). Observe que a faixa salarial é uma diretriz e a remuneração pode variar com base em fatores como qualificações, nível de habilidade, competências e local de trabalho.

Nossos programas de benefícios incluem: férias remuneradas e feriados remunerados, plano 401(k) com contrapartida do empregador, plano de compra de ações para funcionários, uma variedade de opções de planos médicos, odontológicos e de visão, e muito mais.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores