StrideCare
Cadence Design Systems
Arquiteto(a) Sênior de TI
Sobre a oportunidade
NA CADENCE, CONTRATAMOS E DESENVOLVEMOS LÍDERES E INOVADORES QUE QUEREM CAUSAR UM IMPACTO NO MUNDO DA TECNOLOGIA.
Estamos buscando um(a) Engenheiro(a) de Sistemas de IA altamente qualificado(a) e experiente para se juntar à nossa equipe. Esta é uma função prática de contribuidor individual sênior que será fundamental para liderar o desenvolvimento, as operações e o suporte de toda a nossa infraestrutura de IA. Você será responsável por todo o ciclo de vida de nossos sistemas de IA, desde a arquitetura e construção de clusters de GPU de alto desempenho até a implantação e otimização de nossos modelos de IA mais avançados e serviços de agente.
ESTAMOS FAZENDO UM TRABALHO QUE IMPORTA. AJUDE-NOS A RESOLVER O QUE OUTROS NÃO PODEM.
Responsabilidades
- Arquitetura e Estratégia de Infraestrutura de IA: Liderar o projeto e a implementação de nossa infraestrutura de IA de próxima geração para suportar nossas iniciativas de IA de Agente. Você definirá a estratégia técnica para nossos clusters de GPU on-premise, soluções de armazenamento e rede para garantir desempenho ideal, escalabilidade e confiabilidade para todas as nossas cargas de trabalho de IA.
- Integração de Serviços de IA na Nuvem: Suportar e proteger o uso de serviços de IA na nuvem pública, incluindo serviços Azure OpenAI e serviços da Plataforma Google Cloud (GCP) como Gemini. Isso inclui gerenciar acesso seguro, monitorar o uso e rastrear faturamento para garantir a relação custo-benefício. Você também terá experiência prática no suporte a computação, GPUs e serviços de IA tanto em GCP quanto em Azure.
- Gerenciamento Prático de Clusters de GPU: Assumir um papel de liderança na configuração, instalação e otimização de clusters de servidores GPU. Isso inclui solução avançada de problemas de hardware e software, ajuste de desempenho e implementação de melhores práticas para utilização de cluster e gerenciamento de recursos. Você será um especialista em administrar agendadores de jobs como LSF em um ambiente de produção, incluindo integração com Docker para submissão de jobs em contêineres.
- Desenvolvimento e Operações de Stack de Tecnologia de IA Full-Stack: Projetar e implantar uma stack de tecnologia de IA robusta e escalável. Você será responsável pelo ciclo de vida operacional de ponta a ponta, incluindo configuração e gerenciamento de frameworks de deep learning (PyTorch, TensorFlow), contêinerização com Docker e Kubernetes, e implementação de pipelines de CI/CD para desenvolvimento de modelos de IA.
- Implantação e Otimização Avançada de LLM: Liderar a implantação, o serviço e a otimização de Modelos de Linguagem Grandes (LLMs). Você será um especialista em técnicas como quantização de modelos, destilação e uso de frameworks de serviço de alto desempenho (por exemplo, vLLM, TGI, TensorRT-LLM) para maximizar a taxa de transferência de inferência e minimizar a latência.
- Engenharia de Fluxos de Trabalho e Serviços de IA de Agente: Projetar e construir fluxos de trabalho e serviços de IA de Agente de nível de produção. Você será responsável pelo projeto técnico e implementação de sistemas que integram LLMs com ferramentas externas, APIs e bancos de dados, e orientará outros engenheiros na construção de aplicações de agente de IA robustas e escaláveis.
- Automação e Monitoramento: Desenvolver e manter scripts de automação usando linguagens como Python, Bash ou Perl para otimizar a manutenção do sistema, implantação e relatórios. Implementar e gerenciar soluções de monitoramento para saúde do sistema, status de jobs, utilização de GPU e desempenho de contêineres para identificar e resolver problemas proativamente.
- Suporte e Mentoria de Sistemas de IA: Atuar como ponto final de escalonamento para os problemas técnicos mais complexos relacionados à nossa infraestrutura de IA. Você também servirá como líder técnico e mentor para outros engenheiros, fornecendo orientação sobre melhores práticas em engenharia de sistemas de IA, ajuste de desempenho e excelência operacional.
- Segurança e Conformidade: Desenvolver e implementar melhores práticas de segurança para nossos sistemas e dados de IA, garantindo a conformidade com regulamentações relevantes e protegendo nossa propriedade intelectual.
Habilidades e Qualificações Exigidas
- 12+ anos de experiência em uma função técnica sênior, com pelo menos 5 anos focados na construção e operação de infraestrutura de computação de alto desempenho ou IA. Histórico comprovado como Engenheiro(a) Principal ou Sênior.
- Conhecimento em nível de especialista da arquitetura de GPU NVIDIA e tecnologias como CUDA e cuDNN. Experiência extensiva com treinamento e inferência multi-GPU e multi-nó.
- Experiência comprovada com serviços de IA na nuvem pública, especificamente gerenciando acesso, uso e faturamento para serviços Azure OpenAI e Plataforma Google Cloud (GCP).
- Experiência prática extensiva com Docker: gerenciamento de imagens, orquestração de contêineres e solução de problemas.
- Proficiência em linguagens de script como Python, Bash ou Perl.
- Profundo conhecimento em administração de sistemas Linux (RHEL preferencial), incluindo rede, armazenamento e ajuste de desempenho.
- Familiaridade com autenticação de usuário e integração usando sistemas como LDAP ou Active Directory.
- Fortes habilidades de resolução de problemas e comunicação com a capacidade de trabalhar em uma equipe multiplataforma, multifuncional e geograficamente distribuída.
Habilidades Preferenciais/Bônus
- Compreensão de perfil e ajuste de jobs de IA (memória, GPU, I/O).
- Experiência administrando clusters LSF em um ambiente de produção ou pesquisa. Familiaridade com outros agendadores de jobs como Slurm é um diferencial.
- Experiência com integração LSF Docker e submissão de jobs usando imagens de contêiner.
- Experiência com tarefas de administração de sistemas macOS/AppleSilicon e solução de problemas.
A faixa salarial anual para a Califórnia é de US$ 168,000 a US$ 312,000. Você também pode ser elegível para receber remuneração variável: bônus, ações e benefícios. Posições de vendas geralmente oferecem uma estrutura de remuneração variável competitiva On Target Earnings (OTE). Observe que a faixa salarial é uma diretriz e a remuneração pode variar com base em fatores como qualificações, nível de habilidade, competências e local de trabalho.
Nossos programas de benefícios incluem: férias remuneradas e feriados remunerados, plano 401(k) com contrapartida do empregador, plano de compra de ações para funcionários, uma variedade de opções de planos médicos, odontológicos e de visão, e muito mais.
