OKSI
Sustainable Talent
Engenheiro de Confiabilidade de Site apoiando Nvidia
Sobre a oportunidade
Sustainable Talent está fazendo parceria com a Nvidia, líder global que tem transformado gráficos de computador, jogos de PC e computação acelerada por mais de 25 anos. Estamos procurando um Engenheiro de Confiabilidade de Site para apoiar a equipe de nosso cliente baseada em Santa Clara, Ca.
Estamos procurando um Engenheiro de Confiabilidade de Site (Contrato) para trabalhar em IPP (Infraestrutura, Planejamento e Processo). IPP é uma organização global dentro da NVIDIA. Este grupo trabalha com vários outros grupos dentro do Software NVIDIA, como Processadores Gráficos, Processadores Mobile, Deep Learning, Inteligência Artificial e Carros Autônomos para atender às suas necessidades de infraestrutura. Esses serviços em nuvem fornecem quase meio milhão de trabalhos automatizados por dia em milhares de servidores, ajudando na eficiência de milhares de engenheiros de software da NVIDIA em todo o mundo.
A nuvem hospeda uma mistura heterogênea de máquinas e dispositivos com vários sistemas operacionais (Windows/Linux/Android), uma multidão de plataformas de hardware, tanto GPUs NVIDIA quanto Processadores Tegra. Você é apaixonado por infraestrutura e procura questões sofisticadas e relevantes, pronto para construir a próxima geração de serviços em nuvem, criar soluções criativas, minerar dados para descobrir problemas reais e resolvê-los? Ficaríamos entusiasmados em tê-lo a bordo.
Esta é uma função de contrato em tempo integral (W-2). Oferecemos salário competitivo de US$ 65/hora - US$ 85/hora com base em fatores como experiência, educação, localização, etc. e fornecemos benefícios completos, PTO e uma cultura de empresa incrível!
O que você fará
- Monitoramento e recuperação de frota de ativos em nosso ambiente de nuvem privada que abriga vários servidores de computação com GPUs NVIDIA.
- Foco específico na construção e estabilização de nossa infraestrutura de virtualização de ESXi, KVM e Hyper-V.
- Implantação e manutenção de uma grande fazenda de máquinas usando as últimas ferramentas de Gerenciamento de Configuração e Automação de Infraestrutura (Chef, Ansible, Terraform).
- Participar de suporte L1 em regime de plantão e escala para monitoramento e remediação ininterrupta de problemas de infraestrutura (PagerDuty)
- Analisar e depurar problemas de sistema operacional, rede, configuração e desempenho.
- Auxiliar na implantação e lançamento de configurações de infraestrutura para suportar o hardware e as tecnologias mais recentes da NVIDIA.
- Contribuir para o desenvolvimento de sistemas de monitoramento para ter um pulso rápido, confiável e em tempo real dos vários subsistemas de infraestrutura (Zabbix, Big Panda, Grafana)
O que precisamos ver
- Bacharelado ou Mestrado em Ciência da Computação ou Engenharia de Software, ou experiência equivalente.
- Experiência trabalhando em sistemas de produção corporativos de larga escala. 5+ anos de experiência profissional exigidos.
- Capacidade de depurar e analisar problemas de sistema, código para triagem, identificar a causa raiz e resolver problemas na infraestrutura. Trabalhar em estreita colaboração com a equipe de engenharia de plataforma para entender as configurações de hardware.
- Familiaridade com manutenção e configuração de hosts Linux, Windows.
- Experiência com scripting em qualquer um dos Python, Go. Proficiência em linha de comando Unix.
- Experiência com sistemas de controle de versão como Perforce, GIT.
Maneiras de se destacar na multidão
- Experiência com tecnologias de virtualização de VM e hardware como VMware, KVM, Hyper-V, Docker e Kubernetes.
- Experiência com provisionamento de bare metal e VM automatizado.
- Experiência com suporte a GPUs, desenvolvimento de dispositivos embarcados, desenvolvimento de drivers e aplicações CUDA/TensorRT.
- Experiência de desenvolvimento em Chef, Ansible e orquestração de infraestrutura.
Sustainable Talent é um empregador com igualdade de oportunidades de emprego e ação afirmativa para M/F+, deficientes e veteranos.
