StrideCare
Sustainable Talent
Engenheiro de Confiabilidade de Site
Sobre a oportunidade
Sustainable Talent está fazendo parceria com a Nvidia, líder global que tem transformado gráficos de computador, jogos de PC e computação acelerada por mais de 25 anos. Estamos procurando um Engenheiro de Confiabilidade de Site para apoiar a equipe de nosso cliente baseada em Santa Clara, Ca.
Estamos procurando um Engenheiro de Confiabilidade de Site (Contrato) para trabalhar em IPP (Infraestrutura, Planejamento e Processos). IPP é uma organização global dentro da NVIDIA. Este grupo trabalha com vários outros grupos dentro do Software NVIDIA, como Processadores Gráficos, Processadores Móveis, Deep Learning, Inteligência Artificial e Carros Autônomos para atender às suas necessidades de infraestrutura. Esses serviços em nuvem fornecem quase meio milhão de trabalhos automatizados por dia em milhares de servidores, ajudando na eficiência de milhares de engenheiros de software da NVIDIA em todo o mundo.
A nuvem hospeda uma mistura heterogênea de máquinas e dispositivos com vários sistemas operacionais (Windows/Linux/Android), uma infinidade de plataformas de hardware, tanto GPUs NVIDIA quanto Processadores Tegra.
Você é apaixonado por infraestrutura e procura questões sofisticadas e relevantes, pronto para construir a próxima geração de serviços em nuvem, criar soluções criativas, minerar dados para descobrir problemas reais e resolvê-los? Ficaríamos entusiasmados em tê-lo a bordo.
Esta é uma função de contrato em tempo integral (W-2). Oferecemos remuneração competitiva
US$ 65/h - US$ 85/h com base em fatores como experiência, educação, localização, etc. e fornecemos benefícios completos, PTO e uma cultura de empresa incrível!
Sustainable Talent é um empregador que oferece igualdade de oportunidades de emprego e ação afirmativa para homens/mulheres, deficientes e veteranos.
O que você fará
- Monitoramento e recuperação de frota de ativos em nosso ambiente de nuvem privada que abriga vários servidores de computação com GPUs NVIDIA.
- Foco específico na construção e estabilização de nossa infraestrutura de virtualização de ESXi, KVM e Hyper-V.
- Implante e mantenha uma grande fazenda de máquinas usando as ferramentas mais recentes de Gerenciamento de Configuração e Automação de Infraestrutura (Chef, Ansible, Terraform).
- Participar de suporte L1 em regime de sobreaviso e escala rotativa para monitoramento ininterrupto e remediação de problemas de infraestrutura (PagerDuty)
- Analise e depure problemas de sistema operacional, rede, configuração e desempenho.
- Auxilie no lançamento e implantação de configurações de infraestrutura para suportar o hardware e as tecnologias NVIDIA mais recentes.
- Contribua para o desenvolvimento de sistemas de monitoramento para ter um pulso rápido, confiável e em tempo real dos vários subsistemas de infraestrutura (Zabbix, Big Panda, Grafana).
Requisitos mínimos
O que precisamos ver
- Bacharelado ou Mestrado em Ciência da Computação ou Engenharia de Software, ou experiência equivalente.
- Experiência trabalhando em sistemas de produção empresariais de larga escala. 5+ anos de experiência profissional exigidos.
- Capacidade de depurar e analisar problemas de sistema, código para triagem, causa raiz e resolução de problemas na infraestrutura. Trabalhe em estreita colaboração com a equipe de engenharia de plataforma para entender as configurações de hardware.
- Familiaridade com manutenção e configuração de hosts Linux, Windows.
- Experiência em scripting com qualquer um de Python, Go. Proficiência em shell Unix.
- Experiência com sistemas de controle de versão como Perforce, GIT.
Formas de se destacar na multidão
- Experiência com tecnologias de virtualização de VM e hardware como VMware, KVM, Hyper-V, Docker e Kubernetes.
- Experiência com provisionamento automatizado de bare metal e VM.
- Experiência com suporte a GPUs, desenvolvimento de dispositivos embarcados, desenvolvimento de drivers e aplicativos CUDA/TensorRT.
- Experiência de desenvolvimento em Chef, Ansible e orquestração de infraestrutura.
