Oracle

Engenheiro(a) de Software Principal Líder, Infraestrutura Central

JavaAWSGCPKubernetesGoTerraform
Tradução automática. Consulte o original.

Sobre a oportunidade

A equipe de Infraestrutura de Nuvem Oracle (OCI) oferece a oportunidade de construir e operar serviços de nuvem integrados e de grande escala em um ambiente de nuvem amplamente distribuído e multi-tenant. OCI constrói produtos de nuvem para clientes que estão enfrentando alguns dos maiores desafios técnicos e de negócios do mundo.

O Oracle Kubernetes Engine (OKE) é o serviço gerenciado de Kubernetes da OCI. O OKE permite que os clientes criem, executem, dimensionem, protejam e operem clusters de Kubernetes na OCI, integrando Kubernetes com computação, rede, armazenamento, identidade, observabilidade, segurança e automação da OCI. A equipe OKE é proprietária de um serviço de nuvem altamente disponível 24x7 e está expandindo a plataforma para suportar clusters maiores, maior escala, operabilidade aprimorada, integrações mais profundas com a OCI e cargas de trabalho cloud native, de IA e de GPU cada vez mais exigentes.

Estamos procurando um(a) engenheiro(a) de software sênior IC5 com profundo conhecimento em Kubernetes, experiência em infraestrutura de nuvem e um forte histórico em sistemas distribuídos. Esta é uma função de liderança técnica de alto impacto para um(a) engenheiro(a) que possa definir arquitetura, impulsionar a execução entre equipes, resolver problemas ambíguos de produção e plataforma, e entregar sistemas duráveis que melhorem a experiência do cliente e a excelência operacional.

Você trabalhará nas principais capacidades da plataforma OKE, incluindo gerenciamento do ciclo de vida do cluster, orquestração, escalabilidade, confiabilidade, desempenho, automação, observabilidade, segurança e integração com os serviços de infraestrutura da OCI. O(A) candidato(a) ideal tem experiência prática no projeto, construção, operação ou depuração profunda de serviços de nuvem em produção, plataformas de infraestrutura ou sistemas baseados em Kubernetes em escala significativa.

Esta função requer experiência avançada em Kubernetes, incluindo comportamento do plano de controle de Kubernetes, controladores e operadores, agendamento, autoescalonamento, rede, armazenamento, descoberta de serviços, runtimes de contêineres, ciclo de vida do nó, Kubernetes APIs e etcd. Experiência com tecnologias de rede e armazenamento de Kubernetes como CNI, Cilium, Calico, Flannel, outras implementações de rede de contêineres, drivers CSI e integrações de provedores de nuvem é altamente relevante.

O OKE também está se expandindo para suportar casos de uso exigentes de IA e computação acelerada. Experiência com infraestrutura de IA/ML, clusters de GPU multi-nó, computação acelerada, plataformas de treinamento ou inferência de modelos, agendamento de GPU, plugins de dispositivo, Karpenter, autoescalonamento de cluster, CUDA, NCCL, RoCE, InfiniBand, RDMA, offload de SmartNIC/DPU, ou rede de alta performance para IA/HPC é um diferencial significativo.

Esta função também requer um(a) engenheiro(a) que esteja pronto(a) para usar práticas modernas de engenharia agentiva de forma responsável. Esperamos que engenheiros seniores apliquem fluxos de trabalho assistidos por IA e agentivos para acelerar a exploração de design, implementação, testes, depuração, documentação, análise operacional e produtividade do desenvolvedor, mantendo forte senso de propriedade, julgamento de segurança, qualidade de código e responsabilidade de produção.

Responsabilidades

Como membro da divisão de engenharia de software, você terá um papel ativo na definição e evolução de práticas e procedimentos padrão. Você definirá especificações para novos projetos significativos e especificará, projetará, desenvolverá, solucionará problemas e depurará software para o serviço gerenciado de Kubernetes da OCI.

As responsabilidades incluem:

  1. Fornecer liderança técnica para grandes iniciativas da plataforma OKE, desde a arquitetura até a implementação, lançamento e operação em produção.
  1. Projetar e construir sistemas distribuídos que criam, atualizam, dimensionam, reparam e operam clusters de Kubernetes em todas as regiões da OCI.
  1. Melhorar a confiabilidade, escalabilidade, desempenho, segurança de atualização, gerenciamento de ciclo de vida, observabilidade, automação e ferramentas operacionais do OKE.
  1. Trabalhar profundamente com tecnologias de Kubernetes, incluindo componentes do plano de controle, controladores/operadores, agendamento, autoescalonamento, Kubernetes APIs, runtimes de contêineres, comportamento do nó e etcd.
  1. Projetar, depurar e melhorar integrações de rede e armazenamento de Kubernetes, incluindo rede baseada em CNI, Cilium, Calico, Flannel, outras implementações de rede de contêineres, drivers CSI e integrações de infraestrutura OCI.
  1. Construir automação para validação de cluster, verificações de saúde, testes de prontidão, detecção de falhas, recuperação remota e redução de problemas operacionais pós-implantação.
  1. Liderar revisões de design técnico, revisões de código, revisões de incidentes e revisões de prontidão de produção para alterações complexas de serviço.
  1. Depurar problemas de produção difíceis entre limites de serviço, incluindo Kubernetes, Linux, rede, computação, armazenamento, identidade, telemetria e dependências de infraestrutura OCI.
  1. Aplicar práticas de engenharia de desempenho, incluindo profiling, tracing, análise de latência, otimização de throughput e diagnósticos de produção em sistemas distribuídos.
  1. Construir automação que reduza operações manuais, melhore a saúde da frota, acelere o diagnóstico e eleve o padrão de qualidade para a engenharia OKE.
  1. Colaborar com equipes de serviço da OCI para entregar capacidades de plataforma de ponta a ponta, independentemente de fronteiras organizacionais.
  1. Aplicar fluxos de trabalho de engenharia assistidos por IA e agentivos para melhorar a velocidade de engenharia, cobertura de testes, depuração, análise operacional e documentação, garantindo correção, segurança e manutenibilidade.
  1. Orientar engenheiros, influenciar a direção técnica e ajudar a estabelecer padrões que escalam por toda a organização OKE.
  1. Participar da operação de um serviço de nuvem 24x7 e usar feedback do cliente, dados de produção e experiência operacional para priorizar melhorias.

Qualificações Requeridas

  1. 10+ anos de experiência em engenharia de software, ou experiência equivalente na construção e operação de sistemas de software em produção.
  1. Experiência prática em infraestrutura de nuvem é necessária, idealmente projetando, construindo, operando ou depurando serviços ou plataformas em produção na OCI, AWS, Azure, GCP, ou uma nuvem privada de grande escala.
  1. Profundo conhecimento prático em Kubernetes é necessário, incluindo arquitetura de Kubernetes, APIs, comportamento do plano de controle, controladores/operadores, agendamento, autoescalonamento, rede, armazenamento, nós, gerenciamento do ciclo de vida do cluster ou operações de cluster em produção.
  1. Conhecimento avançado de Kubernetes, incluindo CNI, CSI, etcd, descoberta de serviços, runtimes de contêineres, ciclo de vida do nó e modos de falha de Kubernetes.
  1. Experiência com tecnologias de rede de Kubernetes como Cilium, Calico, Flannel, ou outras implementações de CNI.
  1. Experiência com integrações de armazenamento de Kubernetes, incluindo drivers CSI ou integrações de armazenamento em nuvem.
  1. Fortes fundamentos em sistemas distribuídos, incluindo disponibilidade, tratamento de falhas, desempenho, escalabilidade e trade-offs operacionais.
  1. Experiência na construção de serviços de infraestrutura de alta disponibilidade, serviços de plataforma ou sistemas cloud native usados em produção.
  1. Forte experiência de desenvolvimento tanto em Go/Golang quanto em Java é necessária.
  1. Fortes habilidades em Linux, rede, depuração e operações de produção.
  1. Capacidade demonstrada de liderar projetos técnicos ambíguos, influenciar equipes e entregar resultados através de outros engenheiros sem depender de autoridade formal.
  1. Fortes habilidades de comunicação, senso de propriedade, julgamento e capacidade de fazer trade-offs pragmáticos em sistemas de produção.

Qualificações Preferenciais

  1. Experiência com infraestrutura de IA/ML, cargas de trabalho de GPU, clusters de GPU multi-nó, computação acelerada, plataformas de treinamento ou inferência de modelos, agendamento de GPU, plugins de dispositivo, Karpenter, autoescalonamento de cluster, CUDA, NCCL, rede de alta performance ou sistemas de treinamento distribuído.
  1. Experiência com rede baseada em eBPF, política de rede de Kubernetes, service mesh, ingress, balanceamento de carga, overlays/underlays, BGP, VXLAN, offload de SmartNIC/DPU, RoCE, InfiniBand, RDMA ou rede multi-cluster.
  1. Experiência com infraestrutura como código e ferramentas de provisionamento de nuvem como Terraform, Packer, cloud-init, IAM, rede VCN/VPC, VPN, FastConnect/Direct Connect, ou primitivas de nuvem equivalentes.
  1. Experiência na construção de fluxos de trabalho de produtividade do desenvolvedor, automação operacional ou fluxos de trabalho responsáveis de engenharia assistida por IA e agentiva.
  1. Experiência com sistemas de observabilidade, resposta a incidentes, práticas de implantação segura, análise de canary, estratégias de rollback, automação de saúde de serviço e operações de frota grande.
  1. Experiência de contribuição open-source ou upstream em Kubernetes, infraestrutura cloud native, observabilidade, rede ou sistemas relacionados.

Outras Qualificações

Aviso Legal:

Certos cargos baseados nos EUA ou voltados para clientes/parceiros dos EUA podem ser obrigados a cumprir os requisitos aplicáveis, como mandatos de imunização/saúde ocupacional e/ou requisitos de teste de drogas.

As informações de faixa salarial e benefícios fornecidas nesta postagem são específicas apenas para os locais declarados.

EUA: Faixa de contratação em USD de: $135,200 a $306,400 por ano. Pode ser elegível para bônus, ações e diferimento de remuneração.

Oracle mantém amplas faixas salariais para suas funções, a fim de considerar variações em conhecimento, habilidades, experiência, condições de mercado e locais, bem como refletir os diferentes produtos, indústrias e linhas de negócios da Oracle.

Os candidatos são tipicamente posicionados na faixa com base nos fatores precedentes, bem como na equidade interna entre pares.

A função geralmente aceitará candidaturas por pelo menos três dias corridos a partir da data de publicação ou enquanto o cargo permanecer aberto.

Nível de Carreira - IC5

Estamos comprometidos em incluir pessoas com deficiência em todas as etapas do processo de emprego. Se você precisar de assistência de acessibilidade ou acomodação para uma deficiência em qualquer momento, informe-nos enviando um e-mail para [email protected] ou ligando para 1-888-404-2494 nos Estados Unidos.

Oracle é um Empregador de Igualdade de Oportunidades. Todos os candidatos qualificados receberão consideração para emprego sem distinção de raça, cor, religião, sexo, origem nacional, orientação sexual, identidade de gênero, deficiência e status de veterano protegido, ou qualquer outra característica protegida por lei. Oracle considerará para emprego candidatos qualificados com registros de prisão e condenação de acordo com a lei aplicável.

Oracle EUA oferece um pacote abrangente de benefícios que inclui o seguinte:

  • Seguro médico, odontológico e de visão, incluindo opinião médica especializada.
  • Incapacidade de curto prazo e incapacidade de longo prazo.
  • Seguro de vida e AD&D.
  • Seguro de vida suplementar (Funcionário/Cônjuge/Filho).
  • Contas de Gastos Flexíveis para cuidados de saúde e dependentes.
  • Benefícios pré-imposto para transporte e estacionamento.
  • Plano de Poupança e Investimento 401(k) com contrapartida da empresa.
  • Tempo livre remunerado: Férias Flexíveis são fornecidas a todos os funcionários elegíveis designados para uma posição assalariada (não elegível para horas extras). Férias acumuladas são fornecidas a todos os outros funcionários elegíveis para benefícios de férias. Para funcionários que trabalham pelo menos 35 horas por semana, a taxa de acúmulo de férias é de 13 dias anualmente nos primeiros três anos de emprego e 18 dias anualmente nos anos subsequentes de emprego. O acúmulo de férias é prorrateado para funcionários que trabalham entre 20 e 34 horas por semana. Funcionários que trabalham menos de 20 horas por semana não são elegíveis para férias.
  • 11 feriados remunerados.
  • Licença médica remunerada: 72 horas de licença médica remunerada na data de contratação. Renova a cada ano civil. O saldo não utilizado será transferido a cada ano até um limite máximo de 112 horas.
  • Licença parental remunerada.
  • Assistência à adoção.
  • Plano de Compra de Ações para Funcionários.
  • Planejamento financeiro e jurídico em grupo.
  • Benefícios voluntários incluindo seguro de automóvel, residencial e de animais de estimação.

Somente a Oracle reúne os dados, a infraestrutura, os aplicativos e a expertise para potencializar desde inovações industriais até cuidados que salvam vidas. E com IA incorporada em nossos produtos e serviços, ajudamos os clientes a transformar essa promessa em um futuro melhor para todos. Descubra seu potencial em uma empresa líder em soluções de IA e nuvem que impactam bilhões de vidas.

A verdadeira inovação começa quando todos são capacitados a contribuir. É por isso que estamos comprometidos em cultivar uma força de trabalho que promova oportunidades para todos, com benefícios competitivos que apoiam nossos funcionários com opções flexíveis de seguro médico, de vida e de aposentadoria. Também incentivamos os funcionários a retribuir às suas comunidades por meio de nossos programas de voluntariado.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores