Barbaricum

Engenheiro(a) Sênior de Confiabilidade

PythonAWS
Tradução automática. Consulte o original.

Sobre a oportunidade

Barbaricum é uma empreiteira governamental em rápido crescimento, fornecendo suporte de ponta a clientes federais, com foco particular em conjuntos de missões de Defesa e Segurança Nacional. Aproveitamos mais de 17 anos de suporte a partes interessadas em todo o governo federal, com capacidades estabelecidas e crescentes nas disciplinas de Inteligência, Análise, Engenharia, Suporte à Missão e Comunicações. Fundada em 2008, nossa missão é transformar a maneira como nossos clientes abordam conjuntos de problemas complexos e em constante mudança, trazendo o que há de mais recente em tecnologia e o mais alto calibre de talentos.

Com sede no histórico bairro de Dupont Circle, em Washington, DC, a Barbaricum também tem presença corporativa em Tampa, FL, Bedford, IN e Dayton, OH, com membros da equipe em todos os Estados Unidos e ao redor do mundo. Como líder em nosso setor, fazemos parcerias com empresas do setor privado, instituições acadêmicas e associações industriais com o objetivo de construir continuamente nossa expertise e capacidades em benefício de nossos funcionários e dos clientes que apoiamos. Através de tudo isso, construímos uma cultura corporativa vibrante, diversa em expertise e perspectivas, com foco em colaboração e inovação. Nossas equipes estão na vanguarda dos desafios mais complexos e gratificantes da Nação. Junte-se à nossa equipe.

A Barbaricum está buscando um(a) Engenheiro(a) Sênior de Confiabilidade de Sites experiente para apoiar a confiabilidade, disponibilidade, automação e desempenho operacional de sistemas de TI e nuvem sob o contrato de Serviços de Empresa Digital e Divulgação da Comunidade Militar e Política Familiar (MC&FP) (MODES). Você ajudará a garantir que os sistemas MC&FP sejam confiáveis, escaláveis, resilientes e eficientemente gerenciados por meio de monitoramento proativo, resposta automatizada a incidentes, otimização de desempenho e painéis operacionais que suportam a tomada de decisões rápidas.

Responsabilidades

  1. Monitorar e manter a confiabilidade, disponibilidade e desempenho do sistema em ambientes de TI locais, em nuvem e híbridos que suportam os requisitos da missão MC&FP.
  1. Implementar monitoramento proativo de desempenho, alertas automatizados, fluxos de trabalho de resposta a incidentes e práticas de engenharia de resiliência para reduzir o tempo de inatividade e melhorar a visibilidade operacional.
  1. Desenvolver, manter e aprimorar soluções escaláveis de infraestrutura automatizada que suportem operações de sistema confiáveis e entrega de serviço repetível.
  1. Implementar estratégias de rollback, abordagens de recuperação e práticas de engenharia de caos para validar a resiliência, reduzir o risco operacional e melhorar a estabilidade do sistema.
  1. Analisar padrões de uso, tendências de capacidade e indicadores de desempenho para suportar escalonamento dinâmico, otimização de recursos e decisões de melhoria do sistema.
  1. Desenvolver e manter painéis operacionais em tempo real, relatórios e métricas que permitam a tomada de decisões rápidas, a conscientização da liderança e a otimização do sistema.
  1. Responder e resolver interrupções de sistema, falhas e interrupções de serviço, coordenando com equipes técnicas para minimizar o impacto na missão.
  1. Conduzir revisões pós-incidente para identificar causas raiz, documentar lições aprendidas e implementar medidas preventivas que reduzam a recorrência.
  1. Colaborar com desenvolvedores de software, engenheiros de nuvem, pessoal de cibersegurança e equipes de operações para melhorar serviços, padrões de confiabilidade, práticas de implantação e padrões operacionais.
  1. Criar e manter documentação de sistema, padrões de configuração, runbooks operacionais, procedimentos de monitoramento e orientações de confiabilidade de serviço.
  1. Automatizar tarefas operacionais comuns para reduzir cargas de trabalho manuais, melhorar a consistência e aumentar a eficiência do sistema.
  1. Implementar as melhores práticas de segurança em atividades operacionais, automação de infraestrutura, monitoramento, resposta a incidentes e funções de administração de sistemas.

Habilidades Necessárias

  1. Conhecimento especializado em práticas de engenharia de confiabilidade de sites, monitoramento de sistemas, gerenciamento de incidentes, automação, ajuste de desempenho e resiliência operacional.
  1. Forte compreensão da administração de Windows e Linux, operações de infraestrutura, configuração de sistemas, gerenciamento de serviços e práticas de solução de problemas.
  1. Experiência com plataformas de automação e ferramentas de gerenciamento de configuração como Ansible, Puppet, Chef ou tecnologias similares.
  1. Proficiência em linguagens de script como Python, Shell, PowerShell ou ferramentas similares usadas para automatizar tarefas operacionais e de infraestrutura.
  1. Conhecimento de serviços de nuvem e infraestrutura em AWS, Microsoft Azure, Google Cloud ou ambientes de nuvem comparáveis.
  1. Forte compreensão de solução de problemas de rede, configuração, análise de conectividade, dependências de sistema e identificação de gargalos de desempenho.
  1. Capacidade de projetar, interpretar e manter painéis, alertas, métricas, logs e relatórios operacionais que suportam a saúde do serviço e a tomada de decisões.
  1. Capacidade de conduzir análise de causa raiz, revisões pós-incidente e planejamento de ações corretivas em ambientes técnicos complexos.
  1. Fortes habilidades de resolução de problemas e a capacidade de trabalhar sob pressão durante interrupções, falhas e questões operacionais urgentes.
  1. Excelentes habilidades de comunicação escrita e verbal, com a capacidade de explicar descobertas técnicas, impactos de incidentes e recomendações de confiabilidade para partes interessadas técnicas e não técnicas.

Qualificações Necessárias

  1. Bacharelado em Ciência da Computação, Tecnologia da Informação, Engenharia de Sistemas, Cibersegurança ou área relacionada; Mestrado preferencial.
  1. 10+ anos de experiência em engenharia de confiabilidade de sites, administração de sistemas, operações de infraestrutura, operações de nuvem, DevSecOps ou função técnica similar, particularmente em um ambiente de TI governamental, federal, de defesa ou seguro.
  1. Experiência comprovada na manutenção de sistemas de TI confiáveis, escaláveis e eficientemente gerenciados em ambientes locais, em nuvem ou híbridos.
  1. Experiência no desenvolvimento de infraestrutura automatizada, scripts operacionais, soluções de monitoramento, painéis, runbooks e padrões de configuração.
  1. Experiência no suporte à resposta a incidentes, resolução de interrupções de sistema, revisões pós-incidente, análise de causa raiz e iniciativas de melhoria operacional.
  1. Experiência em colaboração com equipes de desenvolvimento, infraestrutura, nuvem, cibersegurança e de programas para melhorar a confiabilidade, segurança e desempenho do serviço.
  1. Acesso a informações confidenciais do Departamento de Defesa (DoD Secret Security Clearance).
  1. Certificações relacionadas a computação em nuvem, administração de sistemas, engenharia de confiabilidade de sites, DevSecOps ou automação são benéficas.

Compromisso com EEO

Todos os candidatos qualificados receberão consideração para emprego sem distinção de sexo, raça, etnia, idade, origem nacional, cidadania, religião, deficiência física ou mental, condição médica, informação genética, gravidez, estrutura familiar, estado civil, ancestralidade, status de parceiro doméstico, orientação sexual, identidade ou expressão de gênero, status de veterano ou militar, ou qualquer outra base proibida por lei.

Mais oportunidades com um só perfil

Quer aparecer para várias vagas sem repetir todo o processo? Crie seu perfil e seja encontrado pelas empresas que usam a Nort.

Criar meu perfil

Seu próximo empregojá está te procurando.

Nort

Plataforma de recrutamento reverso para programadores