Roku
Barbaricum
Ingénieur Fiabilité Senior
À propos du poste
Barbaricum est un sous-traitant gouvernemental en pleine croissance fournissant un support de pointe aux clients fédéraux, avec un accent particulier sur les missions de Défense et de Sécurité Nationale. Nous mettons à profit plus de 17 années de support aux parties prenantes du gouvernement fédéral, avec des capacités établies et croissantes dans les disciplines Intelligence, Analyse, Ingénierie, Support de Mission et Communications. Fondée en 2008, notre mission est de transformer la manière dont nos clients abordent des ensembles de problèmes complexes et en constante évolution en apportant les dernières technologies et le plus haut calibre de talents.
Basé au siège à Washington, DC, dans le quartier historique de Dupont Circle, Barbaricum a également une présence d'entreprise à Tampa, FL, Bedford, IN, et Dayton, OH, avec des membres d'équipe à travers les États-Unis et dans le monde. En tant que leader dans notre domaine, nous nous associons à des entreprises du secteur privé, des institutions académiques et des associations industrielles dans le but de renforcer continuellement notre expertise et nos capacités au profit de nos employés et des clients que nous soutenons. À travers tout cela, nous avons bâti une culture d'entreprise dynamique, diverse en expertise et en perspectives, axée sur la collaboration et l'innovation. Nos équipes sont à la pointe des défis les plus complexes et les plus gratifiants de la Nation. Rejoignez notre équipe.
Barbaricum recherche un Ingénieur Fiabilité Senior expérimenté pour soutenir la fiabilité, la disponibilité, l'automatisation et la performance opérationnelle des systèmes informatiques et cloud dans le cadre du contrat Military Community and Family Policy (MC&FP) Outreach and Digital Enterprise Services (MODES). Vous contribuerez à garantir que les systèmes MC&FP sont fiables, évolutifs, résilients et gérés efficacement grâce à une surveillance proactive, une réponse automatisée aux incidents, une optimisation des performances et des tableaux de bord opérationnels qui soutiennent une prise de décision rapide.
Responsabilités
- Surveiller et maintenir la fiabilité, la disponibilité et les performances des systèmes dans les environnements informatiques sur site, cloud et hybrides soutenant les exigences de mission MC&FP.
- Mettre en œuvre une surveillance proactive des performances, une alerte automatisée, des flux de travail de réponse aux incidents et des pratiques d'ingénierie de résilience pour réduire les temps d'arrêt et améliorer la visibilité opérationnelle.
- Développer, maintenir et améliorer des solutions d'infrastructure automatisées et évolutives qui soutiennent des opérations système fiables et une prestation de services reproductible.
- Mettre en œuvre des stratégies de rollback, des approches de récupération et des pratiques d'ingénierie du chaos pour valider la résilience, réduire le risque opérationnel et améliorer la stabilité du système.
- Analyser les modèles d'utilisation, les tendances de capacité et les indicateurs de performance pour soutenir la mise à l'échelle dynamique, l'optimisation des ressources et les décisions d'amélioration du système.
- Développer et maintenir des tableaux de bord opérationnels en temps réel, des rapports et des métriques qui permettent une prise de décision rapide, une sensibilisation de la direction et une optimisation du système.
- Répondre et résoudre les pannes système, les dégradations et les interruptions de service tout en coordonnant avec les équipes techniques pour minimiser l'impact sur la mission.
- Mener des revues post-incident pour identifier les causes profondes, documenter les leçons apprises et mettre en œuvre des mesures préventives qui réduisent la récurrence.
- Collaborer avec les développeurs de logiciels, les ingénieurs cloud, le personnel de cybersécurité et les équipes opérationnelles pour améliorer les services, les modèles de fiabilité, les pratiques de déploiement et les normes opérationnelles.
- Créer et maintenir la documentation système, les normes de configuration, les runbooks opérationnels, les procédures de surveillance et les directives de fiabilité de service.
- Automatiser les tâches opérationnelles courantes pour réduire les charges de travail manuelles, améliorer la cohérence et augmenter l'efficacité du système.
- Mettre en œuvre les meilleures pratiques de sécurité dans les activités opérationnelles, l'automatisation de l'infrastructure, la surveillance, la réponse aux incidents et les fonctions d'administration système.
Compétences requises
- Connaissance experte des pratiques d'ingénierie de fiabilité de site, de la surveillance système, de la gestion des incidents, de l'automatisation, de l'optimisation des performances et de la résilience opérationnelle.
- Solide compréhension de l'administration Windows et Linux, des opérations d'infrastructure, de la configuration système, de la gestion des services et des pratiques de dépannage.
- Expérience avec les plateformes d'automatisation et les outils de gestion de configuration tels que Ansible, Puppet, Chef, ou des technologies similaires.
- Maîtrise des langages de script tels que Python, Shell, PowerShell, ou des outils similaires utilisés pour automatiser les tâches opérationnelles et d'infrastructure.
- Connaissance des services cloud et de l'infrastructure sur AWS, Microsoft Azure, Google Cloud, ou des environnements cloud comparables.
- Solide compréhension du dépannage réseau, de la configuration, de l'analyse de connectivité, des dépendances système et de l'identification des goulots d'étranglement de performance.
- Capacité à concevoir, interpréter et maintenir des tableaux de bord, des alertes, des métriques, des journaux et des rapports opérationnels qui soutiennent la santé du service et la prise de décision.
- Capacité à mener des analyses de causes profondes, des revues post-incident et une planification d'actions correctives dans des environnements techniques complexes.
- Solides compétences en résolution de problèmes et capacité à travailler sous pression lors de pannes, de dégradations et de problèmes opérationnels urgents.
- Excellentes compétences en communication écrite et verbale, avec la capacité d'expliquer les conclusions techniques, les impacts des incidents et les recommandations de fiabilité aux parties prenantes techniques et non techniques.
Qualifications requises
- Diplôme de Licence en Informatique, Technologie de l'Information, Ingénierie des Systèmes, Cybersécurité, ou un domaine connexe ; Master préféré.
- 10+ années d'expérience en ingénierie de fiabilité de site, administration système, opérations d'infrastructure, opérations cloud, DevSecOps, ou un rôle technique similaire, particulièrement dans un environnement gouvernemental, fédéral, de défense ou sécurisé.
- Expérience démontrée dans le maintien de systèmes informatiques fiables, évolutifs et gérés efficacement dans des environnements sur site, cloud ou hybrides.
- Expérience dans le développement d'infrastructures automatisées, de scripts opérationnels, de solutions de surveillance, de tableaux de bord, de runbooks et de normes de configuration.
- Expérience dans le support de la réponse aux incidents, la résolution des pannes système, les revues post-incident, l'analyse des causes profondes et les initiatives d'amélioration opérationnelle.
- Expérience de collaboration avec les équipes de développement, d'infrastructure, cloud, de cybersécurité et de programme pour améliorer la fiabilité, la sécurité et les performances des services.
- Accréditation de sécurité secrète du DoD.
- Les certifications liées au cloud computing, à l'administration système, à l'ingénierie de fiabilité de site, à DevSecOps, ou à l'automatisation sont un plus.
Engagement EEO
Tous les candidats qualifiés recevront une considération pour l'emploi sans distinction de sexe, race, ethnie, âge, origine nationale, citoyenneté, religion, handicap physique ou mental, condition médicale, information génétique, grossesse, structure familiale, état matrimonial, ascendance, statut de partenaire domestique, orientation sexuelle, identité ou expression de genre, statut de vétéran ou militaire, ou toute autre base interdite par la loi.
