Statista

Ingénieur Data - Plateforme de Données & Ontologie (h/f/d)

PythonSQLAWSTerraform
Traduction automatique. Consultez l’original.

À propos du poste

Chez Statista, nous sommes axés sur les faits et les données, car nous sommes la première plateforme de données commerciales au monde. En fournissant des données fiables et faciles à utiliser, ainsi que divers produits et services d'analyse de données, nous permettons aux gens du monde entier de prendre des décisions basées sur des faits.

Fondée à Hambourg en 2007, nous sommes rapidement devenus une entreprise mondiale avec des bureaux dans les grandes villes telles que Londres, New York, Berlin et Tokyo. Et nous avons encore beaucoup de projets. Notre croissance constante prouve non seulement notre succès, mais crée également de nouvelles opportunités de développement et de carrière pour nos employés.

Nous valorisons et célébrons notre culture diversifiée. Vous êtes le bienvenu tel que vous êtes, peu importe d'où vous venez, à quoi vous ressemblez, ou si vous préférez les graphiques en barres aux diagrammes circulaires. Votre histoire compte – continuez à l'écrire en tant que membre de notre équipe.

Êtes-vous prêt à nous rejoindre ?

En tant qu'Ingénieur Data sur notre Plateforme de Santé, vous serez responsable de bout en bout de l'ingestion des données fondamentale, de la résolution d'entités et de l'infrastructure de la plateforme. Vous concevrez et opérerez des pipelines de données batch/streaming évolutifs, renforcerez l'orchestration de la plateforme et assurerez la fiabilité, la sécurité et l'efficacité des coûts du système.

Un défi central de ce poste est la construction et l'opérationnalisation de notre ontologie unifiée de données de santé – un modèle sémantique cohérent couvrant les hôpitaux, les départements, les spécialités, les métriques et les normes de classification. En étroite collaboration avec les Ingénieurs Analytics, les Data Scientists et les experts en méthodologie, vous transformerez des données hospitalières hétérogènes et multi-pays en un actif de données cohérent et hautement interrogeable.

Responsabilités Clés

  1. Infrastructure et Orchestration des Pipelines : Construire, optimiser et opérer des pipelines ELT fiables (utilisant Python, SQL, et Prefect/Airflow) pour ingérer des données provenant de sources internationales hétérogènes, APIs, bases de données et stockage lakehouse (S3, Apache Iceberg).
  1. Ontologie de Santé et Résolution d'Entités : Piloter la mise en œuvre de la résolution d'entités et de la gestion des données de référence (MDM) pour les entités hospitalières internationales, en mappant les données sources brutes à des structures canoniques et en maintenant des vocabulaires standardisés (par exemple, ICD/OPS, taxonomies de spécialités).
  1. Contrats de Données et Gouvernance de Schéma : Établir des contrats de données stricts (Pydantic, dbt contracts) et une gestion de schéma, en assurant la reproductibilité des jeux de données, le suivi de la lignée des données et la validation automatisée sur tous les pipelines de la plateforme.
  1. Efficacité de la Plateforme et Infrastructure Cloud : Optimiser le stockage des données, l'exécution des requêtes et les coûts de calcul sur AWS et Snowflake, en maintenant les actifs de données performants, sécurisés et rentables.
  1. Automatisation et CI/CD : Mettre en œuvre des flux de travail automatisés de tests et de déploiement pour les pipelines de données en utilisant GitHub Actions et l'Infrastructure as Code (Terraform).
  1. Facilitation des Données Interfonctionnelles : Collaborer directement avec les Ingénieurs Analytics, les Data Scientists et les experts du domaine pour livrer des jeux de données documentés, de qualité recherche et prêts pour la production.

Qualifications

Qualifications Essentielles (Indispensables)

  1. Ingestion de Données et Orchestration de Pipelines : Maîtrise avancée de Python et de SQL analytiques pour l'ingestion de données complexes à travers divers formats de fichiers, REST APIs, bases de données et lacs cloud (S3/Iceberg). Expérience pratique avec des orchestrateurs modernes (Prefect, Airflow, ou Dagster).
  1. Résolution d'Entités et Gouvernance des Données : Expérience pratique avec des frameworks de résolution d'entités/liaison d'enregistrements (par exemple, Splink, dedupe, recordlinkage) et de gestion de schéma/contrats de données (Pydantic, dbt contracts, ou JSON Schema).
  1. Plateforme Cloud et Infrastructure d'Entrepôt : Expérience pratique approfondie dans un environnement de production AWS (S3, ECS/EC2) combinée à des entrepôts de données cloud (Snowflake).
  1. CI/CD Automatisée et Automatisation des Flux de Travail : Expérience avérée dans l'automatisation des déploiements de pipelines de données, des tests d'intégration et des flux de validation via GitHub Actions.

Votre Profil

Diplôme : Licence ou Master en Informatique, Science des Données, Génie Logiciel, ou un domaine quantitatif connexe.

Expérience : 3+ années d'expérience en ingénierie de données dans la construction de pipelines de production et de plateformes de données ; y compris une période soutenue au sein d'une même organisation, ayant vu une plateforme ou un produit principal passer de la conception au lancement puis à l'itération.

Connaissance du Domaine : L'expérience dans le domaine de la santé est un plus (compréhension de base des KPIs de santé, des métriques de qualité ou des concepts de benchmarking ; la familiarité avec les structures hospitalières et les systèmes de classification médicale comme ICD/OPS est particulièrement précieuse).

État d'Esprit : Fort état d'esprit analytique et systémique, avec une capacité avérée à transformer des données internationales désordonnées et hétérogènes en un actif de données propre, bien gouverné et hautement structuré.

Langues : Anglais courant, l'allemand est un plus.

Style de Travail : Très structuré, curieux, soucieux du détail et motivé pour collaborer étroitement avec les ingénieurs analytics, les data scientists et les experts en méthodologie dans un environnement international.

Atouts (Ce qui vous démarquera)

  1. Knowledge Graphs & Terminologies de Santé : Exposition aux frameworks d'ontologie/sémantiques (RDF/OWL, SKOS, Neo4j, LinkML) ou aux classifications/vocabulaires médicaux internationaux (SNOMED CT, ICD/OPS, FHIR).
  1. Outils de Métadonnées et de Lignée : Expérience dans l'exploitation de registres de métadonnées et de catalogues de lignée (par exemple, OpenMetadata, DataHub, dbt docs).
  1. Infrastructure as Code (IaC) : Maîtrise de l'utilisation de Terraform pour gérer déclarativement les ressources et environnements cloud.

Ce que nous offrons

En plus de notre formidable équipe, de notre culture et de notre objectif commun de donner aux gens les moyens d'agir grâce aux données, il existe de nombreuses autres raisons qui font de Statista un excellent lieu de travail ! Rejoignez-nous et bénéficiez de :

  • Travail depuis l'étranger jusqu'à 30 jours calendaires par an
  • Travail hybride et flexibilité horaire
  • Équipe internationale et événements sociaux
  • Mobilité urbaine subventionnée et accès à des options de fitness et de bien-être
  • Accès gratuit à Langdock et à toutes ses fonctionnalités
  • Opportunités de carrière et de formation
  • Emplacements attrayants et bureaux modernes
  • Soutien à la santé mentale avec OpenUp

Certains des avantages mentionnés ici s'appliquent uniquement à l'entité allemande et aux postes de niveau Junior ou supérieur.

Plus d’opportunités avec un seul profil

Vous souhaitez accéder à plus de postes sans répéter tout le processus ? Créez votre profil pour être trouvé par les entreprises utilisant Nort.

Créer mon profil

Ton prochain jobest déjà à ta recherche.

Nort

Plateforme de recrutement inversé pour développeurs

Réseaux sociauxInstagramLinkedInTwitter