Capgemini
Chain IQ
Ingeniero/a Senior de Plataforma de Datos
Sobre la oportunidad
En Chain IQ, tus ideas se mueven rápido.
Información para agencias: Las solicitudes enviadas o cargadas por agencias de colocación o similares no son deseadas, por lo tanto, no se considerarán y se eliminarán.
Chain IQ es un socio global de servicios de adquisiciones impulsado por IA, con sede en Baar, Suiza, y operaciones en los principales centros y 16 oficinas en todo el mundo. Ofrecemos soluciones de adquisición integrales y personalizadas que permiten la transformación, impulsan la escalabilidad y generan reducciones sustanciales en el gasto indirecto de nuestros clientes. Nuestra cultura se basa en la innovación, el emprendimiento, la propiedad y el impacto. Aquí, tu voz importa: se fomenta el pensamiento audaz y la acción sigue a la ambición.
Propósito del puesto
Estamos construyendo una plataforma de datos modular de nivel empresarial impulsada por Databricks, diseñada para ofrecer datos confiables y gobernados a través de múltiples canales de consumo, incluyendo análisis, APIs, streaming y soluciones de grafos de conocimiento. La plataforma se basa en un modelo de datos canónico compartido y enfatiza la escalabilidad, la gobernanza, la privacidad y una mentalidad de Datos como Producto. Como Ingeniero/a Senior de Plataforma de Datos, desempeñarás un papel clave en el diseño y la evolución de la plataforma en la ingesta, gobernanza, modelado de datos y productos de datos. Este es un puesto práctico con alta responsabilidad, enfocado en la creación de capacidades de plataforma reutilizables, la habilitación del acceso a datos confiables a escala y la promoción de las mejores prácticas de ingeniería en todo el ecosistema de datos.
Chain IQ – Crea. Lidera. Genera impacto.
Responsabilidades
- Desarrollar y mantener patrones de ingesta modulares que soporten fuentes de datos por lotes, basadas en API y orientadas a eventos (por ejemplo, JDBC, conectores SaaS/ERP, Kafka, CDC).
- Establecer marcos de ingesta reutilizables (basados en metadatos cuando sea posible) que permitan la incorporación rápida y consistente de nuevas fuentes de datos.
- Construir y optimizar canalizaciones de datos basadas en Databricks (Spark, Delta Live Tables/Lakeflow) a través de la arquitectura medallion (Bronze, Silver, Gold).
- Implementar y evolucionar capacidades de gobernanza de datos, incluyendo controles de acceso, linaje, catalogación, auditoría, clasificación de datos y cumplimiento de privacidad.
- Definir y aplicar estándares de calidad de datos, contratos de datos, monitoreo y alertas en las capas de ingesta y transformación.
- Implementar soluciones de protección de datos y privacidad, incluyendo enmascaramiento, tokenización, seudonimización y otras técnicas de anonimización apropiadas para cumplir con los requisitos regulatorios (por ejemplo, GDPR).
- Construir, poseer y evolucionar productos de datos alineados con un modelo de datos canónico, asegurando propiedad clara, SLAs y documentación.
- Colaborar con los equipos de dominio para integrar datos de origen en el modelo canónico, preservando el matiz específico del dominio.
- Promover un enfoque de Datos como Producto: descubribilidad, autoservicio, versionado y contratos orientados al consumidor.
- Construir y mantener capas de consumo y servicio de datos, incluyendo conjuntos de datos de BI/analítica, APIs (REST/GraphQL) y extensiones impulsadas por casos de uso como salidas de streaming o representaciones de grafos de conocimiento.
- Impulsar estándares técnicos y dirección de plataforma en CI/CD, Infraestructura como Código, pruebas, observabilidad y optimización de costos.
- Mentorizar ingenieros y colaborar con partes interesadas de gobernanza, seguridad, arquitectura y negocio.
Requisitos
- Alrededor de 6+ años de experiencia en ingeniería de datos, con 2+ años diseñando/operando plataformas Lakehouse basadas en Databricks a escala de producción.
- Experiencia práctica con Apache Spark y Delta Lake; la experiencia con Delta Live Tables/Lakeflow Declarative Pipelines es un plus importante.
- Experiencia práctica con Unity Catalog (o equivalente) para control de acceso, linaje y catalogación.
- Experiencia demostrada en la implementación de técnicas de anonimización/seudonimización de datos en un entorno regulado.
- Sólida comprensión del modelado de datos canónico/conforme (por ejemplo, data vault, modelado dimensional, diseño de dominio para datos).
- Historial de exposición de datos a través de APIs (REST/GraphQL) - diseño de esquemas, contratos y versionado para consumidores externos/internos.
- Dominio de Python y/o Scala, SQL, e infraestructura como código (Terraform preferido).
- Sólido conocimiento de marcos de gobernanza de datos, regulación de privacidad de datos (GDPR/CCPA) y prácticas de seguridad de datos.
- Experiencia con plataformas en la nube (Azure, AWS o GCP) y sus servicios nativos de datos/eventos.
Se valorará
- Exposición a Structured Streaming o ingesta orientada a eventos (Kafka, herramientas CDC como Debezium) - no es un requisito principal, pero es útil a medida que la plataforma madura.
- Familiaridad con conceptos de grafos de conocimiento (por ejemplo, RDF/grafos de propiedades, Neo4j, capas de grafos en Spark) - un plus más que una expectativa.
- Experiencia con arquitecturas de malla de datos o productos de datos federados.
- Experiencia con herramientas de gestión de metadatos/catálogo más allá de Unity Catalog (por ejemplo, OpenMetadata, Collibra, Purview).
- Exposición a patrones MLOps o de almacén de características en Databricks.
- Certificaciones relevantes (Ingeniero/a de Datos Profesional de Databricks, certificados de arquitectura en la nube).
Únete a un equipo verdaderamente global.
Ofrecemos un entorno dinámico e internacional donde el alto rendimiento se une a un propósito real. Estamos orgullosos de tener la certificación Great Place to Work y aún más orgullosos de las personas que lo hacen posible. Demos forma al futuro de las adquisiciones, juntos.
