Lineage y catálogo de datos: qué se automatiza y qué necesita a una persona

Dataprix — El referente en datos e IT en español
in LinkedIn 𝕏 Follow f Facebook

Un catálogo de datos rara vez muere de golpe: simplemente deja de actualizarse. Este mes le ha pasado a Amundsen, el catálogo que Lyft liberó en 2019 y cuyo repositorio acaba de archivarse por inactividad, y es lo que les ocurre a muchos catálogos dentro de las empresas. El nuevo capítulo de la guía de arquitectura de datos parte de esa observación para separar el metadato que emiten los propios sistemas en cada ejecución, que se puede automatizar con OpenLineage, del que tiene que escribir una persona y se degrada con cada cambio. El capítulo anterior, sobre testing de pipelines, completa el bloque. En el directorio acompañamos la edición con Collate, la plataforma de la compañía que impulsa OpenMetadata, y con las fichas de Snowflake y Google BigQuery, dos de los protagonistas de la semana.

En el sector, el open source deja dos noticias de peso: dbt v2, el motor reescrito en Rust, llega a disponibilidad general junto con dbt State, y PostgreSQL 19 retira las consultas de grafos SQL/PGQ y se queda de momento sin fecha de lanzamiento. Snowflake se integra con STACKIT, la nube soberana del grupo Schwarz, con los datos en Iceberg y las claves en la UE; Databricks abre a cualquier agente de IA el contexto de negocio gobernado de Genie One, y Microsoft Fabric ya replica BigQuery con soporte para producción. El hilo común enlaza con el capítulo: cuanto más se automatiza, más importa que las definiciones y los permisos estén donde las máquinas puedan leerlos.

Destacado

Automatización del lineage y el catálogo de datos

Automatización del lineage y el catálogo de datos: qué se extrae solo y qué necesita a una persona

El metadato se reparte en dos mitades con economías opuestas: la que emiten los sistemas en cada ejecución y se regenera sola, y la que escribe una persona y se degrada con cada cambio. El capítulo 27 de la guía explica cómo automatizar la primera con OpenLineage y por qué conviene documentar al 100 % el conjunto pequeño de activos que de verdad se consulta, en lugar de perseguir un porcentaje de cobertura. Incluye panorama de plataformas, criterios de selección, antipatrones, checklist y FAQ.

Blog de Dataprix


Entradas de blog

Testing de pipelines y datos: qué probar, cuándo y qué no merece la pena

El capítulo anterior y el complemento natural del de esta semana: los tests unitarios, de integración y de contratos verifican la lógica de un pipeline antes de desplegarlo, del mismo modo que el linaje emitido en cada ejecución documenta lo que el pipeline hace después. Si una transformación está probada y declarada como código, su linaje se obtiene sin coste adicional.

Blog de Dataprix


Software empresarial

Collate Unified AI Platform

Collate Unified AI Platform

Plataforma SaaS de gobernanza con catálogo unificado, motor de linaje y clasificación automática de datos sensibles, de la compañía que impulsa el proyecto open source OpenMetadata. Encaja con la mitad del metadato que el capítulo de esta semana propone automatizar.

Snowflake Cloud Data Platform

Snowflake Cloud Data Platform

Plataforma de datos gestionada en la nube para data warehousing, data lakes, ingeniería y ciencia de datos, con escalado elástico y pago por uso. Esta semana suma una integración con STACKIT, la nube soberana europea del grupo Schwarz.

Google BigQuery

Google BigQuery

Almacén de datos serverless de Google Cloud, con motor Dremel y separación entre almacenamiento y cómputo para consultar petabytes sin gestionar infraestructura. Desde esta semana, Microsoft Fabric puede replicarlo de forma continua con soporte para producción.


Noticias del sector datos

Publicado esta semana en Dataprix.net

Logo de dbt Labs

dbt v2 llega a disponibilidad general: el motor en Rust pasa a ser el dbt de referencia

Fusion se convierte en dbt v2 y Core pasa a ser dbt v1, ambos bajo Apache 2.0. Llega también dbt State, que solo reconstruye lo que ha cambiado, y Lake Compute ejecuta transformaciones con DuckDB sobre tablas Iceberg.

Logo de PostgreSQL

PostgreSQL 19 retira las consultas de grafos SQL/PGQ y se queda sin fecha de lanzamiento

La comunidad prefiere retrasar la versión antes que cargar cinco años de soporte con un diseño que no convence. REPACK CONCURRENTLY y los datos temporales siguen dentro; la fecha de disponibilidad general, por ahora, no.

Logo de Snowflake

Snowflake se integra con STACKIT, la nube soberana del grupo Schwarz, con los datos en Iceberg y las claves en la UE

Centros de datos en Alemania y Austria, claves de cifrado bajo custodia europea y datos en un formato abierto que otros motores pueden leer. El catálogo de funciones y las fechas aún están por concretar.

Logo de Databricks

Databricks lleva a disponibilidad general Genie One MCP para dar contexto de negocio gobernado a cualquier agente de IA

Claude, ChatGPT o Cursor pueden consultar los datos a través de las métricas y definiciones aprobadas de Genie Ontology, con los permisos de Unity Catalog aplicados al usuario que pregunta.

Ilustración de computación en la nube

Microsoft Fabric lleva a disponibilidad general la réplica continua de Google BigQuery en OneLake

Réplica casi en tiempo real sin procesos ETL y con el cómputo de Fabric gratuito. Conviene revisar antes dos puntos: los costes que genera en el lado de Google y el requisito de clave primaria en las tablas con actualizaciones.


Recurso destacado

Tutorial dbt completo con DuckDB y Docker: pipeline, tests y docs

Con dbt v2 en disponibilidad general y Lake Compute ejecutando transformaciones sobre DuckDB, es un buen momento para practicar dbt sin depender de un almacén en la nube. Nuestro tutorial construye paso a paso un proyecto completo con DuckDB como base de datos analítica y Docker para tener un entorno reproducible: modelos en tres capas, tests de calidad de datos y documentación autogenerada con el grafo de linaje, que es justo la mitad del metadato que el capítulo de esta semana propone obtener sin escribirla a mano.

Si tu equipo está pensando en adoptar dbt o en ordenar sus transformaciones como código, este es el punto de partida. Seguir el tutorial en Dataprix →

Dataprix · C/ Font dels Arcs, 10 · La Florida, Barcelona 08130

in LinkedIn 𝕏 Follow f Facebook

Los contenidos de este boletín se elaboran con asistencia de inteligencia artificial y se revisan y editan por el equipo editorial de Dataprix, que asume la responsabilidad editorial.