Un catálogo de datos rara vez muere de golpe: simplemente deja de actualizarse. Este mes le ha pasado a Amundsen, el catálogo que Lyft liberó en 2019 y cuyo repositorio acaba de archivarse por inactividad, y es lo que les ocurre a muchos catálogos dentro de las empresas. El nuevo capítulo de la guía de arquitectura de datos parte de esa observación para separar el metadato que emiten los propios sistemas en cada ejecución, que se puede automatizar con OpenLineage, del que tiene que escribir una persona y se degrada con cada cambio. El capítulo anterior, sobre testing de pipelines, completa el bloque. En el directorio acompañamos la edición con Collate, la plataforma de la compañía que impulsa OpenMetadata, y con las fichas de Snowflake y Google BigQuery, dos de los protagonistas de la semana.
En el sector, el open source deja dos noticias de peso: dbt v2, el motor reescrito en Rust, llega a disponibilidad general junto con dbt State, y PostgreSQL 19 retira las consultas de grafos SQL/PGQ y se queda de momento sin fecha de lanzamiento. Snowflake se integra con STACKIT, la nube soberana del grupo Schwarz, con los datos en Iceberg y las claves en la UE; Databricks abre a cualquier agente de IA el contexto de negocio gobernado de Genie One, y Microsoft Fabric ya replica BigQuery con soporte para producción. El hilo común enlaza con el capítulo: cuanto más se automatiza, más importa que las definiciones y los permisos estén donde las máquinas puedan leerlos.
El metadato se reparte en dos mitades con economías opuestas: la que emiten los sistemas en cada ejecución y se regenera sola, y la que escribe una persona y se degrada con cada cambio. El capítulo 27 de la guía explica cómo automatizar la primera con OpenLineage y por qué conviene documentar al 100 % el conjunto pequeño de activos que de verdad se consulta, en lugar de perseguir un porcentaje de cobertura. Incluye panorama de plataformas, criterios de selección, antipatrones, checklist y FAQ.
El capítulo anterior y el complemento natural del de esta semana: los tests unitarios, de integración y de contratos verifican la lógica de un pipeline antes de desplegarlo, del mismo modo que el linaje emitido en cada ejecución documenta lo que el pipeline hace después. Si una transformación está probada y declarada como código, su linaje se obtiene sin coste adicional.
Plataforma SaaS de gobernanza con catálogo unificado, motor de linaje y clasificación automática de datos sensibles, de la compañía que impulsa el proyecto open source OpenMetadata. Encaja con la mitad del metadato que el capítulo de esta semana propone automatizar.
Plataforma de datos gestionada en la nube para data warehousing, data lakes, ingeniería y ciencia de datos, con escalado elástico y pago por uso. Esta semana suma una integración con STACKIT, la nube soberana europea del grupo Schwarz.
Almacén de datos serverless de Google Cloud, con motor Dremel y separación entre almacenamiento y cómputo para consultar petabytes sin gestionar infraestructura. Desde esta semana, Microsoft Fabric puede replicarlo de forma continua con soporte para producción.
Fusion se convierte en dbt v2 y Core pasa a ser dbt v1, ambos bajo Apache 2.0. Llega también dbt State, que solo reconstruye lo que ha cambiado, y Lake Compute ejecuta transformaciones con DuckDB sobre tablas Iceberg.
La comunidad prefiere retrasar la versión antes que cargar cinco años de soporte con un diseño que no convence. REPACK CONCURRENTLY y los datos temporales siguen dentro; la fecha de disponibilidad general, por ahora, no.
Centros de datos en Alemania y Austria, claves de cifrado bajo custodia europea y datos en un formato abierto que otros motores pueden leer. El catálogo de funciones y las fechas aún están por concretar.
Claude, ChatGPT o Cursor pueden consultar los datos a través de las métricas y definiciones aprobadas de Genie Ontology, con los permisos de Unity Catalog aplicados al usuario que pregunta.
Réplica casi en tiempo real sin procesos ETL y con el cómputo de Fabric gratuito. Conviene revisar antes dos puntos: los costes que genera en el lado de Google y el requisito de clave primaria en las tablas con actualizaciones.
Con dbt v2 en disponibilidad general y Lake Compute ejecutando transformaciones sobre DuckDB, es un buen momento para practicar dbt sin depender de un almacén en la nube. Nuestro tutorial construye paso a paso un proyecto completo con DuckDB como base de datos analítica y Docker para tener un entorno reproducible: modelos en tres capas, tests de calidad de datos y documentación autogenerada con el grafo de linaje, que es justo la mitad del metadato que el capítulo de esta semana propone obtener sin escribirla a mano.
Si tu equipo está pensando en adoptar dbt o en ordenar sus transformaciones como código, este es el punto de partida. Seguir el tutorial en Dataprix →
Dataprix · C/ Font dels Arcs, 10 · La Florida, Barcelona 08130
Los contenidos de este boletín se elaboran con asistencia de inteligencia artificial y se revisan y editan por el equipo editorial de Dataprix, que asume la responsabilidad editorial.