Testing de pipelines y datos: qué probar, cuándo y qué no merece la pena

Herramientas de Integración, ETLs y Pipelines de datos

Capítulo 25 de la Guía práctica para diseñar y operar la arquitectura de datos de tu empresa. Llevamos varios capítulos construyendo piezas: pipelines de ingesta resilientes, flujos CDC casi en tiempo real y controles de calidad que vigilan cada carga.
Este capítulo responde a la pregunta que las une todas: ¿quién dirige la orquesta? Hablamos de orquestación de pipelines: DAGs, dependencias, políticas de reintento y alertas..


El Change Data Capture (CDC) es la técnica que detecta y propaga los cambios de una base de datos (inserciones, actualizaciones y borrados) a otros sistemas casi en tiempo real. La aproximación log-based —leer el registro de transacciones de la base de datos— es hoy el estándar de facto porque no impacta en el rendimiento del sistema origen, mientras que las variantes trigger-based y query-based quedan relegadas a casos residuales. Debezium, la plataforma open source (Apache 2.0) del ecosistema Kafka, es la referencia del mercado, con su versión estable 3.5.2 publicada en junio de 2026..
Airflow, Prefect, dbt, NiFi y Kafka son un ejemplo de stack de integración —el del modern data stack open-source, código primero— que este capítulo usa como hilo conductor para entender los cuatro planos de un pipeline: quién orquesta (Airflow, Prefect), quién transforma (dbt), quién mueve los datos (NiFi) y sobre qué viajan los eventos en tiempo real (Kafka).
No son "las mejores" herramientas ni la única vía válida. El mercado ofrece desde plataformas comerciales integradas —Informatica, Azure Data Factory, AWS Glue, Talend y el resto del TOP 10 de Dataprix— hasta decenas de alternativas open-source por cada capa.
La pregunta correcta no es "¿qué cinco herramientas elijo?", sino entender los planos, elegir un arquetipo coherente con tu equipo y tu caso, y no usar una herramienta excelente para el trabajo equivocado..