Blogs

Calidad de datos en el pipeline: validaciones, observabilidad y SLAs

La calidad de datos en el pipeline consiste en verificar los datos de forma automática y continua mientras se mueven y transforman, en lugar de descubrir los errores cuando ya han contaminado informes y modelos. Se apoya en tres capas complementarias: validaciones (tests explícitos que bloquean o marcan datos que incumplen reglas conocidas), observabilidad de datos (monitorización continua de frescura, volumen, esquema y distribución para detectar lo que nadie previó) y SLAs de calidad (compromisos medibles con los consumidores del dato). La regla de oro es el shift-left: cuanto antes se detecta un error en el flujo, más barato resulta corregirlo..

Noticias

La Almoraima, una finca de 14,000 hectáreas situada en el Parque Natural de Los Alcornocales (Cádiz), ha logrado una significativa…
La facturación electrónica está experimentando una transformación estructural que va mucho más allá del cumplimiento normativo.
JOM Metal Parts Manufacturing, empresa especializada en mecanizado de precisión y fabricación de componentes metálicos para sectores…
Westcon-Comstor, distribuidor global de tecnología especializado en soluciones de ciberseguridad, networking y cloud híbrida, anuncia hoy…

Software IT

Databricks Workflows GlobalPipeline
Databricks es una plataforma unificada de datos e inteligencia artificial que engloba funcionalidades de Data Science, Machine Learning y análisis avanzado en un mismo entorno. Su propuesta se basa en la arquitectura Lakehouse, que aúna la flexibilidad de un Data Lake (datos no estructurados) con la eficiencia de un Data Warehouse (datos estructurados)..

Dataiku DSS

Dataiku es una plataforma única de software como servicio que combina la potencia de la ciencia de datos, SQL, Hadoop y Spark. Automatiza todo el ciclo de vida de la ciencia de datos: desde la preparación de los datos, el aprendizaje automático y la analítica avanzada hasta el despliegue de la analítica de producción..

OCI Data Integration

Oracle Cloud Infrastructure Data Integration es una solución en la nube que facilita la integración fluida de datos entre Oracle Cloud Infrastructure y otros servicios en la nube, como Amazon Web Services (AWS). Esta herramienta permite a las empresas aprovechar la escalabilidad y elasticidad de la nube al tiempo que integran sus recursos locales existentes. Su principal ventaja es facilitar la migración de aplicaciones y cargas de trabajo entre entornos sin necesidad de una completa reestructuración..