|
|
|
|
Si la orquestación decidía cuándo se ejecuta cada cosa, el capítulo de esta semana se ocupa de la pregunta anterior: cómo saber que lo que se va a ejecutar está bien antes de que toque datos de verdad. El nuevo capítulo de la guía separa dos disciplinas que se confunden a menudo —las pruebas en desarrollo, que cazan errores de lógica, y la validación en producción, que vigila el dato real— y ordena las primeras en tres niveles: unitarias sobre transformaciones aisladas, de integración en entornos efímeros y validación de contratos entre productor y consumidor. El título ya avisa de que hay una segunda mitad menos habitual en este tipo de textos: qué no merece la pena probar, porque una suite que tarda cuarenta minutos en pasar es una suite que nadie ejecuta.
En el sector, la semana ha traído dos lecturas de la misma cifra. Snowflake acelera por tercer trimestre consecutivo hasta un 37 % en ingresos por producto y MongoDB crece un 30 % entrando por fin en beneficios GAAP: el gasto en plataformas de datos sigue subiendo, no ajustándose. Salesforce y Anthropic anuncian Claudeforce, que mete el CRM dentro de Claude con 37 habilidades de venta y —esto es lo relevante— hace que el agente herede el modelo de permisos en lugar de replicarlo. Y dos movimientos en la capa de control: Apache Iceberg aprueba aplicar las restricciones de lectura en el catálogo en vez de en cada motor, y el 12 de septiembre entra en juego la obligación de acceso por diseño del Data Act europeo.
|
Destacado
|
Capítulo 26 de la guía práctica de arquitectura de datos. La premisa es simple y tiene consecuencias: si el pipeline es código, se prueba como código. A partir de ahí, el capítulo distingue las pruebas en desarrollo de la validación en producción —complementarias, no sustitutivas— y despliega tres niveles. Las unitarias verifican transformaciones aisladas con datos sintéticos en segundos, cubriendo los casos que siempre acaban rompiendo algo: nulos, duplicados, valores extremos. Las de integración comprueban cómo encajan los componentes en entornos efímeros, levantados y destruidos para cada ejecución, lo que además evita el staging podrido y el problema de compliance de tener datos personales reales en un entorno de pruebas. Y la validación de contratos convierte el acuerdo entre productor y consumidor en un esquema ejecutable que se verifica en CI/CD, no en un correo. En herramientas, el capítulo cita pytest e Hypothesis, Great Expectations y Soda, las pruebas unitarias nativas de dbt desde la 1.8, Testcontainers y las capacidades de branching del propio almacén. Dos ideas que conviene subrayar: la testabilidad se diseña —separar la lógica de negocio de la infraestructura es lo que hace barato probar— y las fixtures son un activo vivo, que se versiona y se enriquece después de cada incidente.
Blog de Dataprix
|
|
Entradas de blog
|
|
El capítulo anterior, y el que da sentido al de esta semana: la orquestación declara las dependencias en un grafo versionado y define qué se reintenta y cuándo, pero solo es seguro reintentar lo que es idempotente — y eso es exactamente el tipo de propiedad que se demuestra con pruebas, no con confianza. Incluye el repaso comparado de Airflow, Dagster y Prefect frente a la orquestación nativa de las plataformas.
Blog de Dataprix
|
|
|
Software empresarial
|
|
Catálogo y gobierno de metadatos con actualización automática a medida que se ejecutan los pipelines. Viene al hilo de la votación de Iceberg: si la política de acceso se va a aplicar en el catálogo, lo que ese catálogo sepa de cada columna —quién es el propietario, qué contiene, qué sensibilidad tiene— deja de ser documentación y pasa a ser configuración de seguridad.
|
|
|
CRM en la nube con marketing, ventas, servicio y operaciones en hubs modulares. Es el contrapunto natural a Claudeforce para quien no está en el ecosistema de Salesforce: la pregunta que deja el anuncio no es qué modelo se usa, sino si el CRM expone permisos y acciones de forma que un agente pueda operar dentro de ellos y quede rastro de lo que hace.
|
|
|
Entorno open source para construir flujos de trabajo sobre datos. Aquí por el ángulo del destacado: en un lienzo visual, la testabilidad depende de lo mismo que en código —nodos con una responsabilidad clara y separados del acceso a la fuente— porque un flujo donde la lógica y la conexión viven en el mismo bloque solo se puede probar contra el sistema real.
|
|
|
Noticias del sector datos
Publicado esta semana en Dataprix.net
|
|
1.491 millones de dólares en ingresos por producto, un 37 % más, con retención neta del 126 % y 9.000 millones de contratado pendiente de reconocer. Como factura por consumo, su curva es una medida bastante directa de la carga de trabajo real que se está ejecutando. La contrapartida es presupuestaria: si su consumo sigue esa misma pendiente, conviene revisar los controles de coste antes de que lo haga la factura.
|
|
|
El dato interesante está en el desglose: Atlas creció cerca del 29 % y Enterprise Advanced —la edición autogestionada— alrededor del 36 %. El producto que se instala en casa avanza más rápido que el de la nube, algo coherente con residencia del dato, contratos vigentes o control de coste. No conviene dar por muerta la opción autogestionada al dibujar la arquitectura.
|
|
|
Integración en las dos direcciones: un plugin con 37 habilidades de venta dentro de Claude, y Claude como modelo por defecto del motor de razonamiento de Agentforce, dentro del perímetro de confianza de Salesforce vía Amazon Bedrock. Lo relevante para arquitectura es que el agente hereda el modelo de permisos del CRM en lugar de replicarlo, y que el acceso se expone por servidores MCP.
|
|
|
Las restricciones de columna y de fila pasan a aplicarse en el catálogo y no en cada motor, con un kit de compatibilidad para validar implementaciones. En un lakehouse donde Spark, Trino, Flink y DuckDB leen las mismas tablas, la política deja de definirse tantas veces como motores haya. El catálogo se convierte en componente de seguridad, y eso cambia los criterios para elegirlo.
|
|
|
Todo producto conectado que se introduzca en el mercado de la UE a partir de esa fecha debe permitir al usuario acceder a los datos que genera de forma fácil, segura y, cuando sea técnicamente factible, directa y gratuita, en formato estructurado y legible por máquina. La telemetría deja de ser un activo solo interno: hay que separar el dato bruto del inferido y tratar el esquema como un compromiso contractual.
|
|
|
Recurso destacado
|
|
Dos resultados trimestrales en la misma semana dicen lo mismo desde ángulos distintos: el gasto en plataformas de datos crece, y crece por consumo. Eso convierte la elección de plataforma en una decisión con consecuencias que se pagan cada mes, no en una compra que se cierra una vez.
La clasificación de Dataprix compara las principales plataformas de datos empresariales —almacén, lakehouse, ingesta, modelo de coste y encaje con el resto del stack— con criterio propio y enfoque en el mercado en español. Ver la clasificación en Dataprix →
|
|
Dataprix · C/ Font dels Arcs, 10 · La Florida, Barcelona 08130
|
|
Los contenidos de este boletín se elaboran con asistencia de inteligencia artificial y los revisa y edita el equipo editorial de Dataprix.
|
| |
|
|