06-03-2026

Data lakehouse: qué es y cómo funciona

Un Lakehouse (o Data Lakehouse) es una arquitectura moderna de gestión de datos que combina lo mejor de dos mundos tradicionales en bases de datos y big data:
    Data Lake → almacenamiento masivo, barato y flexible de datos en bruto (estructurados, semi-estructurados y no estructurados). Data Warehouse → consultas rápidas, confiables, con transacciones ACID, gobernanza y buena performance en análisis SQL.
En lugar de tener dos sistemas separados (como se hacía antes), el lakehouse unifica todo en una sola plataforma.
Característica Data Warehouse (tradicional) Data Lake (tradicional) Data Lakehouse
Tipos de datos Principalmente estructurados Todo tipo (raw) Todo tipo (raw + estructurado)
Costo de almacenamiento Alto Muy bajo Muy bajo
Performance en consultas SQL Excelente Baja-mala Muy buena (casi igual a warehouse)
Transacciones ACID Sí No (o muy limitada) Sí
Soporte Machine Learning / IA Limitado Bueno Excelente (mismo formato open)
Gobernanza y calidad Muy buena Débil Muy buena
Casos de uso típicos BI, reporting Big data, DS/ML BI + DS/ML + IA + streaming

¿Cómo se logra esto técnicamente?

  • Almacenamiento barato y escalable → normalmente object storage (S3, Azure Data Lake, Google Cloud Storage)
  • Formato de tablas abierto + capa de metadatos → los más populares son: Estos formatos añaden sobre archivos Parquet/ORC:
    • Transacciones ACID.
    • Time travel (viajar en el tiempo a versiones anteriores).
    • Schema enforcement y evolution.
    • Upserts, deletes, merges (DML completo).
  • Motor de consulta potente → Spark, Trino, Presto, Snowflake, Dremio, Microsoft Fabric, Google BigLake, etc.