Data lakehouse: qué es y cómo funciona
Un Lakehouse (o Data Lakehouse) es una arquitectura moderna de gestión de datos que combina lo mejor de dos mundos tradicionales en bases de datos y big data:-
Data Lake → almacenamiento masivo, barato y flexible de datos en bruto (estructurados, semi-estructurados y no estructurados).
Data Warehouse → consultas rápidas, confiables, con transacciones ACID, gobernanza y buena performance en análisis SQL.
| Característica | Data Warehouse (tradicional) | Data Lake (tradicional) | Data Lakehouse |
|---|---|---|---|
| Tipos de datos | Principalmente estructurados | Todo tipo (raw) | Todo tipo (raw + estructurado) |
| Costo de almacenamiento | Alto | Muy bajo | Muy bajo |
| Performance en consultas SQL | Excelente | Baja-mala | Muy buena (casi igual a warehouse) |
| Transacciones ACID | Sí | No (o muy limitada) | Sí |
| Soporte Machine Learning / IA | Limitado | Bueno | Excelente (mismo formato open) |
| Gobernanza y calidad | Muy buena | Débil | Muy buena |
| Casos de uso típicos | BI, reporting | Big data, DS/ML | BI + DS/ML + IA + streaming |
¿Cómo se logra esto técnicamente?
- Almacenamiento barato y escalable → normalmente object storage (S3, Azure Data Lake, Google Cloud Storage)
- Formato de tablas abierto + capa de metadatos → los más populares son:
- Delta Lake
- Apache Iceberg
- Apache Hudi
- Transacciones ACID.
- Time travel (viajar en el tiempo a versiones anteriores).
- Schema enforcement y evolution.
- Upserts, deletes, merges (DML completo).
- Motor de consulta potente → Spark, Trino, Presto, Snowflake, Dremio, Microsoft Fabric, Google BigLake, etc.