DATA LAKE: QUÉ ES, CÓMO FUNCIONA Y PARA QUÉ SIRVE
Un data lake es un repositorio centralizado diseñado para almacenar grandes volúmenes de datos en su formato original o nativo, sin necesidad de estructurarlos ni transformarlos previamente. Imagina un lago real: llegan ríos de diferentes tamaños y composiciones (datos de muchas fuentes), y todo se guarda tal cual en el lago. Luego, cuando alguien necesita algo específico, va y lo extrae/procesa según lo que quiera hacer.Ejemplos reales de uso
- Netflix guarda logs de visualización, ratings, metadatos, clics → entrena algoritmos de recomendación.
- Empresas de retail analizan imágenes de productos + datos de ventas + redes sociales IoT en manufactura: sensores generan terabytes diarios → se almacenan crudos y se procesan solo lo necesario.
- Bancos y aseguradoras para detección de fraude con patrones en datos no estructurados.
Características de un data lake
| Aspecto | Data Lake | Data Warehouse (tradicional) |
|---|---|---|
| Tipo de datos | Estructurados, semiestructurados y no estructurados (logs, JSON, imágenes, videos, IoT, texto libre, etc.) | Principalmente estructurados (tablas limpias) |
| Esquema | Schema-on-read (se define cuando se lee/usa) | Schema-on-write (se define al cargar) |
| Formato al llegar | Sin procesar / raw | Limpio, transformado y modelado |
| Volumen | Prácticamente ilimitado (escalable con cloud) | Limitado y más costoso por GB |
| Costo de almacenamiento | Muy bajo (object storage: S3, GCS, Azure Data Lake, etc.) | Más alto |
| Usuarios típicos | Data scientists, ingenieros de ML, analistas avanzados | Analistas de negocio, reportes BI |
| Uso principal | Machine Learning, IA, análisis exploratorio, big data, streaming | Reportes, dashboards, BI estructurado |