DATA LAKE: QUÉ ES, CÓMO FUNCIONA Y PARA QUÉ SIRVE

Un data lake es un repositorio centralizado diseñado para almacenar grandes volúmenes de datos en su formato original o nativo, sin necesidad de estructurarlos ni transformarlos previamente. Imagina un lago real: llegan ríos de diferentes tamaños y composiciones (datos de muchas fuentes), y todo se guarda tal cual en el lago. Luego, cuando alguien necesita algo específico, va y lo extrae/procesa según lo que quiera hacer.

Ejemplos reales de uso

  • Netflix guarda logs de visualización, ratings, metadatos, clics → entrena algoritmos de recomendación.
  • Empresas de retail analizan imágenes de productos + datos de ventas + redes sociales IoT en manufactura: sensores generan terabytes diarios → se almacenan crudos y se procesan solo lo necesario.
  • Bancos y aseguradoras para detección de fraude con patrones en datos no estructurados.

Características de un data lake

Aspecto Data Lake Data Warehouse (tradicional)
Tipo de datos Estructurados, semiestructurados y no estructurados (logs, JSON, imágenes, videos, IoT, texto libre, etc.) Principalmente estructurados (tablas limpias)
Esquema Schema-on-read (se define cuando se lee/usa) Schema-on-write (se define al cargar)
Formato al llegar Sin procesar / raw Limpio, transformado y modelado
Volumen Prácticamente ilimitado (escalable con cloud) Limitado y más costoso por GB
Costo de almacenamiento Muy bajo (object storage: S3, GCS, Azure Data Lake, etc.) Más alto
Usuarios típicos Data scientists, ingenieros de ML, analistas avanzados Analistas de negocio, reportes BI
Uso principal Machine Learning, IA, análisis exploratorio, big data, streaming Reportes, dashboards, BI estructurado