Un Data Lake permite almacenar datos estructurados y no estructurados a bajo costo, para procesarlos después según se necesite, en lugar de forzar un esquema rígido desde el momento en que llegan.
Capa de almacenamiento: Azure Data Lake Storage Gen2
ADLS Gen2 combina el almacenamiento económico de Blob Storage con un espacio de nombres jerárquico, lo que mejora el rendimiento de operaciones sobre carpetas y es la base recomendada para cualquier Data Lake en Azure.
Organización en zonas
Una estructura común divide el lago en tres zonas: raw (datos tal como llegan de la fuente, sin modificar), curated/silver (datos limpios y validados) y gold (datos agregados, listos para consumo de negocio o BI). Este ordenamiento evita que los datos crudos y los procesados se mezclen.
Procesamiento con Azure Databricks
Databricks, sobre Apache Spark, permite transformar grandes volúmenes de datos en paralelo, aplicando limpieza, validación de calidad y enriquecimiento antes de moverlos de la zona raw a la curated.
Consumo con Synapse Analytics
Azure Synapse Analytics conecta el Data Lake con motores de consulta SQL y con Power BI, permitiendo que analistas de negocio consuman los datos de la zona gold sin necesidad de escribir código de procesamiento distribuido.
Gobierno desde el día uno
Sin catalogación de metadatos y control de acceso a nivel de carpeta o columna (por ejemplo con Microsoft Purview), un Data Lake tiende a convertirse en un "data swamp": datos acumulados sin que nadie sepa qué contienen ni quién puede usarlos.