¿Qué es un lakehouse de datos?

¿Qué es un lakehouse de datos?

Un lakehouse de datos es una plataforma de datos moderna que combina el almacenamiento de datos flexible y de bajo coste de un data lake con las capacidades de análisis y gestión de datos de alto rendimiento de un almacén de datos.

Históricamente, las organizaciones solían utilizar data lakes y almacenes de datos de forma conjunta. Los data lakes actuaban como un sistema de almacenamiento general para datos estructurados, semiestructurados y no estructurados sin procesar, que luego se movían mediante canalizaciones ETL/ELT a un almacén de datos para casos de uso posteriores, como la inteligencia empresarial (BI) y el análisis predictivo.

Sin embargo, coordinar estos sistemas para proporcionar datos fiables puede suponer un gran gasto tanto de tiempo como de recursos, especialmente en lo que respecta al análisis de datos y las cargas de trabajo de IA. El traslado de datos puede contribuir a que estos queden obsoletos y a la aparición de redundancias, mientras que las capas adicionales de ETL/ELT pueden introducir riesgos para la calidad de los datos y la coherencia

Los lakehouses de datos resuelven estos retos al aplicar capacidades de gestión y análisis de datos, similares a las de los almacenes de datos, directamente a los datos almacenados en los data lakes. Este sistema ayuda a los equipos de datos a unificar la gestión de datos, acelerar el proceso de datos, mejorar la calidad de los mismos y dar soporte a cargas de trabajo escalables de inteligencia artificial (IA) y machine learning (ML).

¿Cómo funciona un lakehouse de datos?

Al igual que un data lake, un lakehouse de datos utiliza un almacenamiento de objetos en la nube de bajo coste. Este enfoque les permite almacenar datos en casi cualquier formato (estructurado, semiestructurado y no estructurado).

Lo que lo convierte en un lakehouse es la capa de gestión de datos tipo almacén que se integra sobre ese almacenamiento, la cual añade estructura de datos y gobierno para dar soporte a cargas de trabajo de análisis y de BI.

La mayoría de los lakehouses de datos se basan en formatos de tabla abierta (OTF), normalmente:

  • Apache Hudi (desarrollado originalmente en Uber y diseñado para el proceso de datos incremental)
  • Apache Iceberg (un formato de alto rendimiento para tablas de análisis de gran volumen)
  • Delta Lake (una opción muy popular desarrollada por Databricks y convertida en código abierto en 2019)

Estas tecnologías actúan como capas de metadatos que organizan los archivos de datos abiertos (como los almacenados en Apache Parquet) en tablas lógicas similares a bases de datos.

Este enfoque permite a las organizaciones trabajar con los datos sin procesar de los data lakes como si se tratara de datos de almacén estructurados, y admite capacidades clave como el viaje en el tiempo, el control de versiones, la evolución de los esquemas, la manipulación de datos y la coherencia transaccional (ACID).

(“ACID” significa atomicidad, consistencia, aislamiento y durabilidad. Estas propiedades ayudan a garantizar la integridad y la fiabilidad de las transacciones de datos).

Con estas capas y características añadidas, los lakehouses hacen que los data lakes sean más fiables e intuitivos de usar. También permiten a los usuarios ejecutar consultas en lenguaje de consulta estructurado (SQL), cargas de trabajo de análisis y otros casos de uso avanzados directamente en un data lake, optimizando así la BI, la IA, el ML y la inteligencia de datos (DI).

Capas de la arquitectura del lakehouse de datos

La arquitectura de un lakehouse de datos suele constar de cinco capas:

  • Capa de ingestión
  • Capa de almacenamiento
  • Capa de metadatos
  • Capa de API
  • Capa de consumo

Capa de ingesta

Esta primera capa recopila datos de una serie de fuentes internas y externas y los prepara para su almacenamiento y análisis. La capa de ingesta puede utilizar conectores para integrarse con fuentes como sistemas de gestión de bases de datos, bases de datos NoSQL, aplicaciones SaaS y fuentes de redes sociales. La ingesta puede ser por lotes o en tiempo real.

Capa de almacenamiento

La capa de almacenamiento aloja conjuntos de datos estructurados, no estructurados y semiestructurados en un almacenamiento de objetos en la nube de bajo coste. Entre los servicios más comunes se incluyen Amazon Simple Storage Service (Amazon S3), Microsoft Azure Blob Storage, Google Cloud Storage y IBM Cloud Object Storage

Los datos se almacenan normalmente en formatos de almacenamiento por columnas optimizados para grandes cargas de trabajo de análisis, como Apache Parquet u Optimized Row Columnar (ORC). Esta capa proporciona un beneficio importante del lakehouse de datos: su capacidad para alojar de forma rentable prácticamente todos los tipos de datos.

Capa de metadatos

La capa de metadatos es un catálogo unificado que organiza y proporciona información sobre los datos en el data lake. Por lo general, funciona con formatos de tabla abiertos como Apache Iceberg, Apache Hudi o Delta Lake.

Las capacidades de esta capa permiten las transacciones ACID, el viaje en el tiempo y el cumplimiento de esquemas, lo que contribuye a mejorar el gobierno de datos. Los controles de acceso robustos en este nivel son críticos para las organizaciones que gestionan datos sensibles y son valiosos para rastrear el acceso a datos y las modificaciones para mantener pistas de auditoría1.

Capa de API

Las interfaces de programación de aplicaciones (API) proporcionan acceso estandarizado a los datos y metadatos del lakehouse. En concreto, esta capa ofrece a los consumidores de datos y a los desarrolladores la oportunidad de utilizar una variedad de motores de análisis y marcos de machine learning (como TensorFlow) para ejecutar análisis avanzados y entrenamiento de modelos directamente sobre los datos del lakehouse.

Capa de consumo

La capa final de la arquitectura del lakehouse de datos aloja aplicaciones y herramientas que tienen acceso a todos los datos almacenados en el data lake. Esto abre el acceso a datos a los usuarios de una organización, que pueden utilizar el lakehouse para realizar tareas como crear paneles de control de inteligencia empresarial, visualizaciones de datos y tareas de machine learning.

¿Qué es una arquitectura de lakehouse Medallion?

La arquitectura de datos Medallion (MDA) es un enfoque de diseño de datos multicapa y centrado en la calidad que garantiza que los datos del lakehouse se limpien, validen y sean fiables progresivamente a medida que pasan de la ingesta al consumo. Puede ayudar a las organizaciones a crear un lakehouse de datos escalable y gobernado, adecuado tanto para los informes empresariales cotidianos como para las cargas de trabajo de análisis avanzado y machine learning.

Esa escalabilidad es crítica para mantener la calidad a medida que crecen los volúmenes de datos. Según un estudio de referencia de enero de 2025, el 87,4 % de las organizaciones consideraron que los marcos de calidad de los datos heredados se volvían operativamente insostenibles más allá de los siete petabytes2.

El marco organiza los datos en tres capas distintas a lo largo de su ciclo de vida: bronce, plata y oro, mejorando la calidad de los datos en cada etapa.

  • La capa de bronce es para los datos sin procesar. Conserva los datos originales exactamente como estaban cuando se recibieron de los sistemas de origen. Esto garantiza que siempre exista un archivo fuente inmutable, eliminando el riesgo de que los datos se pierdan o se sobrescriban durante la transformación.

  • La capa de plata es donde los datos se limpian, estructuran y enriquecen activamente. Unifica los registros conflictivos o duplicados en una única fuente de datos para los análisis y los informes operativos.

  • La capa de oro contiene datos refinados y listos para su uso empresarial, una única fuente fiable ideal para la toma de decisiones estratégicas. Todas las métricas empresariales críticas se definen y se calculan previamente en esta capa.

La capa de oro también refuerza la preparación para la IA. Proporciona un flujo de datos preparados para la IA de alta calidad directamente a las canalizaciones de ML, lo que puede ayudar a mejorar la precisión de los modelos y reducir los esfuerzos de preparación de los datos.

Esta progresión estructurada de los datos garantiza que cualquier archivo de datos final pueda rastrearse hacia atrás a lo largo de su transformación hasta su estado original. También proporciona unos costes más predecibles y, a menudo, más bajos, ya que el almacenamiento de datos y los recursos informáticos pueden optimizarse en función de la finalidad de cada capa.

¿Cuáles son las características clave de un lakehouse de datos?

Los lakehouses de datos ofrecen varias características clave:

  • Formatos de archivo abiertos
  • Transacciones ACID
  • Datos unificados
  • Almacenamiento rentable
  • Flexibilidad en la carga de trabajo
  • Gobierno de datos sólido
  • Escalabilidad
  • Soporte para transmisión en tiempo real

Formatos de archivo abiertos

Los formatos de almacenamiento abiertos y columnares (o formatos de datos abiertos), como Apache Parquet u ORC, mejoran el rendimiento de las consultas y reducen los costes de almacenamiento gracias a una compresión eficiente, la poda de columnas y la aplicación de predicados. Estos formatos son compatibles con los motores de análisis más habituales, lo que permite a las organizaciones acceder a los mismos datos al mismo tiempo. Esta funcionalidad les ayuda a evitar el vendor lock-in y a lograr la interoperabilidad entre sus diferentes herramientas.

Transacciones ACID

La mayoría de los lakehouses de datos utilizan formatos de tabla abiertos como Apache Iceberg, Apache Hudi y Delta Lake para proporcionar transacciones ACID. Estas transacciones, como las inserciones, actualizaciones y eliminaciones, garantizan que los datos se mantengan coherentes y fiables durante y después de las operaciones con datos.

Datos unificados

Un único sistema de almacenamiento de datos crea una plataforma centralizada que puede satisfacer todas las demandas de datos empresariales, reduciendo los silos de datos y la duplicación entre sistemas y equipos. Esta unificación también simplifica la observabilidad de los datos de principio a fin, ya que se reduce considerablemente el movimiento de datos a través de diversas canalizaciones de datos y sistemas.

Almacenamiento rentable

Los data lakehouses aprovechan el almacenamiento de objetos en la nube de bajo coste, lo que los hace más rentables para grandes volúmenes de datos y cargas de trabajo que los almacenes de datos tradicionales. La arquitectura híbrida de un lakehouse de datos también elimina la necesidad de mantener múltiples sistemas de almacenamiento de datos, lo que a menudo reduce los gastos operativos.

Flexibilidad de cargas de trabajo

Los lakehouses de datos pueden abordar diferentes casos de uso a lo largo del ciclo de vida de la gestión de datos. Pueden dar soporte a flujos de trabajo de inteligencia empresarial y visualización basada en datos, o a proyectos más complejos de ciencia de datos (como el entrenamiento de modelos de machine learning o el análisis en tiempo real), todo ello a partir de los mismos datos.

Seguridad y gobierno de datos sólidos

La arquitectura de lakehouse de datos mitiga los problemas de gobierno de los data lakes con catálogos de metadatos centralizados, la aplicación de esquemas y herramientas integradas de gestión de la calidad de los datos. La seguridad de los datos puede reforzarse mediante controles de acceso, monitorización y auditorías, la anonimización de datos, el blockchain e incluso la computación cuántica3,4.

Escalabilidad

Los lakehouses de datos separan el almacenamiento y la computación, lo que permite a los equipos de datos escalarlos por separado. Este desacoplamiento también proporciona la flexibilidad necesaria para acceder a los mismos datos mientras se utilizan diferentes motores o nodos de computación para distintas aplicaciones.

Soporte con transmisión en tiempo real

Los lakehouses de datos modernos están diseñados para las empresas y la tecnología actuales. Muchas fuentes de datos contienen datos en transmisión en tiempo real desde fuentes como dispositivos del Internet de las cosas. El sistema lakehouse soporta estas fuentes mediante la ingesta de datos en tiempo real y el proceso incremental.

¿En qué se diferencia un lakehouse de un almacén de datos o un data lake?

Un lakehouse de datos no es simplemente un almacén de datos combinado con un data lake. Se trata de una arquitectura unificada que aúna lo mejor de ambos en una única plataforma.

Almacén de datos: gobierno y rendimiento sólidos, menor flexibilidad

Los almacenes de datos están diseñados para análisis estructurados. Ofrecen un rendimiento excelente para aplicaciones de inteligencia empresarial y elaboración de informes mediante el almacenamiento y la transformación de los datos de la empresa.

Sin embargo, los almacenes de datos carecen de la flexibilidad de los data lakes. Están limitados por su ineficiencia y sus costes a medida que crecen los volúmenes de datos y las cargas de trabajo. El almacenamiento de datos también requiere esquemas estrictos, lo que significa que los datos deben ajustarse a un modelo predefinido antes de la ingesta en el repositorio de datos (esquema en escritura). Debido a estas limitaciones, no funcionan bien con datos no estructurados o semiestructurados, que son críticos para los casos de uso de IA y ML.

Data lakes: mayor flexibilidad, gobierno y análisis deficientes

Los data lakes permiten a las organizaciones almacenar todo tipo de datos (estructurados, no estructurados y semiestructurados) de diversas fuentes en un solo lugar. Utilizan un enfoque de esquema en lectura, por lo que los modelos de datos se aplican en el momento de su uso y no en el momento de su almacenamiento. Además, suelen contar con un almacenamiento de datos más escalable y asequible (a menudo, almacenamiento de objetos en la nube).

Sin embargo, no disponen de herramientas de proceso de datos integradas y dependen de capacidades externas para realizar análisis. Su tamaño y complejidad también pueden requerir la experiencia de usuarios más técnicos, como científicos de datos e ingenieros de datos. Además, dado que el gobierno de datos se lleva a cabo en una fase posterior, los data lakes pueden ser propensos a los silos de datos, lo que acaba convirtiéndose en pantanos de datos (donde no se puede acceder a los datos de calidad debido a una gestión deficiente).

Lakehouses de datos: flexibilidad de los data lakes con gestión y rendimiento similares a los de un almacén

Los lakehouses de datos están diseñados para resolver los retos de los almacenes de datos y los data lakes, reuniendo sus beneficios en una sola plataforma. Aprovechan un almacenamiento flexible y de bajo coste que admite una amplia variedad de tipos de datos, a la vez que ofrecen capacidades de gestión de datos y de alto rendimiento para dar soporte a cargas de trabajo de BI, análisis e IA/ML en una única arquitectura.

Anson Kokkat, director principal de productos de IBM Software, hace hincapié en la importancia de los lakehouses para los programas de IA modernos:

“Los modelos de IA son tan buenos como la plataforma de datos gobernada y escalable sobre la que se asientan. Un lakehouse de datos adecuado se convierte en la base que transforma los datos empresariales sin procesar en IA lista para producción. Cuando se basa en una arquitectura abierta, esto se traduce en flexibilidad para la IA: usted no está limitado a un único motor, sino que puede integrarse con herramientas de código abierto existentes, como Presto, Apache Spark, OpenSearch y Cassandra”.

Otro beneficio importante: las organizaciones suelen poder implementar los lakehouses de datos junto con sus data lakes y almacenes de datos existentes sin necesidad de desmantelarlos y reconstruirlos por completo.

AI Academy

¿Es la gestión de datos el secreto de la IA generativa?

Explore por qué los datos de alta calidad son esenciales para el uso satisfactorio de la IA generativa.

Preguntas frecuentes sobre los lakehouses de datos

¿Qué es un lakehouse de datos abierto?

Hoy en día, muchos proveedores ofrecen lakehouses de datos abiertos. Esta arquitectura es compatible con datos abiertos y formatos abiertos para almacenar grandes cantidades de datos en formatos independientes del proveedor, como Parquet, Avro y Apache ORC. También puede aprovechar Apache Iceberg para compartir grandes volúmenes de datos a través de un formato de tabla abierto.

¿Cuáles son los problemas habituales de los lakehouses?

Entre los retos habituales de los lakehouses de datos se encuentran las implementaciones complejas (incluidas las migraciones desde plataformas de datos existentes); el equilibrio entre el gobierno y la seguridad de los datos y el acceso unificado a los mismos; y la garantía de que el rendimiento de las consultas se mantenga óptimo a medida que aumentan los volúmenes de datos.

¿Se puede ejecutar IA y ML en una arquitectura de lakehouse de datos?

Sí. Los lakehouses de datos admiten cargas de trabajo de IA y ML al proporcionar acceso unificado a grandes volúmenes de datos diversos con un gobierno sólido. Utilizan datos abiertos y formatos de tabla abiertos para evitar el vendor lock-in y permitir la integración directa entre la capa de almacenamiento y los marcos de ML.

¿Puede un lakehouse de datos sustituir por completo a mi almacén de datos?

Sí, pero que lo haga o no depende de sus prioridades en materia de datos. Los lakehouses son una excelente opción para almacenar datos diversos, big data y dar soporte a cargas de trabajo de IA/ML, mientras que los almacenes siguen siendo útiles para necesidades de datos más estructurados o que requieran un alto rendimiento y baja latencia . Muchas organizaciones utilizan ambas plataformas.

¿Cómo se evita que un lakehouse se convierta en un “pantano de datos”?

Para evitar un pantano de datos es necesario contar con prácticas sólidas de gobierno, calidad y seguridad de datos. Además, una arquitectura de almacenamiento por niveles (Medallion) mantiene los datos organizados, y los formatos de tabla abiertos con transacciones ACID ayudan a garantizar la integridad, la coherencia y la fiabilidad de los datos.

Techsplainers | Pódcast | ¿Qué es un lakehouse de datos?

Escuche: “¿Qué es un lakehouse de datos?”

Siga a Techsplainers: Spotify, Apple Podcasts y Casted.

Autores

Alexandra Jonker

Staff Editor

IBM Think

Alice Gomstyn

Staff Writer

IBM Think

Representación en 3D de una espiral de varios iconos alineados, como una cámara, un potenciómetro de volumen y un portapapeles
Soluciones relacionadas
IBM StreamSets

Cree y gestione canalizaciones de datos de streaming inteligentes a través de una interfaz gráfica intuitiva, y facilite una integración de datos fluida en entornos híbridos y multinube.

Explore StreamSets
IBM watsonx.data

Watsonx.data le permite escalar la analítica y la IA con todos sus datos, residan donde residan, a través de un almacén de datos abierto, híbrido y gobernado.

Descubra watsonx.data
Servicios de asesoramiento sobre datos y análisis

Desbloquee el valor de los datos empresariales con IBM Consulting, y construya una organización impulsada por conocimientos que ofrezca ventajas empresariales.

Descubra los servicios de análisis
De el siguiente paso

Diseñe una estrategia de datos que elimine los silos, reduzca la complejidad y mejore la calidad de los datos para ofrecer experiencias excepcionales a clientes y empleados.

  1. Explore las soluciones de gestión de datos
  2. Descubra watsonx.data
Notas a pie de página

1 Data Lakehouse Architecture: The Evolution of Enterprise Data Management. Journal of Computer Science and Technology Studies. 23 de junio de 2025. 

2 Data Lakehouse Implementation: A Journey From Traditional Data Warehouses. World Journal of Advanced Engineering Technology and Sciences. 26 de febrero de 2025.

3 Data Lakehouse: A Survey and Experimental Study. Science Direct. 26 de septiembre 2024.

4 Minimizing Incident Response Time in Real-World Scenarios Using Quantum Computing. Springer Nature Link. 26 de mayo de 2023.