Qu’est-ce qu’un data lakehouse ?

Qu’est-ce qu’un data lakehouse ?

Un data lakehouse est une plateforme de données moderne qui combine le stockage de données flexible et peu coûteux d'un lac de données avec les capacités d'analyse hautes performance et gestion des données d'un entrepôt de données.

Historiquement, les organisations utilisaient souvent des datalakes et des entrepôts de données en tandem. Les lacs de données servaient de système fourre-tout pour les données brutes structurées, semi-structurées et non structurées , qui étaient ensuite déplacées à l'aide de pipelines ETL / ELT vers un entrepôt de données pour des cas d'utilisation en aval tels que la veille stratégique (BI) et l'analyse prédictive .

Néanmoins, la coordination de ces systèmes pour fournir des données fiables peut s’avérer coûteuse en temps et en ressources, en particulier pour l’analytique des données et les workloads d’IA. Le déplacement des données peut contribuer à l’obsolence et à la redondance des données, tandis que des couches supplémentaires d’ETL/ELT peuvent introduire des risques de qualité et de cohérence des données

Les datalakehouses atténuent ces défis en apportant directement des capacités de gestion et d’analyse de données de type entrepôt aux données stockées dans les datalakes. Cette organisation aide les équipes de données à unifier la gestion des données, à accélérer le traitement des données, à améliorer la qualité des données et à prendre en charge des charges de travail d'intelligence artificielle (IA) et d'apprentissage automatique (AA) évolutives.

Comment fonctionne un data lakehouse ?

Comme un data lake, un data lakehouse utilise un stockage d’objets cloud à faible coût. Cette approche leur permet de stocker des données dans presque tous les formats (structurés, semi-structurés et non structurés).

Ce qui en fait une maison de lac, c'est la couche de gestion des données de type entrepôt construite au-dessus de ce stockage, qui ajoute une structure de données et une gouvernance pour soutenir les charges de travail analytiques et de BI.

La plupart des data lakehouses utilisent les formats de table ouverts (OTF), généralement :

  • Apache Hudi (développé à l'origine par Uber et conçu pour le traitement incrémental des données)
  • Apache Iceberg (un format haute performance pour les tables analytiques massives)
  • Delta Lake (une option populaire développée par Databricks et rendue open source en 2019)

Ces technologies agissent comme des couches de métadonnées qui organisent les fichiers de données ouverts (tels que ceux stockés dans Apache Parquet) en tables logiques, semblables à des bases de données .

Cette approche permet aux entreprises de travailler avec des données brutes comme s’il s’agissait de données d’entrepôt structurées, en soutenant des capacités clés telles que le voyage dans le temps, la gestion des versions, l’évolution des schémas , la manipulation des données et la cohérence transactionnelle (ACID).

(« ACID » signifie atomicité, consistance, isolation et durabilité. Ces propriétés contribuent à garantir l’intégrité et la fiabilité des transactions de données.)

Grâce à ces couches et fonctionnalités supplémentaires, les lakehouses rendent les lacs de données plus fiables et plus intuitifs à utiliser. Ils permettent également aux utilisateurs d’exécuter des requêtes en langage de requête structuré (SQL), des charges de travail analytiques et d’autres cas d’usage avancés directement sur un data lake, simplifiant ainsi le BI, l’IA, l’apprentissage automatique et l’intelligence des données (DI).

Les couches de l’architecture de data lakehouse

L’architecture d’un data lakehouse se compose généralement de cinq couches :

  • Couche d’ingestion
  • Couche de stockage
  • Couche de métadonnées
  • Couche API
  • Couche de consommation

Couche d’ingestion

Cette première couche collecte des données provenant de diverses sources internes et externes et les prépare pour le stockage et l'analyse. La couche d’ingestion peut utiliser des connecteurs pour s’intégrer à des sources telles que les systèmes de gestion de bases de données, les bases de données NoSQL, les applications SaaS et les flux de réseaux sociaux. L’ingestion peut se faire par lots ou en temps réel.

Couche de stockage

La couche de stockage contient des ensembles de données structurés, non structurés et semi-structurés dans un stockage d'objets dans le cloud à faible coût. Parmi les services courants, on peut citer Amazon Simple Storage Service (Amazon S3), Microsoft Azure Blob Storage, Google Cloud Storage et IBM Cloud Object Storage

Les données sont généralement stockées dans des formats de stockage en colonnes optimisés pour les grandes charges de travail analytiques, comme Apache Parquet ou Optimized Row Columnar (ORC). Cette couche présente l'un des principaux avantages du lac de données, à savoir sa capacité à accueillir de manière rentable pratiquement tous les types de données.

Couche de métadonnées

La couche de métadonnées est un catalogue unifié qui organise et fournit des informations sur les data lakes. Il est généralement alimenté par des formats de table ouverts tels que Apache Iceberg, Apache Hudi ou Delta Lake.

Les capacités de cette couche permettent les transactions ACID, le voyage dans le temps et l’application des schémas, ce qui contribue à améliorer la gouvernance des données. Des contrôles d’accès robustes à ce niveau sont essentiels pour les entreprises qui traitent des données sensibles et s’avèrent précieux pour suivre les accès et les modifications apportées aux données afin de maintenir des pistes d’audit.1

Couche API

Les interfaces de programmation d’applications (API) offrent un accès standardisé aux données et métadonnées de lakehouse. Plus exactement, cette couche offre aux consommateurs de données et aux développeurs la possibilité d'utiliser une gamme de moteurs d'analyse et de frameworks d'apprentissage automatique (tels que TensorFlow) pour exécuter des analyses avancées et l'entraînement de modèles directement sur les données du lac de données.

Couche de consommation

La couche finale de l’architecture des lacs de données héberge des applications et outils qui ont accès à toutes les données stockées dans le data lake. Cela ouvre l'accès aux données aux utilisateurs de toute l'organisation, qui peuvent utiliser le lakehouse pour effectuer des tâches telles que la création de tableaux de bord de business intelligence, de visualisations de données et d'emplois en apprentissage automatique.

Qu’est-ce qu’une architecture lakehouse médaillon ?

L’architecture de données en médaillon (MDA) est une approche de conception des données multicouche axée sur la qualité qui garantit que les données du lakehouse sont progressivement nettoyées, validées et fiables tout au long de leur parcours, de l’ingestion à la consommation. Elle peut aider les entreprises à mettre en place un data lakehouse évolutif et gouverné, adapté au reporting quotidien ainsi qu’aux workloads avancées d’analytique et de machine learning.

Cette évolutivité est essentielle pour maintenir la qualité des données à mesure que les volumes augmentent. Selon une étude comparative de janvier 2025, 87,4 % des organisations ont constaté que leurs cadres de qualité des données existants devenaient opérationnellement non viables au-delà de sept pétaoctets. 2

Le cadre organise les données en trois couches distinctes tout au long de son cycle de vie : bronze, argent et or — améliorant la qualité des données à chaque étape.

  • La couche de bronze est réservée aux données brutes. Il préserve les données originales telles qu'elles étaient lorsqu'elles ont été reçues des systèmes sources. Cela garantit qu'il y a toujours un fichier source immuable, ce qui élimine le risque de perte ou d'écrasement des données au cours de la transformation.

  • La couche argentée est l'endroit où les données sont activement nettoyées, structurées et enrichies. Il rassemble les enregistrements contradictoires ou les doublons dans une source de données unique pour l’analytique et le reporting opérationnel.

  • La couche d'or contient des données affinées, prêtes pour l'entreprise, une source d’information unique idéale pour la prise de décision. Tous les indicateurs critiques de l'entreprise sont définis et précalculés dans cette couche.

La couche or renforce également la préparation à l’IA. Elle fournit un flux de données de haute qualité prêt pour l’IA directement vers les pipelines d’apprentissage automatique, ce qui peut aider à améliorer la précision des modèles et à réduire les efforts de préparation des données.

Cette progression structurée des données garantit que tout fichier de données final peut être retracé à travers sa transformation jusqu'à son état d'origine. Elle offre également des coûts plus prévisibles et souvent inférieurs, car le stockage de données et les ressources de calcul peuvent être optimisés en fonction de l’objectif de chaque couche.

Quelles sont les principales caractéristiques d’une data lakehouse ?

Les data lakehouses offrent plusieurs fonctionnalités principales :

  • Formats de fichiers ouverts
  • Transactions ACID
  • Données unifiées
  • Stockage économique
  • Flexibilité de workload
  • Gouvernance robuste des données
  • Évolutivité
  • Support pour le streaming en temps réel

Formats de fichiers ouverts

Les formats de stockage ouverts en colonnes (ou formats de données ouverts) tels qu'Apache Parquet ou ORC améliorent les performances des requêtes et réduisent les coûts de stockage grâce à une compression efficace, à l'élagage des colonnes et à la suppression des prédicats. Ces formats sont compatibles avec les moteurs d'analyse les plus courants, ce qui permet aux organisations d'accéder aux mêmes données, au même moment. Cette fonctionnalité leur permet d'éviter l'enfermement propriétaire et de garantir l'interopérabilité entre leurs différents outils.

Transactions ACID

La plupart des data lakehouses utilisent des formats de table ouverts tels qu’Apache Iceberg, Apache Hudi et Delta Lake pour traiter les transactions ACID. Ces transactions, telles que l’insertion, la mise à jour et la suppression, garantissent la cohérence et la fiabilité des données pendant et après leur opération.

Données unifiées

Un système de stockage de données unique crée une plateforme centralisée qui peut répondre à toutes les demandes de données de l'entreprise, réduisant les silos de données et la duplication dans les systèmes et les équipes. Cette unification simplifie également l'observabilité des données de bout en bout, car les mouvements de données à travers les différents systèmes et pipelines de données sont considérablement réduits.

Stockage économique

Les data lakehouses tirent parti du stockage objet cloud à faible coût, ce qui les rend plus rentables pour les grands volumes de données et les workloads que les entrepôts de données traditionnels. L’architecture hybride d’un data lakehouse élimine également la nécessité de maintenir plusieurs systèmes de stockage de données, ce qui réduit souvent les dépenses opérationnelles.

flexibilité de la charge de travail

Les data lakehouses peuvent être adaptés à différents cas d’utilisation tout au long du cycle de vie de la gestion des données. Ils peuvent prendre en charge les workflows de veille stratégique et de visualisation des données , ou des projets de science des données plus complexes (tels que l'entraînement de modèles d'apprentissage automatique ou l'analyse en temps réel ), le tout sur les mêmes données.

Gouvernance des données et sécurité robustes

L'architecture des data lakehouse atténue les problèmes de gouvernance des data lakes avec des catalogues de métadonnées centralisés, à l'application de schémas et à des outils intégrés de gestion de la qualité des données. La sécurité des données peut être renforcée grâce aux contrôles d’accès, à la surveillance et audits, à l’anonymisation des données, à la blockchain et même à l’informatique quantique.3,4

Évolutivité

Les data lakes séparent le stockage et le calcul, permettant aux équipes de données de dimensionner séparément. Ce découplage offre également la flexibilité d’accéder aux mêmes données en utilisant différents moteurs de calcul ou nœuds pour différentes applications.

Prise en charge du streaming en temps réel

Les data lakehouses modernes sont conçus pour les entreprises et les technologies d'aujourd'hui. De nombreuses sources de données contiennent des données en continu en temps réel provenant de sources telles que les appareils connectés (Internet des objets). Ces sources sont prises en charge grâce à l’ingestion de données en temps réel et à leur traitement incrémentiel.

En quoi un lakehouse diffère-t-il d’un entrepôt de données ou d’un data lake ?

Un data lakehouse n'est pas simplement un entrepôt de données combiné avec un data lake. Il s'agit d'une architecture unifiée qui réunit les meilleurs éléments des deux systèmes en une seule plateforme.

Entrepôts de données : gouvernance et performance solides, moindre flexibilité

Les entrepôts de données sont conçus pour des analyses structurées. Ils offrent d'excellentes performances pour les applications de veille stratégique et de reporting en stockant et en transformant les données de l'entreprise.

Néanmoins, les entrepôts de données manquent de la flexibilité des lacs de données. Ils sont limités par leur inefficacité et leurs coûts lorsque les volumes de données et les charges de travail augmentent. L'entreposage de données exige également des schémas stricts, ce qui signifie que les données doivent être conformes à un modèle prédéfini avant d'être introduites dans le référentiel de données (schéma à l'écriture). À cause de ces contraintes, ils ne fonctionnent pas bien avec les données non structurées ou semi-structurées, qui sont essentielles pour les cas d'utilisation de l'IA et du machine learning.

Data lakes : une flexibilité accrue, une gouvernance et une analytique limitées

Les data lakes permettent aux entreprises de stocker tous les types de données — structurées, non structurées et semi-structurées — provenant de sources diverses en un seul endroit. Ils adoptent une approche de type schéma à la lecture, afin que les modèles de données soient appliqués lorsque les données sont utilisées plutôt que lorsqu’elles sont magasin. Ils disposent également généralement d’un stockage de données plus évolutif et abordable (souvent du Cloud Object Storage).

Néanmoins, ils ne disposent pas d'outils de traitement de données intégrés et s'appuient sur des capacités externes pour effectuer l'analytique. Leur taille et leur complexité peuvent également nécessiter l'expertise d'utilisateurs plus techniques, tels que des data scientists et des ingénieurs de données. Et, parce que la gouvernance des données intervient en aval, les data lakes peuvent être sujets au cloisonnement des données, évoluant ensuite vers des « marécages de données » (où les bonnes données sont inaccessibles en raison d’une mauvaise gestion).

Data lakehouses : la flexibilité d’un data lake avec une gestion et des performances de type entrepôt

Les data lakehouses sont conçus pour résoudre les défis des entrepôts de données et des data lakes, en réunissant leurs avantages au sein d'une seule plateforme. Ils exploitent un stockage flexible et à faible coût qui prend en charge un large éventail de types de données tout en offrant des capacités de gestion des données et de haute performance pour supporter les charges de travail BI, analytiques et IA/ML dans une seule architecture.

Anson Kokkat, Principal Product Manager d'IBM Software, souligne l'importance des lacs pour les programmes d'IA modernes :

« Les modèles d'IA sont aussi bons que la plateforme de données régulée et évolutive qui les sous-tend. Le bon data lakehouse devient la base qui transforme les données brutes de l'entreprise en IA prête à la production. Lorsqu’elle est construite sur une architecture ouverte, ceci se traduit par une flexibilité de l’IA — vous n’êtes pas enfermé dans un seul moteur, vous pouvez vous intégrer avec des outils open source existants tels que Presto, Apache Spark, OpenSearch et Cassandra. »

Un autre avantage majeur : Les organisations peuvent souvent mettre en œuvre des data lakehouses aux côtés de leurs data lakes et entrepôts de données existants sans avoir à tout démonter et reconstruire.

AI Academy

La gestion des données est-elle le secret de l’IA générative ?

Découvrez pourquoi des données de haute qualité sont essentielles pour une utilisation réussie de l’IA générative.

Questions fréquentes sur les data lakehouses

Qu’est-ce qu’un data lakehouse ouvert ?

Aujourd'hui, de nombreux fournisseurs proposent des lakehouses de données ouvertes. Cette architecture prend en charge les données ouvertes et les formats ouverts pour stocker de grandes quantités de données dans des formats indépendants des fournisseurs, tels que Parquet, Avro et Apache ORC. Elle peut également exploiter Apache Iceberg pour partager de grands volumes de données via un format de table ouverte.

Quels sont les problèmes courants liés aux lacs ?

Les défis courants des data lakehouse incluent des implémentations complexes (y compris des migrations depuis des plateformes de données existantes) ; l’équilibre entre la gouvernance des données et la sécurité avec un accès aux données ; et en veillant à ce que la performance reste optimale à mesure que le volume de données augmente.

Pouvez-vous faire fonctionner l'IA et la ML sur une architecture de data lakehouse ?

Oui. Les data lakehouses prennent en charge les workloads IA et de ML en fournissant un accès unifié à de grands volumes de données diversifiées avec une gouvernance solide. Ils utilisent des données ouvertes et des formats de table ouverts pour éviter l’enfermement propriétaire et permettre une intégration directe entre la couche de stockage et les cadres de ML.

Un data lakehouse peut-il remplacer complètement mon entrepôt de données ?

C’est possible, mais la question dépend de vos priorités en matière de données. Les lakehouses sont un choix solide pour stocker des big data diversifiés et supporter des workloads IA/ML, alors que les entrepôts restent utiles pour des besoins de données plus structurés ou performants et à faiblelatence . De nombreuses entreprises utilisent les deux plateformes.

Comment éviter qu'une maison au bord d'un lac ne devienne un « marécage de données » ?

Pour éviter un marécage de données, il faut mettre en place des pratiques robustes en matière de gouvernance, de qualité et de sécurité des données. De plus, une architecture de stockage en couches (médaillon) permet de maintenir les données organisées, tandis que les formats de tables ouverts avec des transactions ACID contribuent à garantir l’intégrité, la cohérence et la fiabilité des données.

Techsplainers | Podcast | Qu'est-ce qu'un data lakehouse ?

Écouter : « Qu’est-ce qu’un data lakehouse ? »

Suivez le podcast Techsplainers : Spotify, Apple Podcasts et Casted.

Auteurs

Alexandra Jonker

Staff Editor

IBM Think

Alice Gomstyn

Staff Writer

IBM Think

Rendu 3D d'une spirale de plusieurs icônes alignées comme un appareil photo, un bouton de volume et un clipboard
Solutions connexes
IBM StreamSets

Créez et gérez des pipelines intelligents de diffusion de données en continu via une interface graphique intuitive, facilitant ainsi une intégration fluide des données dans les environnements hybrides et multicloud.

Découvrir StreamSets
IBM watsonx.data

watsonx.data vous permet d’adapter le dimensionnement des analyses et de l’IA à toutes vos données, où qu’elles se trouvent, grâce à un entrepôt de données ouvert, hybride et gouverné.

Découvrir watsonx.data
Services de conseil pour les données et les analyses

Avec IBM Consulting, exploitez les données de votre entreprise et développez une organisation basée sur les informations pour tirer des avantages métier.

Découvrir les services d’analytique
Passez à l’étape suivante

Élaborez une stratégie de gestion des données qui élimine les silos, réduit la complexité et améliore la qualité des données pour offrir une expérience client et collaborateur exceptionnelle.

  1. Découvrir les solutions de gestion des données
  2. Découvrir watsonx.data
Notes de bas de page

1 Data Lakehouse Architecture : The Evolution of Enterprise Data Management, Journal of Computer Science and Technology Studies, 23 juin 2025. 

2 Mise en œuvre d'un entrepôt de données (Data Lakehouse) : A Journey From Traditional Data Warehouses, World Journal of Advanced Engineering Technology and Sciences, 26 février 2025.

3 Data Lakehouse: A Survey and Experimental Study, Science Direct, 26 septembre 2024.

4. Minimiser le temps de réponse aux incidents dans des scénarios réels grâce à l'informatique quantique, Springer Nature Link, 26 mai 2023.