Stratégie d’architecture des données pour la qualité des données

Magnifique bibliothèque construite dans les années 1960

Auteur

Grzegorz Przybycień

Senior Product Manager

Watson Knowledge Catalog

La mauvaise qualité des données est l’un des principaux obstacles auxquels sont confrontées les entreprises qui aspirent à être davantage axées sur les données. Des décisions inopportunes et des processus métier erronés, des opportunités de revenus manquées, des initiatives commerciales infructueuses et des systèmes de données complexes peuvent tous découler de problèmes de qualité des données. Un seul de ces problèmes peut s’avérer coûteux pour une entreprise. Devoir tous les gérer simultanément peut être dévastateur.

Plusieurs facteurs déterminent la qualité des données de votre entreprise, tels que leur exactitude, leur exhaustivité ou encore leur cohérence. Mais il existe un autre facteur qui n’est pas reconnu à sa juste valeur : votre architecture de données.

Comment une architecture de données adaptée améliore la qualité des données

Une architecture de données adéquate peut aider votre entreprise à améliorer la qualité des données, car elle fournit le cadre qui définit la manière dont les données sont recueillies, transportées, stockées, sécurisées, employées et partagées pour des cas d’utilisation liés à la business intelligence et à la science des données.

La première génération d’architectures de données, représentée par les entrepôts de données d’entreprise et les plateformes de business intelligence, se caractérisait par des milliers de tâches ETL, de tableaux et de rapports que seul un petit groupe d’ingénieurs de données spécialisés comprenait, ce qui se traduisait par un impact positif sous-estimé sur l’activité. La nouvelle génération de plateformes de big data et de tâches par lots longue durée gérées par une équipe centrale d’ingénieurs de données a souvent conduit à des marécages de data lakes.

Ces deux approches étaient généralement des architectures monolithiques et centralisées, organisées autour de fonctions mécaniques d’ingestion, de traitement, de nettoyage, d’agrégation et de livraison des données. Cela a créé un certain nombre de goulets d’étranglement organisationnels et technologiques qui ont empêché l’intégration et la mise à l’échelle des données à plusieurs niveaux : changement constant du paysage des donnéesprolifération des sources et des consommateurs de donnéesdiversité des transformations et des traitements de données requis par les cas d’utilisation, et rapidité de réponse aux changements.

Mixture of Experts | 12 décembre, épisode 85

Décryptage de l’IA : Tour d’horizon hebdomadaire

Rejoignez notre panel d’ingénieurs, de chercheurs, de chefs de produits et autres spécialistes de premier plan pour connaître l’essentiel de l’actualité et des dernières tendances dans le domaine de l’IA.

Que peut apporter une architecture de données moderne à votre entreprise ?

Une architecture de données moderne telle que le maillage de données et la data fabric vise à connecter facilement de nouvelles sources de données et à accélérer le développement de pipelines spécifiques à des cas d’utilisation dans des environnements sur site, hybrides et multicloud. Associée à une gestion efficace du cycle de vie des données, qui évolue vers la gestion des données en tant que produit, une architecture de données moderne peut permettre à votre entreprise de :

  • Permettre aux intendants des données de garantir la conformité, la protection et la sécurité des données
  • renforcer la confiance dans les données en obtenant une visibilité sur leur provenance, leur évolution et les personnes qui les emploient ;
  • surveiller et identifier les problèmes de qualité des données au plus près de la source afin d’atténuer leur impact potentiel sur les processus ou les workloads en aval ;
  • adopter efficacement des plateformes de données et de nouvelles technologies pour une gestion efficace des données ;
  • Appliquer des métadonnées pour contextualiser les données existantes et nouvelles afin de les rendre consultables et détectables
  • Effectuer le profilage des données (examiner, analyser et créer des résumés des jeux de données)
  • réduire la duplication et la fragmentation des données.

Comme votre architecture dicte la manière dont vos actifs et vos ressources de gestion des données sont structurés, elle joue un rôle essentiel dans l’efficacité avec laquelle votre entreprise accomplit ces tâches. En d’autres termes, l’architecture de données est un élément fondamental de votre stratégie métier pour une meilleure qualité des données. Pour bénéficier pleinement des capacités essentielles des solutions modernes de gestion de la qualité des données, les organisations doivent :

  • appliquer la gouvernance des données à l’échelle de l’entreprise en complétant les processus manuels de qualité des données par des métadonnées et des technologies liées à l’IA (lien externe à ibm.com) ;
  • effectuer un contrôle de la qualité des données basé sur des règles préconfigurées ;
  • développer une traçabilité de modélisation des données pour effectuer une analyse des causes racines des problèmes de qualité des données ;
  • rendre la valeur d’un jeu de données immédiatement compréhensible ;
  • pratiquer une bonne hygiène des données sur toutes les interfaces.

Concevoir une architecture de données qui améliore la qualité des données

Une stratégie de données peut aider les architectes de données à créer et à mettre en œuvre une architecture qui améliore la qualité de ces données. Les étapes pour développer une stratégie de données efficace comprennent :

1. Définir les objectifs métier que vous souhaitez atteindre grâce à vos données

Par exemple, un établissement financier peut chercher à améliorer sa conformité réglementaire, à réduire ses coûts et à augmenter ses revenus. Les parties prenantes peuvent identifier des cas d’utilisation métier pour certains types de données, tels que l’analyse de données en temps réel au fur et à mesure de leur intégration afin d’automatiser la prise de décision et de baisser les dépenses.

2. Dresser l’inventaire des ressources de données existantes et cartographier les flux de données actuels

Cette étape consiste à identifier et à répertorier toutes les données de l’entreprise dans une liste d’inventaire centralisée ou fédérée, éliminant ainsi les silos de données. La liste doit détailler l’emplacement de chaque jeu de données et les applications et cas d’utilisation qui en dépendent. Ensuite, sélectionnez les données nécessaires à vos cas d’utilisation clés et hiérarchisez les domaines de données qui les contiennent.

3. Élaboration d’une nomenclature standardisée

Une convention de dénomination et un format de données harmonisé (classes de données) pour les données utilisées dans l’entreprise contribuent à garantir la cohérence et l’interopérabilité des données entre les services (domaines) et les cas d’utilisation.

4. Identification des modifications à apporter à l’architecture existante

Déterminez les changements qui permettront d’optimiser vos données pour atteindre vos objectifs métier. L’étude des différents types d’architectures de données modernes, telles que la data fabric et le maillage de données, peut vous aider à choisir la structure de données la mieux adaptée à vos besoins commerciaux.

5. Définir les KPI qui permettront d’évaluer l’efficacité de l’architecture de données

Créez des KPI et utilisez des analyses avancées qui relient la mesure du succès de votre architecture à la qualité des données qu’elle prend en charge.

6. Créer une feuille de route pour votre architecture de données

Les entreprises peuvent élaborer un plan de déploiement pour mettre en œuvre l’architecture et la gouvernance des données dans trois à quatre domaines par trimestre.

Architecture des données et IBM

Une architecture de données bien conçue crée une base pour la qualité des données grâce à la transparence et à la standardisation qui définissent la manière dont votre entreprise perçoit, utilise et parle des données.

Comme indiqué précédemment, la data fabric est l’une de ces architectures. Elle automatise la découverte, la gouvernance et la gestion de la qualité des données et simplifie l’accès en libre-service aux données distribuées dans un environnement en cloud hybride. Elle peut englober les applications qui génèrent et utilisent des données, ainsi qu’un nombre illimité de référentiels de stockage de données tels que les entrepôts de données, les data lakes (qui stockent de grands volumes de big data), les bases de données NoSQL (qui stockent des données non structurées) et les bases de données relationnelles qui utilisent le langage SQL.

Découvrez les avantages de la data fabric et d’IBM Cloud Pak for Data.

 
Solutions connexes
Solutions de qualité des données

IBM propose des solutions de qualité des données qui optimisent des aspects clés tels que la précision, l’exhaustivité et la cohérence.

Découvrir les solutions de qualité des données
IBM Databand

IBM Databand permet de surveiller la qualité des données en temps réel pour détecter les problèmes de mauvaise qualité des données et garantir une meilleure qualité des données.

Découvrir Databand
Services de conseil pour les données et les analyses

Avec IBM Consulting, exploitez les données de votre entreprise et développez une organisation basée sur les informations pour tirer des avantages métier.

Découvrir les services d’analytique
Passez à l’étape suivante

IBM propose des solutions de qualité des données qui optimisent des aspects clés tels que la précision, l’exhaustivité et la cohérence.

  1. Découvrir les solutions de qualité des données
  2. Découvrir les services d’analytique