データ・ガバナンス・チュートリアル: データの取り込み

このチュートリアルは、「高品質なデータを収集する」チュートリアルとデータを保護する」チュートリアルを終了した後に、高品質で保護されたデータを使用するためのものです。 目標は、データ・ファブリック内のデータを評価、共有、シェーピング、および分析することです。

クイック・スタート:

このチュートリアルのサンプルプロジェクトをまだ作成していない場合は、リソースハブから 「データガバナンス」サンプルプロジェクトにアクセスしてください。

このチュートリアルのストーリーは、ゴールデン・バンクには、高品質の顧客住宅ローン・データにアクセスする必要があるいくつかの部門があるということです。 データ・アナリストは、適切なデータを検索して見つけ、その内容を理解して信頼し、他のデータ・アナリストやデータ・サイエンティストが使用できるように準備する必要があります。

チュートリアルをプレビューする

このチュートリアルでは、以下のタスクを実行します:





このチュートリアルを完了するためのヒント
このチュートリアルを正常に完了するためのヒントを以下に示します。

ブラウザー・ウィンドウのセットアップ

このチュートリアルを最適に体験するには、アカウントを1つのブラウザウィンドウで開いておき、このチュートリアルページを別のブラウザウィンドウで開いておくと、両ウィンドウ間を簡単に切り替えることができます。 2 つのブラウザー・ウィンドウを横並びに配置して、見やすくすることを検討してください。

横並びのチュートリアルと UI

ヒント: ユーザー・インターフェースでこのチュートリアルを実行しているときにガイド・ツアーが表示された場合は、 「後で行うこともあります」をクリックします。



前提条件のセットアップ

前提条件のチュートリアルの完了

高品質データのキュレート および データの保護 のチュートリアルを完了します。

  • 高品質データのキュレート ・チュートリアルでは、データ資産をインポートしてエンリッチし、それらをカタログに公開します。
  • Protect your data チュートリアルはデータ保護ルールとマスキング・フローを作成してデータを保護します。



タスク 1: データ資産の理解

カタログ内のデータ資産は、データへのポインター以上のものです。 これらには、データの形式と意味、およびデータ値に関する統計に関する情報が含まれています。 データ資産の価値を理解するには、以下のステップを実行します。

  1. ナビゲーションメニュー から ナビゲーション・メニュー「カタログ」>「すべてのカタログを表示」 を選択します。

  2. Mortgage Approval Catalogを開きます。

    注目資産セクションには 、最近追加された資産と、カタログ作成者が評価およびレビューした評価の高い資産が表示されます。

  3. 主なアセットの非表示 をクリックして、そのセクションを閉じます。

  4. mortgageを検索します。

  5. そのカタログ資産を表示するには、 「MORTGAGE_APPLICANTS_TRUST」 をクリックします。 「概要」 タブおよびサイド・パネルには、資産に関する基本情報 (説明、評価、タグ、資産が配置されている場所、ビジネス用語、データ・クラス、および関連項目など) が表示されます。

  6. プロファイル タブをクリックしてください。 プロファイル情報は、データの内容、品質、およびユーザビリティーを理解するのに役立ちます。

  7. 右にスクロールして、 ZIP_CODE 列を見つけます。

  8. 「ZIP_CODE」 列に自動的に割り当てられたデータ・クラスは、 Commercial and Government Entityです。 自動的に割り当てられるデータ・クラスは異なる場合があることに注意してください。 値は郵便番号であるため、この列は簡単に再分類できます。 ドロップダウン・リストをクリックすると、その他の可能なデータ・クラスとその信頼性レベルが表示されます。 US Zip Codeを選択します。

  9. Asset タブをクリックして、データのプレビューを表示します。

  10. 列に関するメタデータをさらに表示するには、 「概要」 タブに戻ります。 列のリストで、 職業状況 列を検索して、割り当てられたビジネス用語を含むメタデータを確認します。

チェックポイント・アイコン 進捗状況を確認してください

次の図は、カタログ内の MORTGAGE_APPLICANTS_TRUST 資産を示しています。 IBM watsonx.data intelligence メタデータエンリッチメント中にデータアセットに自動的に追加される情報のタイプを探った。 次のタスクでは、このデータ資産を手動でエンリッチします。

MORTGAGE_APPLICANTS_TRUST 資産




タスク 2: 資産のエンリッチと関係の作成

資産に情報を追加することで、資産の価値を高めることができます。 例えば、アセットに関する意見を追加したり、アセット・プロパティーを更新したり、アセットをリンクする関係を作成したりすることができます。 資産を強化し、関係を作成するには、以下の手順を実行します。

  1. MORTGAGE_APPLICANTS_TRUST カタログ資産の場合は、 「レビュー」 タブをクリックします。 このアセットを評価してコメントすることで、他のユーザーがアセットを簡単に見つけられるようにします。

    1. レーティングに 星 5 個 を選択してください。

    2. レビューのために、以下のテキストをコピーして貼り付けます。

      This contains high quality customer data from the mortgage system.
      
    3. 「実行依頼」をクリックします。

  2. 「概要」 タブをクリックします。

  3. アセット名の横にある 「編集 編集 」アイコンをクリックして、アセット名を編集します。

    1. 名前を次のように変更します。

      MORTGAGE_APPLICANTS_TRUST_PROTECT
      
    2. 「適用」をクリックします。

  4. 右側のパネルの 「説明 」セクションで、[ 追加] アイコン 追加をクリックします。

    注:

    このアセットに既存の説明がある場合、「 追加 」アイコンの 編集 代わりに 「編集」 アイコンが表示されます。

    1. 以下の説明をコピーして貼り付けます。

      Mortgage applicants from the Mortgage System
      
    2. 「適用」をクリックします。

  5. この資産は住宅ローンに関連するため、 「ビジネス用語 」の横にある「 追加 」アイコン 追加 または 「編集 」アイコンをクリックしてください 編集

    1. 「検索」 フィールドに loanと入力します。

      注: 検索語を入力した後に Enter キーを押す必要はありません。 検索語を入力すると、すぐに結果のリストが表示されます。
    2. 「ローン」を選択します。

    3. 保存 をクリックします。

  6. このアセットには個人情報が含まれているため、 「分類」 の横にある 「追加」 アイコン 追加 または「 編集 」アイコンをクリックしてください 編集

    1. Personally Identifiable Informationを選択します。

    2. 保存 をクリックします。

  7. この資産は他の住宅ローン資産と関連しているため、「 関連項目 」の隣にある、

    1. Is related to を選択し、 Nextをクリックします。

    2. CREDIT_SCORE 資産と MORTGAGE_APPLICATION 資産を選択し、 Addをクリックします。

  8. MORTGAGE_APPLICATION をクリックして、その関連資産を表示します。

チェックポイント・アイコン 進捗状況を確認してください

以下のイメージは、カタログ内の MORTGAGE_APPLICANTS_TRUST_PROTECT 資産の「概要」タブを示しています。 プロパティーの確認、更新、およびアセットへの関係の追加を行うことで、これらのアセットの価値を高めました。 次のタスクでは、エンリッチされた資産をプロジェクトに追加します。

MORTGAGE age_applicants_trust (関連資産あり)




タスク 3: 強化されたデータをプロジェクトに追加する

データ・アナリスト・チームは、モデルのトレーニング・データとして詳細化、視覚化、分析、および使用するために、住宅ローン分析プロジェクトで住宅ローン申請者データを必要とします。 以下の手順に従って、エンリッチされたデータをプロジェクトに追加します。

  1. ナビゲーションバーの 「住宅ローン承認カタログ」 をクリックしてください。
    ナビゲーション・トレール

  2. MORTGAGE_APPLICANTS_TRUST_PROTECT 」カタログのアセット行の末尾にあるオーバーフロー メニューをクリックし、「 プロジェクト オーバーフロー・メニューに追加」を選択します。

    1. 「ターゲット」 ドロップダウン・リストで、 「データ・ガバナンス」 プロジェクトを選択します。

    2. 追加 をクリックします。

  3. 通知が表示されたら、 Go to projectをクリックします。 通知を見落としたら、以下のようにします:

    1. ナビゲーションメニュー ナビゲーション・メニューをクリックし、 「プロジェクト」>「すべてのプロジェクトを表示」 を選択します。

    2. 「データ・ガバナンス」 プロジェクトをクリックします。

  4. プロジェクトで 「資産」 タブをクリックして、 MORTGAGE age_applicants_trust_protect データ資産を表示します。

チェックポイント・アイコン 進捗状況を確認してください

以下の図は、プロジェクト内の MORTGAGE_APPLICANTS_TRUST_PROTECT 資産を示しています。 これで、データを視覚化する準備ができました。

プロジェクト内の MORTGAGE age_applicants_trust_protect 資産




タスク 4: データの視覚化

住宅ローン申請者のデータをクレンジングして改善し、分析ツールやモデルに対応できるようにする必要があります。 どのように形成する必要があるかを判断するための迅速かつ簡単な方法は、 Data Refineryでデータを視覚化することです。 視覚化は、データの最初の 5,000 行に基づいています。 データを視覚化するには、以下の手順を実行します。

  1. MORTGAGE_APPLICANTS_TRUST_PROTECT データ資産をクリックして、データをプレビューします。

  2. 「データの準備 (Prepare Data)」 をクリックして Data Refineryでデータ資産を開き、データが読み取られて処理されるのを待ちます。

  3. 「このアセットについて」 パネルで、 「X」 をクリックしてパネルを閉じます。

  4. 「ステップ」 パネルで、 「X」 をクリックしてパネルを閉じます。

  5. 視覚化 タブをクリックしてください。

  6. 「視覚化する列 (Column to visualize)」で、 「STREMENT_STATUS」を選択します。

  7. データの視覚化(Visualize data)をクリックします。 このツールは、この列に最適なグラフ・タイプとして円グラフを選択します。このグラフには、採用状況ごとの応募者の分布が表示されます。 推奨されるグラフ・タイプは、バー、ワード・クラウド、およびサンバーストの横に青い点で示されています。

  8. 「グラフ・タイプ」で、 「バブル」 グラフ・タイプを選択します。 バブル・チャートは、特定のデータ・セット内の値の分布を素早く視覚化するための 1 つの簡単な方法です。

  9. 「グラフ・タイプ」 ドロップダウンから、 「関係」 グラフ・タイプを選択します。

  10. このグラフ・タイプには 2 つの列が必要です。 以下の列を選択します:

    1. 最初の列では、 雇用状況を選択します。

    2. 「別の列の追加」をクリックします。

    3. 2 番目の 「列」で、 「EDUCATION」を選択します。

  11. 「関係」 グラフでは、エンドポイントを選択して関係を表示できます。 例えば、学歴ごとに応募者の雇用状況を表示できます。

チェックポイント・アイコン 進捗状況を確認してください

以下のイメージは、 Data Refineryで視覚化された MORTGAGE_APPLICANTS_TRUST_PROTECT 資産を示しています。 これで、データをクレンジングする準備ができました。

関係の視覚化




タスク 5: 分析と AI のためのデータの準備

社会保障番号のない応募者は処理できないため、データを確認して、社会保障番号のない応募者を削除する必要があります。 MORTGAGE_APPLICANTS_TRUST_PROTECT データを準備するために、以下を行います。

  • Social_Security_Number 列の値の頻度を表示します。
  • 「ソーシャル・セキュリティー番号 (Social_Security_Number)」列の値が欠落している応募者をフィルタリングします。

データを準備するには、以下の手順を実行します。

  1. Data Refineryで、 「プロファイル」 タブをクリックします。

  2. 右にスクロールして、 Social_Security_Number 列を見つけます。 いくつかの欠損値に注意してください。

  3. 「データ」 タブをクリックして、これらのレコードをフィルターで除外します。 画面下部のステータス・バーにある Data Refinery は、 「FULL DATA SET」 が 1101 行であることを示します。

  4. 「ステップ」 パネルが表示されない場合は、 「ステップ」 をクリックしてパネルを開きます。

  5. 「新規ステップ」をクリックします。

    1. 「クリーンアップ」 セクションで、 「フィルター」を選択します。

    2. 「列」 フィールドで、 「Social_Security_Number」 列を選択します。

    3. 「演算子」 フィールドで、 「空ではない」を選択します。

    4. 「適用」をクリックします。 画面下部のステータス・バーにある Data Refinery に、 「FULL DATA SET」 が 1000 行であることが示されるようになりました。これは、ソーシャル・セキュリティー番号が欠落している行がフィルターで除外されるためです。 「ステップ」 パネルに、 「フィルター」 操作を示す新しいステップが表示されることに注意してください。

  6. プロファイル タブをクリックしてください。

  7. 右にスクロールして、 Social_Security_Number 列を見つけます。 欠落値がなくなっていることに注意してください。

  8. ツールバーの「 保存 」アイコン 保存をクリックします。

  9. ツールバーの 「エクスポート 」アイコンをクリックし、「 現在のデータを CSV にエクスポート 」を選択します。
    csv 形式でエクスポート

    1. MORTGAGE_APPLICANTS_TRUST_PROTECT_shaped.csv をローカル・フォルダーに保存します。

    2. そのフォルダに移動し、「 CSV 」ファイルを開いてください。このファイルには1000行のデータが含まれており、社会保障番号が欠落している応募者はいません。

  10. Cloud Pak for Data に戻り、ナビゲーションパスの「 データガバナンスプロジェクト 」をクリックします。
    ナビゲーション・トレール

  11. 「すべての資産」をクリックし、 MORTGAGE_APPLICANTS_TRUST_PROTECT_flowという名前の新しい Data Refinery フロー資産を見つけます。

ヒント: 精製されたデータ・セットは、プロジェクトまたは外部データ・ソース (元のデータ・セットが保管されている Db2 Warehouse インスタンスなど) に保存できます。 詳しくは、 Data Refineryを参照してください。

チェックポイント・アイコン 進捗状況を確認してください

以下のイメージは、 Data Refineryで精製した MORTGAGE_APPLICANTS_TRUST_PROTECT_shaped.csv ファイルを示しています。 このデータ・セットには、社会保障番号を提供した住宅ローン申請者に関する情報が含まれています。

精製されたデータ資産



ゴールデン・バンクのデータ・アナリストは、適切なデータを検索して見つけ、そのコンテンツを理解して信頼し、他のデータ・アナリストやデータ・サイエンティストが使用できるように準備する方法を学習しました。

クリーンアップ (オプション)

データ・ガバナンスのユース・ケースでチュートリアルを再利用する場合は、以下の成果物を削除します。

成果物 削除方法
インポートされたビジネス用語 ガバナンス・アーティファクトの削除
銀行カテゴリー カテゴリーを削除します
データ保護ルール: 機密情報と Redact 社会保障番号 データ保護ルールの削除
住宅ローン承認カタログ カタログの削除
データ・ガバナンス・サンプル・プロジェクト プロジェクトの削除

詳細情報