用語集
この用語集には、 watsonx.ai および watsonx.governanceの用語と定義が記載されています。
この用語集では、次の相互参照を使用します。
- 「 を参照 」は、非優先用語の場合は優先用語を、省略語の場合は省略していない形式を読者に示すものです。
- 「も参照」は、関連語や対義語への参照を意味します。
A
アクセラレーター
ハイパフォーマンス・コンピューティングにおいて、CPU から計算負荷の一部を取得するために使用される特殊な回路。これにより、システムの効率が向上します。 例えば、ディープ・ラーニングでは、多くの場合、GPU アクセラレーション・コンピューティングは、メイン・アプリケーションが CPU を稼働している間に、計算ワークロードの一部を GPU にオフロードするために使用されます。 「 グラフィックス処理装置 (graphics processing unit)」も参照。
責任追跡性
組織または個人が、それぞれの役割および適用される規制フレームワークに従って、設計、開発、運用、または導入する AI システムのライフサイクル全体を通して、適切に機能することを保証するという期待。 これには、法的専門家がケース・バイ・ケースで責任を判断することを必要とする可能性のある AI の誤りの責任者を決定することが含まれます。
活動化機能
他のニューロンからの一連の着信活性化を与えられたニューラル単位の出力を定義する関数
アクティブ・ラーニング
システムが必要とするときにのみ、より多くのラベル付きデータを要求する機械学習のモデル。
アクティブ・メタデータ
機械学習プロセスによる分析に基づいて自動的に更新されるメタデータ。 例えば、プロファイル作成およびデータ品質分析は、データ資産のメタデータを自動的に更新します。
アクティブ・ランタイム (active runtime)
コードを実行するアセットに計算リソースを提供するために実行される環境のインスタンス。
エージェント
環境と対話して、特定の目標を達成するために、通常は強化学習を使用して最適なアクションまたは意思決定を学習するアルゴリズムまたはプログラム。
エージェント型AI
プロンプトを複数のタスクに分解し、適切なAIエージェントにタスクを割り当て、人間の介入なしに答えを合成することができる生成AIフロー。
AI
「 人工知能 (AI)」を参照。
AI アクセラレーター
ディープ・ラーニング、機械学習、ニューラル・ネットワークなどの AI 関連タスクを効率的に実行して、高速でエネルギー効率の良いコンピューティングを実現するよう設計された、特殊なシリコン・ハードウェア。 コア内の専用ユニット、マルチ・モジュール・チップ上の別個のチプレット、または別のカードにすることができます。
AI倫理
リスクと悪影響を軽減しながら、AI の有益な影響を最適化する方法を研究する多領域分野。 AI 倫理の問題の例としては、データの責任とプライバシー、公平性、説明可能性、頑強性、透明性、環境の持続可能性、包含性、道徳的機関、価値の調整、説明責任、信頼、テクノロジーの誤用などがあります。
AIガバナンス
AI のライフサイクル全体を通して指示、スタッフ、プロセス、およびシステムを管理し、指示、評価、モニター、および修正アクションを実行する組織の行為。これにより、AI システムが組織の意図、利害関係者の期待、および関連規制の要求に従って運用されていることが保証されます。
AI の安全性
研究分野では、人工知能システムが人間にとって有益で、不注意に害を及ぼさないような方法で動作することを目的とし、信頼性、公平性、透明性、人間の価値観に合わせた AI システムの調整などの課題に対処することを目的としています。
AI サービス
生成AIのユースケースのロジックを含み、アプリケーションからの推論のためのエンドポイントを提供する、展開可能なコードの単位。
AI システム
「 人工知能システム (人工知能 system)」を参照。
アルゴリズム
分析上の問題を解決するための最適な方法を決定するためにデータに適用される数式。
アナリティクス
データ内に意味のあるパターンを見つけ、それらのパターンに基づいて結論を導き出すために、データを研究する科学。
適切な信託
AI システムにおいて、正確性、信頼性、および信頼性に合わせて調整された信頼性の量。
人工知能 (AI)
予測、推奨、または意思決定を行うために、モデルの形式で知識を取得、処理、作成、および適用する機能。
人工知能システム (AI システム)
物理環境または仮想環境に影響を与える予測、推奨、または決定を行うことができ、その出力または動作が必ずしも開発者またはユーザーによって事前に決定されるとは限らないシステム。 AI システムは通常、大量の構造化データまたは非構造化データを使用してトレーニングされ、人間が定義した目標を達成するために、さまざまなレベルの自律性を使用して動作するように設計されている場合もあれば、まったく動作しないように設計されている場合もあります。
資産
データに関する情報、その他の貴重な情報、またはデータを処理するコードを含む項目。 「 データ資産 (data asset)」も参照。
アテンション機構
ディープ・ラーニング・モデルのメカニズムの 1 つで、モデルが出力を生成するときに、入力のどの部分に焦点を当てるかを決定する。
AutoAIエクスペリメント
一連の学習定義およびパラメーターを評価することでランク付けされた一連のパイプラインをモデル候補として作成する、自動化された学習プロセス。
B
バッチ・デプロイメント (batch deployment)
ストレージ・バケット内のファイル、データ接続、または接続されたデータからの入力データを処理し、選択された宛先に出力を書き込むモデルをデプロイする方法。
バイアス
不公平な意思決定を生み出す可能性のある方法で、意図的または非意図的に設計された AI システムの体系的なエラー。 バイアスは、AI システムと、それをトレーニングおよびテストするために使用されるデータの両方に存在する可能性があります。 AI バイアスは、文化的期待、技術的制限、または予期しない展開コンテキストの結果として、AI システムで発生する可能性があります。 公平性 (公平性)も参照してください。
バイアス検出
AI モデルが特定の属性に基づいて不公平な結果を提供していることを検出するために、メトリックに対する公平性を計算するプロセス。
バイアス緩和
トレーニング・データをキュレーションし、公平性の手法を適用することで、AI モデルのバイアスを軽減します。
2 項分類
2 つのクラスを持つ分類モデル。 予測は、2 つのクラスのいずれかの 2 項選択です。
C
分類モデル
異なるカテゴリーのデータを予測する予測モデル。 分類は、2 つのデータ・クラスを持つ 2 項分類にすることも、3 つ以上のカテゴリーがある場合は複数のクラスにすることもできます。
クレンジング (cleanse)
データ・セットのすべての値が整合していること、および正しく記録されていることを確認すること。
CNN
認知強制機能
意思決定の瞬間に、ヒューリスティック推論を中断し、分析的思考に従事させるために適用される介入。例としては、チェックリスト、診断のタイムアウト、または代替手段の除外を求めることが挙げられます。
計算言語学
自然言語を計算的にモデリングするためのアプローチを検討する分野。
計算リソース
ツールで資産を実行するために環境テンプレートによって定義されるハードウェア・リソースおよびソフトウェア・リソース。
混同行列
実際の正の結果および負の結果と比較して、モデルの正の予測結果と負の予測結果の間の精度を決定するパフォーマンス測定。
接続済みデータ・アセット (connected data asset)
外部データ・ソースへの接続を介してアクセスされるデータへのポインター。
接続済みフォルダー資産
IBM Cloud Object Storage のフォルダーを指すポインター。
接続
データベースへの接続に必要な情報。 実際に必要な情報は、DBMS および接続方式によって異なります。
接続アセット (connection asset)
データ・ソースへの接続を可能にする情報が含まれたアセット。
制約
- データベースにおいて、テーブル間の関係。
- Decision Optimizationにおいて、問題の解によって満たされる必要がある条件。
継続的学習
モデルのパフォーマンスのモニター、新規データを使用した再学習、および予測品質を確保するための再デプロイで構成されるタスクの自動化。
畳み込みニューラル・ネットワーク (CNN)
イメージ・データを処理するために畳み込み層を使用するコンピューター・ビジョン・タスクで一般的に使用されるニューラル・ネットワークのクラス。
コア ML のデプロイメント (Core ML deployment)
iOS アプリでの使用を目的として、デプロイメントをコア ML 形式でダウンロードするプロセス。
コーパス
機械学習モデルのトレーニングに使用されるソース文書のコレクション。
CPLEX モデル
CPLEX エンジンによって求解されるように定式化された Decision Optimization モデル。
CPO モデル
Decision Optimization CP オプティマイザー (CPO) エンジンによって求解されるように定式化された制約プログラミング・モデル。
交差検証
検証テスト・サンプルがない場合に、モデルがどの程度一般化しているかを検定するための手法。 交差検証では、学習データがいくつかのサブセットに分割されてから、同じ数のモデルが作成され、各サブセットが順番に保持されます。 これらの各モデルはホールドアウト・サンプルで検定され、それらのホールドアウト・サンプルのモデルの平均精度を使用して、新しいデータに適用されたときのモデルの精度が推定されます。
キュレート
特定のトピックに関連するコンテンツを選択、収集、保存、および保守します。 キュレーションは、データを確立し、維持し、データに価値を付加します。データを信頼できる情報と知識に変換します。
D
データ資産
アップロードされたファイルなどのデータを指すアセット。 接続や接続済みデータ・アセットも、データ・アセットと見なされる。 「 資産 (asset)」も参照。
データ代入
データ・セット内の欠損値を、推定値または明示的な値で置換すること。
データレイク
フラット・アーキテクチャーで任意の形式の生データを保管する大規模なデータ・ストレージ・リポジトリー。 データレイクは、処理と分析の目的で、構造化データと非構造化データ、およびバイナリー・データを保持します。
データレイクハウス
データレイクの柔軟性とデータウェアハウスの構造化された照会およびパフォーマンスの最適化を組み合わせた、統合されたデータ・ストレージおよび処理アーキテクチャー。これにより、AI および分析アプリケーションのためのスケーラブルで効率的なデータ分析が可能になります。
データ・マイニング
データ・ソースから重要なビジネス情報を収集し、これらの情報を相互に関連付けて、関連性、パターン、および傾向を発見するプロセス。 「 予測分析 (predictive analytics)」も参照。
Data Refinery フロー (Data Refinery flow)
新しいデータ資産を生成するためにデータをクレンジングおよびシェーピングする一連のステップ。
データサイエンス
洞察および知識をディスカバーするための構造化データおよび非構造化データの分析および視覚化。
データ・セット
データのコレクション。通常は、行 (レコード) と列 (フィールド) の形式でファイルまたはデータベース表に含まれる。
データ・ソース
データベースなどのデータを読み取るためのリポジトリー、キュー、またはフィード。
データ・テーブル
データのコレクション。通常は、行 (レコード) と列 (フィールド) の形式で表に含まれる。
データウェアハウス
レポート作成およびデータ分析に使用される、さまざまなソースから収集されたデータの大規模で一元化されたリポジトリー。 主に構造化データと半構造化データを保管するため、企業は情報に基づいた意思決定を行うことができます。
DDL
「 分散ディープ・ラーニング」を参照してください。
決定境界
スペース内のデータ・ポイントを異なるグループまたは分類に分割すること。
デコーダーのみのモデル
入力シーケンスからの推論によって、ワードごとに出力テキスト・ワードを生成するモデル。 デコーダーのみのモデルは、テキストの生成や質問への回答などのタスクに使用されます。
ディープ・ラーニング
一連の計算を通じて入力データ (最初の層) を変換して出力 (最終層) を生成するために、階層層に編成された相互接続ノードの複数の層を使用する計算モデル。 ディープ・ラーニングは、人間の脳の構造と機能に触発されています。 分散ディープ・ラーニング (distributed deep learning)も参照。
ディープ・ニューラル・ネットワーク
複数の隠れ層を持つニューラル・ネットワーク。これにより、より複雑なデータ表現が可能になります。
深推論
機械学習の一種で、システムがデータから洞察を生成し、常識、状況の変化、計画、意思決定など、知覚や分類を超えた認知タスクをサポートする。
展開
使用可能なモデルまたはアプリケーション・パッケージ。
デプロイメント・スペース
モデルがデプロイされ、デプロイメントが管理されるワークスペース。
決定論
コンピューター・システムの出力が入力によって完全に決定される場合の、そのコンピューター・システムの特性について説明する。
差別的 AI
データ内のさまざまなクラスを分離する境界の検出に焦点を当てたアルゴリズムのクラス。
分散ディープ・ラーニング (DDL)
分散コンピューティングの手法を活用したディープ・ラーニング・トレーニングへのアプローチ。 DDL 環境では、コンピュート・ワークロードは中央演算処理装置とグラフィックス処理装置の間で分散されます。 ディープ・ラーニング (deep learning)も参照。
DOcplex
Decision Optimization の問題をモデル化して解決するための Python API。
E
埋め込み
ワードやセンテンスなどの情報の単位を、実数値のベクトルとして表した数値表現。 埋め込みとは、学習された、高次元データの低次元表現のことです。 「 エンコード (encoding)」、「 表記 (representation)」も参照。
出現
モデルが明示的にトレーニングされていない動作を示す基盤モデルのプロパティー。
創発的な行動
明示的に構成されていない基盤モデルによって示される動作。
エンコーダー・デコーダー・モデル
入力テキストを理解し、入力テキストに基づいて出力テキストを生成するためのモデル。 エンコーダー・デコーダー・モデルは、要約や変換などのタスクに使用されます。
エンコーダーのみのモデル
入力シーケンスを組み込みと呼ばれる表現ベクトルに変換することによって、センテンス・レベルで入力テキストを理解するモデル。 エンコーダーのみのモデルは、顧客のフィードバックの分類や大規模な文書からの情報の抽出などのタスクに使用されます。
エンコード
情報の単位 (文字や単語など) を数値の集合として表現したもの。 「 組み込み (embedding)」、「 定位置エンコード (positional encoding)」も参照。
エンドポイント URL (endpoint URL)
サービスやオブジェクトなどのリソースを識別するネットワーク宛先アドレス。 例えば、ユーザーがデプロイメントにペイロード・データを送信するときに、モデルまたは関数のデプロイメントの場所を識別するために、エンドポイント URL が使用される。
環境
ジョブを実行するための計算リソース。
環境ランタイム (environment runtime)
アセットを実行するための環境テンプレートのインスタンス化。
環境テンプレート
環境ランタイムをインスタンス化するためのハードウェア・リソースおよびソフトウェア・リソースを指定する定義。
外因性の特徴
予測モデルに影響を与えることはできるが、その代わりに影響を与えることはできない特徴量。 例えば、温度は予測されるアイスクリーム販売に影響を与える可能性がありますが、アイスクリーム販売は温度に影響を与えることはありません。
実験
最も正確なモデル構成を決定するために、一連のトレーニング定義とパラメーターを考慮するモデル・トレーニング・プロセス。
説明可能性
- AI システムを使用するアプリケーションで行われる予測をトレース、監査、および理解するための人間のユーザーの能力。
- 人間がシステムの予測の原因を理解するために使用できる洞察を提供する AI システムの能力。
F
フェアネス
AI システムにおいて、個人または個人のグループの公平な扱い。 AI システムに対して特定の公平性の概念を選択するかどうかは、そのシステムが使用されているコンテキストによって異なります。 「 バイアス (bias)」も参照。
フィーチャー
データ・セット内の項目のプロパティーまたは特性。例えば、スプレッドシート内の列など。 場合によっては、フィーチャーはデータ・セット内の他のフィーチャーの組み合わせとして設計されます。
特徴量エンジニアリング
機械学習モデルのパフォーマンスと予測精度を向上させるために、生データから新機能を選択、変換、および作成するプロセス。
フィーチャー・グループ
機械学習に使用されるメタデータと共に、特定のデータ資産の列のセット。
特徴量選択 (feature selection)
機械学習モデルでの正確な予測またはスコアを最も適切にサポートするデータの列を特定する。
フィーチャー・ストア
機能を管理および編成し、機械学習パイプラインおよびアプリケーション全体で機能データを保管、取得、および共有するためのスケーラブルで効率的な方法を提供する、集中化されたリポジトリーまたはシステム。
特徴量の変換 (feature transformation)
AutoAI で、モデル・タイプに最適な結果を得るために、アルゴリズムを適用して学習データを変換および最適化するパイプライン作成のフェーズ。
数回のプロンプト
タスクを完了する方法を示すために、いくつかの例をモデルに提供するプロンプト手法。
微調整
追加のトレーニングを実施することによって、特定のタスクを実行するために事前にトレーニングされたモデルを適応させるプロセス。 微調整には、(1) モデルの既存のパラメーターの更新 (完全な微調整と呼ばれる)、(2) モデルの既存のパラメーターのサブセットの更新、またはモデルへの新規パラメーターの追加とモデルの既存のパラメーターのトレーニング (パラメーター効率のよい微調整と呼ばれる) が含まれる場合があります。
フロー
データの処理またはモデルのトレーニングのための一連のステップを定義するノードのコレクション。
基盤モデル
広範なダウンストリーム・タスクに適応できる AI モデル。 基盤モデルは通常、自己監視を使用してラベル付けされていないデータでトレーニングされる大規模な生成モデルです。 大規模なモデルとして、基盤モデルには数十億個のパラメーターを含めることができます。
G
ガント・チャート
タイム・スケールに沿ってスケジュール・データが横棒として表示される、プロジェクトのタイムラインおよび期間のグラフィカル表現。
AI の生成
生成 AIを参照してください。
生成 AI (生成 AI) (gen AI)
テキスト、ソース・コード、画像、音声、合成データなど、さまざまなタイプのコンテンツを生成できる AI アルゴリズムのクラス。
生成変動
モデルへの入力が一定である場合でも、さまざまな出力を生成する生成モデルの特性。 「 確率的 (probabilistic)」も参照。
GPU
グラフィカル・ビルダー
視覚的にコーディングしてフロー資産を作成するツール。 キャンバスは、フローを作成するために接続できるオブジェクトまたはノードを配置する領域。
グラフィックス処理装置 (GPU)
ディスプレイへの出力用のフレーム・バッファーでのイメージの作成を高速化するために、メモリーを迅速に操作および変更するように設計された特殊なプロセッサー。 GPU は、並列処理機能を備えているため、機械学習に大きく使用されます。 「 アクセラレーター (accelerator)」も参照。
接地
結果の正確性を向上させるための情報を大規模言語モデルに提供する。
H
幻覚
非トピック、反復、誤り、または加工されたコンテンツを含む基盤モデルからの応答。 テキストを生成するようにモデルにプロンプトが出されたが、正しい詳細を含む結果を生成するためにモデルに十分な関連テキストがない場合に、詳細の作成に関連する幻覚が発生する可能性があります。
HAP 検出 (HAP 検出)
- ユーザーによって送信されたプロンプトと、AI モデルによって生成された応答の両方で、ヘイト、悪用、および不適切表現を検出してフィルタリングする機能。
HAP 検出機能 (HAP 検出機能)
- 潜在的に有害なコンテンツ (ヘイト・スピーチ、迷惑メール、冒涜など) を基盤モデルの出力および入力から削除するセンテンス分類器。
ホールドアウト・セット
トレーニング・セットと検証セットの両方から意図的に除外されたラベル付きデータのセット。表示されていないデータに対する最終モデルのパフォーマンスの不偏評価として機能します。
均質化
トランスフォーマーのような少数のディープ・ニューラル・ネットワーク・アーキテクチャーが、さまざまなタスクにわたって最先端の成果を達成するという、機械学習研究の傾向。
HPO
人間の監督
AI システムによって行われる意思決定のレビューに人間が関与することで、人間の自律性と意思決定の説明責任を実現します。
ハイパーパラメーター
機械学習において、モデルの精度を向上させる方法として、学習前に値が設定されるパラメーター。
ハイパーパラメーターの最適化 (hyperparameter optimization (HPO))
最も精度の高いモデルを生成するする設定に、ハイパーパラメーター値を設定するプロセス。
I
イメージ
一連のライブラリーが含まれるソフトウェア・パッケージ。
増分学習
前のタスクから取得したデータを忘れることなく、継続的に更新されるデータを使用してモデルをトレーニングするプロセス。 この技法は、大規模なトレーニング・データ・ソースからのデータのバッチを使用してモデルをトレーニングするために使用されます。
推論
予測を行うため、またはタスクを求解するために、トレーニングされた AI モデルを介してライブ・データを実行するプロセス。
取り込む
- 大量のリアルタイム・データをデータベースに継続的に追加すること。
- 知識ベースを作成する目的で、データをシステムにフィードすること。
洞察
何かに対する正確で深い理解。 洞察は、コグニティブ分析を使用して導出され、顧客の行動と態度の最新のスナップショットと予測を提供します。
インテリジェント AI
知識を理解し、学習し、適応し、実装し、意思決定、問題解決などの能力を実証し、人間の知能と同様に複雑な概念を理解することができる人工知能システム。
インテント
質問への回答や請求支払いの処理など、チャットボットへのお客様の入力によって表される目的または目標。
J
ジョブ
個別に実行可能な作業単位。
K
知識ベース
「 コーパス (corpus)」を参照。
L
ラベル
監視対象 learning.Labels のデータ・ポイントに割り当てられたクラスまたはカテゴリーは、データから派生させることができますが、多くの場合、ヒューマン・ラベラーまたはアノテーターによって適用されます。
ラベル付きデータ
機械学習モデルのトレーニングに使用できるように、コンテキストまたは意味を追加するためにラベルが割り当てられた生データ。 例えば、モデルの入力および出力のコンテキストを提供するために、数値に郵便番号または年齢のラベルを付けることができます。
ラージ言語モデル (LLM)
多数のパラメーターを持ち、大量のテキストに基づいてトレーニングされる言語モデル。
潜在空間
データ・インスタンスが埋め込まれる n 次元の数学的空間。 二次元の潜在空間は、データを2D平面内の点として埋め込む(表象空間も参照)。 「 Representational Space」も参照。
LLM
M
機械学習 (ML)
人工知能 (AI) とコンピューター・サイエンスの分野で、人間が学習する方法を模倣するためのデータとアルゴリズムの使用に重点を置き、AI モデルの精度を徐々に向上させています。
機械学習フレームワーク (machine learning framework)
モデルの学習およびデプロイのためのライブラリーおよびランタイム。
機械学習モデル
新しいデータを分析してそこから学習するために使用できるアルゴリズムを開発するために、一連のデータに基づいてトレーニングされた AI モデル。
精神モデル
システムがどのように機能し、それらのアクションがシステムの結果にどのように影響するかについての個人の理解。 これらの期待がシステムの実際の能力と一致しない場合、フラストレーション、放棄、または誤用につながる可能性があります。
調整不良
AI システムが達成するために最適化された目標または行動と、人間のユーザーまたは設計者の真の (多くの場合、複雑な) 目標との間の矛盾
ML
「 機械学習 (machine learning)」を参照。
MLOps
- 機械学習モデルを開発から実動に移行する方法。
- 実動機械学習 (またはディープ・ラーニング) のライフサイクルの管理を支援するための、データ・サイエンティストと運用プロフェッショナル間のコラボレーションの手法。 MLOps は、自動化を向上させ、実動 ML の品質を向上させると同時に、ビジネス要件や規制要件にも重点を置いています。 これには、モデルの開発、トレーニング、検証、デプロイメント、モニター、および管理が含まれ、CI/CD などのメソッドを使用します。
モデル
- 機械学習のコンテキストでは、予測または意思決定を提供するために特定のデータ・セットで学習およびテストが行われた、一連の関数およびアルゴリズム。
- Decision Optimization では、さまざまなデータ・セットを使用して CPLEX 最適化エンジンで解決できる問題の数学的定式化。
ModelOps
AI モデルのライフサイクル全体 (トレーニング、デプロイメント、スコアリング、評価、リトレーニング、更新など) を管理するための方法。
モニタリング対象グループ
予測モデルの結果が参照グループの結果と大きく異なるかどうかを判別するためにモニターされるデータのクラス。 グループは一般に、人種、性別、年齢などの特性に基づいてモニターされます。
多項分類モデル
3 つ以上のクラスを持つ分類タスク。 例えば、二項分類モデルが「はい」または「いいえ」の値を予測する場合、複数クラス・モデルは「はい」、「いいえ」、「おそらく」、または「適用外」を予測します。
マルチモーダルモデル
テキスト、画像、音声など複数の種類のデータを処理し、それらの間で変換できる生成AIモデル。 例えば、マルチモーダルモデルは、テキスト入力を受けて画像出力を生成することができる。
多変量時系列
2 つ以上の変化する変数を含む時系列エクスペリメント。 例えば、3 つのクライアントの電力使用量を予測する時系列モデルがあるとします。
N
自然言語処理 (NLP)
人間の言語を理解するコンピューターの能力を高めることを目的として、自然言語の処理と操作に固有の問題を研究する人工知能と言語学の分野。
自然言語処理ライブラリー
構文分析のための基本的な自然言語処理機能と、さまざまなテキスト処理タスクのためのすぐに使用可能な事前トレーニング・モデルを提供するライブラリー。
ニューラル・ネットワーク
抽象化された脳細胞をシミュレートする複雑な数式を使用してケースを予測または分類するための数学モデル。 ニューラル・ネットワークの学習は、観測された多数のケースを一度に 1 つずつ提示し、ニューラル・ネットワークがタスクを学習するまで繰り返し自己更新できるようにすることで行われる。
NLP
ノード
SPSS Modeler フローでは、データ操作のグラフィカル表現です。
ノートブック
実行可能コード、そのコードの説明テキスト、および実行されるコードの結果が記載される対話式ドキュメント。
ノートブック・カーネル (notebook kernel)
コードを実行し、計算結果を返すノートブック・エディターの部分。
O
オブジェクト・ストレージ
クラウド内で一般的に使用されるデータ保管方法の 1 つであり、ファイル階層を使用せずに、すべてのオブジェクトを同じレベルに保管する、ストレージ・プールまたはリポジトリーにデータが個別ユニットまたはオブジェクトとして保管される。
1 回限りの学習
ほとんどの人間の学習は 1 つまたは 2 つの例を受け取ったときに行われるという前提に基づいたディープ・ラーニングのモデル。 このモデルは、教師なし学習に似ています。
1 回限りのプロンプト
タスクを完了する方法を示すために、単一の例をモデルに提供するプロンプト手法。
オンライン・デプロイメント (online deployment)
リアルタイムでオンラインで予測を生成するために、Web サービスとして API エンドポイントを介してモデルまたは Python コード・デプロイメントにアクセスする方法。
オントロジー
対象の一部の領域に存在し得るオブジェクト、概念、およびその他のエンティティーおよびそれらの関係を表現する、明示的な形式の仕様。
運用資産
ツールまたはジョブ内でコードを実行する資産。
最適化
課せられた制約と制限を尊重しながら、厳密に定義された問題に対して最も適切な解を見つけるプロセス。 例えば、リソースの割り振り方法や、多数の選択肢から最適な要素または組み合わせを見つける方法を決定します。
最適化プログラミング言語
最適化問題のモデルの定式を、IBM CPLEX などの CPLEX 最適化エンジンによって解決できる形式で表すためのモデル作成言語。
最適化メトリック
モデルのパフォーマンスを測定するために使用されるメトリック。 例えば、精度は、二項分類モデルのパフォーマンスを測定するために使用される標準的なメトリックです。
オーケストレーション
機械学習モデルをトレーニング、実行、デプロイ、テスト、および評価できるエンドツーエンド・フローを作成し、自動化を使用してシステムを調整するプロセス。多くの場合、マイクロサービスを使用する。
過度に依存すること
AI モデルによって行われた誤った推奨のユーザーによる受け入れ。 「 依存関係 (reliance)」、「 依存関係 (underreliance)」も参照。
P
パラメーター
- モデルの内部にあり、その値がデータから推定または学習される、モデルの構成可能な部分。 パラメーターは、モデルが出力を正確に予測できるように、トレーニング・プロセス中に調整されるモデルの側面です。 モデルのパフォーマンスと予測精度は、これらのパラメーターの値に大きく依存します。
- ニューラル・ネットワーク内の 2 つのニューロン間の接続の強さを示す、 0.0 から 1.0 までの実数値の重み。
ペイロード
スコア、予測、または解決策を取得するためにデプロイメントに渡されるデータ。
ペイロード・ロギング
ビジネス・アプリケーションでの AI の継続的な正常性をモニターするためのペイロード・データとデプロイメント出力のキャプチャー。
パイプライン
- Watson Pipelinesでは、作成からデプロイメントまでの資産のエンドツーエンド・フロー。
- AutoAI,候補モデル。
パイプライン・リーダーボード (pipeline leaderboard)
AutoAI,では、パイプラインとして自動生成された候補モデルのリストを、指定された基準に従ってランク付けして表示する表。
ポリシー
現在の状態に基づいて次のアクションを決定するためにエージェントが従う戦略またはルール。
定位置エンコード
定位置情報 (センテンス内の各単語の位置を含むセンテンス内の単語のエンコードなど) を含む、順序付けられたデータ・シーケンスのエンコード。 「 エンコード (encoding)」も参照。
予測分析
将来の可能性および傾向の予測に関係するビジネス・プロセスおよび関連する一連のテクノロジー。 予測分析では、特定の状況に最適なアクションを見つけるために、確率、統計、機械学習、人工知能などのさまざまな分野をビジネス上の問題に適用します。 「 データ・マイニング (data Mining)」も参照。
事前トレーニングされたモデル
特定のタスクを実行するために大規模なデータ・セットで以前にトレーニングされた AI モデル。 モデルを最初から作成する代わりに、事前トレーニングされたモデルが使用されます。
プリトレーニング
特定のタスクに合わせて機械学習モデルを微調整する前に、大きなデータ・セットで機械学習モデルをトレーニングするプロセス。
プライバシー
個人に関する情報が無許可アクセスおよび不適切な使用から保護されていることを保証します。
確率的
ランダム性の対象となる特性 (非決定論的)。 確率モデルは、同じ入力を前提として同じ出力を生成しません。 「 生成変動 (生殖 variability)」も参照。
プロジェクト
データおよびその他の資産を処理するためのコラボレーション・ワークスペース。
プロンプト
- 基盤モデルの出力を準備、指示、または条件付けするデータ (テキストやイメージなど)。
- 出力画面への遷移を行う前に、フィールドにユーザー入力が必要であることを示すアクションのコンポーネント。
プロンプト・エンジニアリング
自然言語を設計するプロセスでは、特定のタスクを実行するための言語モデルのプロンプトが表示されます。
プロンプト
基盤モデルに入力を提供して、基盤モデルが出力を生成するように誘導するプロセス。
プロンプトのチューニング
モデルのリトレーニングや重みの更新を行わずに、事前にトレーニングされたモデルを新しいタスクに適合させるための効率的で低コストの方法。 プロンプトのチューニングでは、モデルの既存のパラメーターを凍結しながら、モデルのプロンプトに追加される少数の新規パラメーターを学習します。
プルーニング
デシジョン・ツリーまたはニューラル・ネットワークを単純化、縮小、またはトリミングするプロセス。 これを行うには、あまり重要でないノードまたはレイヤーを削除し、複雑さを軽減してオーバーフィッティングを防止し、予測精度を維持しながらモデルの一般化を改善します。
Python
データ・サイエンスおよび AI で使用されるプログラミング言語。
Python 関数
実動でモデルをサポートするための Python コードを含む関数。
Q
量子化
基盤モデルの重みを圧縮して、推論を高速化し、GPU メモリーのニーズを削減する方法。
R
R
さまざまな分析、統計、およびグラフィック機能と技法を提供する、データ・サイエンスおよび AI で使用される拡張可能なスクリプト言語。
RAG
ランダムシード
疑似乱数発生ルーチンを初期化するために使用される数値。 ランダム・シードは、乱数生成に依存するプロセスの再現性を可能にします。
参照グループ
予測モデルで肯定的な結果を受け取る可能性が最も高いと識別されるグループ。 結果をモニター対象グループと比較して、結果に潜在的なバイアスがないかどうかを調べることができます。
精製
データのクレンジングおよびシェーピングを行うこと。
回帰モデル
従属変数を 1 つ以上の独立変数に関連付けるモデル。
リインフォースメント・ラーニング
報酬シグナルを最大化するために、エージェントが環境内で順次意思決定を行うことを学習する機械学習技法。 試行錯誤学習に触発されたエージェントは、環境と対話し、フィードバックを受け取り、最適なポリシーを達成するために行動を調整します。
人間のフィードバックに関する強化学習 (RLHF)
言語学習モデルの応答を、プロンプトで指定された指示に合わせて調整する方法。 RLHF では、ヒューマン・アノテーターがモデルからの複数の出力をランク付けする必要があります。 これらのランキングは、強化学習を使用して報酬モデルをトレーニングするために使用されます。 その後、報酬モデルを使用して、大規模な言語モデルの出力を微調整します。
信頼性
AI システムにおいて、ユーザーが AI モデルによって行われた推奨、または AI モデルによって生成された出力を受け入れること。 「 過剰依存 (overreliance)」、「 過少依存 (underreliance)」も参照。
表現
情報の単位のエンコード方式。多くの場合、実数値のベクトルとして使用される。 「 組み込み (embedding)」も参照。
表現空間
データ・インスタンスが埋め込まれる n 次元の数学的空間。 2 次元の潜在空間は、 2D 平面内の点としてデータを埋め込みます (「潜在空間」も参照)。 「 潜在スペース (latent space)」も参照。
リランキング
指定されたクエリに答える可能性が最も高いものから最も低いものへと、一連の文書パッセージをランク付けするための生成的AIプロセス。
検索拡張世代 (RAG)
テキストを生成するために、外部ソースからの知識を使用して大規模な言語モデルを拡張する技法。 取得ステップでは、外部ソースからの関連文書がユーザーの照会から識別されます。 生成ステップでは、これらの文書の一部が LLM プロンプトに組み込まれ、取得された文書に基づいて応答が生成されます。
報酬
意思決定の適合性に関するフィードバックを提供するエージェント (通常は強化学習エージェント) をガイドするために使用されるシグナル
RLHF (ライフル)
人間のフィードバックに関する強化学習を参照してください。
ランタイム環境
ノートブックなどのツールまたはジョブを実行するために使用される、事前定義またはカスタムのハードウェアおよびソフトウェア構成。
S
スコアリング
- 機械学習において、予測された結果の信頼性を測定するプロセス。
- 入力 ID の属性が既存のエンティティーの属性とどの程度一致しているかを計算するプロセス。
スクリプト
実動でモデルをサポートするための Python スクリプトまたは R スクリプトを含むファイル。
自己注意
入力データ自体からの情報を使用して、出力の生成時にフォーカスする入力の部分を決定するアテンション・メカニズム。
自己教師あり学習
モデルが、入力シーケンス内のトークンをマスキングし、それらを予測することによって、ラベルなしデータから学習する機械学習トレーニング方式。 例えば、「I like ________ sprouts」などです。
センチメント分析
テキストで表現される感情または感情の検査。例えば、映画のレビューが肯定的か否定的かを判別します。
形状
列のフィルタリング、ソート、削除、表の結合、および計算、データ・グループ化、階層化などの操作の実行により、データをカスタマイズすること。
スモールデータ
人間がアクセスし、理解できるデータ。 「 構造化データ (structured data)」も参照。
SQLプッシュバック
SPSS Modeler で、 SQL コードを使用してデータベースで直接さまざまなデータ準備操作やマイニング操作を実行するプロセス。
構造化データ
レコードまたはファイル内の固定フィールドにあるデータ。 リレーショナル・データベースとスプレッドシートは、構造化データの例です。 「 非構造化データ (unstructured data)」、「 小さいデータ (small data)」も参照。
構造化情報
構造化リソース (検索エンジン索引、データベース、知識ベースなど) に保管されている項目。
教師あり学習
新規データを予測するために、ラベル付きデータ・セットでモデルをトレーニングする機械学習トレーニング方式。
T
温度
生成プロセスにおける変動の量を指定する生成モデルのパラメーター。 温度が高いほど、モデルの出力のばらつきが大きくなります。
テキスト分類
テキストを自動的に識別し、指定されたカテゴリーに分類するモデル。
テキスト抽出
大規模な言語モデルの入力として使用するために、高度に構造化された情報をより単純なテキスト形式に変換する生成的AI手法。
時系列
周期的な時点での変数の値のセット。
時系列モデル
経時的なデータの追跡と予測を行うモデル。
トークン
単語やサブワードなどの、テキスト内の意味または分析の個別の単位。
トークン化
テキストのストリングをワードやサブワードなどの小さい単位に分割するために、自然言語処理で使用されるプロセス。
学習済みモデル (trained model)
実際のデータを使用してトレーニングされ、新しいデータが提示されたときに結果を予測するためにデプロイする準備ができているモデル。
トレーニング
ソース・データのサブセットが含まれる、モデル作成の初期段階。 モデルは、既知のデータから例によって学習します。 これ以後、結果が既に分かっている別のサブセットと対照するモデル・テストが可能。
研修データ
機械学習モデルの学習に使用されるデータの集まり。
学習セット
機械学習モデルをサンプルおよび対応するラベルに公開することでトレーニングするために使用されるラベル付きデータのセット。これにより、モデルはパターンを学習し、予測を行うことができます。
転移学習
トレーニングされたモデルがまったく新しい問題に適用される機械学習戦略。
変圧器
一連のトークン内の次のトークンを予測するために、定位置エンコードおよび自己アテンション・メカニズムを使用するニューラル・ネットワーク・アーキテクチャー。
透明
AI システムがどのように設計および開発されたかについて、利害関係者と適切な情報を共有する。 この情報の例としては、どのようなデータが収集され、どのように使用され、保管され、誰がそのデータにアクセスできるか、正確性、頑強性、バイアスのテスト結果などがあります。
トラスト調整
精度、信頼性、信頼性などの要因に基づいて、AI システムに対する信頼を評価および調整するプロセス。
チューリングテスト
1950 年にアラン・チューリング (Alan Turing) によって提案された、人間と同等の、または人間と区別できない知的行動を示す機械の能力のテスト。
U
過小評価
ユーザーが AI モデルによって行われた正しい推奨を拒否した。 「 過剰依存 (overreliance)」、「 依存関係 (reliance)」も参照。
1 変量の時系列
1 つの変更変数のみを含む時系列エクスペリメント。 例えば、温度を予測する時系列モデルには、温度の単一の予測列があります。
非構造化データ
固定のフィールドにではなく、構造化されていない形式で保管されるデータ。 ワード・プロセッシング文書のデータは、非構造化データの一例である。 「 構造化データ (structured data)」も参照。
非構造化情報
固定の場所に含まれていないデータ (自然言語テキスト文書など)。
教師なし学習
- ラベルなしの生データを使用して、人的労力をほとんどまたはまったくかけずにシステムを学習することが可能な、ディープ・ラーニング用のモデル。
- モデルにラベル付きデータが提供されておらず、データ内のパターンまたは構造を単独で検出する必要がある機械学習トレーニング方式。
V
検証セット
トレーニング・プロセス中に機械学習モデルのパフォーマンスおよび一般化可能性を評価するために使用される、ラベル付きデータの別個のセット。ハイパーパラメーターのチューニングおよびモデルの選択を支援する。
ベクトル
[1, 2, 5] または [0.7, 0.2, -1.0] などの、1 次元の番号付きリスト。
ベクトルデータベース
ベクターストアを参照。
ベクトルインデックス
ベクトルストアから文書のベクトル化埋め込みを検索するインデックス。
ベクターストア
ベクトル化された埋め込み文書を保存するリポジトリ。
言語化
生成 AI において、チューニングおよび推論の際にデータをフォーマットするためのテンプレート。
仮想エージェント
自然言語を処理して単純なビジネス・トランザクションに対応したり、より複雑な要求を対象分野の専門知識を持つ人に送付したりすることができる、事前にトレーニングされたチャットボット。
可視化
グラフ、図表、プロット、表、マップ、またはその他のデータ・ビジュアル表示。
W
ウェイト
ネットワークの層内で入力データを変換するノードの係数。 重みは、AI モデルが学習を通じて学習し、その値を調整してモデルの予測の誤差を減らすパラメーターです。
Z
ゼロ・ショット・プロンプト
方法の具体的な例を示さずに、モデルがタスクを完了するプロンプト手法。