AIの行動リスク
説明
AIエージェントは、関連する人間の価値観、倫理的配慮、ガイドライン、ポリシーに沿わない行動を取る可能性がある。 ミスアラインメントは、次のようなさまざまな形で発生する可能性がある:
- 学習した目標を、新しい状況や予期せぬ状況に不適切に適用する。
- AIエージェントを、本来の用途を超えた目的/目標のために使用すること。
- 偏った方法でリソースやツールを選択する
- 特定の文脈の中で与えられた指示に基づいて策略を練る能力を身につけることで、目標を達成するために欺く戦術を用いる。
- AIエージェントの価値を妥協して、別のAIエージェントやツールと協力してタスクを達成する。
基盤モデル、アクションのズレが懸念されるのはなぜか?
ズレた行動は、人々に悪影響を与えたり、傷つけたりする可能性がある。
親トピック AIリスクアトラス
基盤モデルリスクの多くを説明するために、報道で取り上げられた例を提供する。 報道されたこれらの出来事の多くは、現在も進行中であるか、あるいは解決済みであり、それらを参照することは、読者が潜在的なリスクを理解し、軽減策を講じるのに役立つ。 これらの例を強調するのは、あくまでも説明のためである。