AIへの直接指示攻撃リスク

堅牢性 ロバストネス・リスクを表すアイコン。
堅牢性:迅速な攻撃
推論リスク
生成AIに特有

説明

アプリケーションから望ましくない応答を引き出すように設計されたプロンプト、質問、または要求。 このアプローチは、望ましくない行動をとるようモデルに直接指示する。

基盤モデル、なぜ直接的な指示攻撃が懸念されるのか?

直接命令攻撃は、モデルの挙動を変化させ、攻撃者に利益をもたらすために使用できる。 それが生成するコンテンツは、ユーザーや他者に害を及ぼす可能性がある。

親トピック AIリスクアトラス

基盤モデルリスクの多くを説明するために、報道で取り上げられた例を提供する。 報道されたこれらの出来事の多くは、現在も進行中であるか、あるいは解決済みであり、それらを参照することは、読者が潜在的なリスクを理解し、軽減策を講じるのに役立つ。 これらの例を強調するのは、あくまでも説明のためである。