AI 的数据中毒风险
描述
一种对抗性攻击,即敌方或恶意内部人员向训练或微调数据集注入故意破坏、虚假、误导或不正确的样本。
为什么数据中毒是对基础模型的关注?
中毒数据可使模型对恶意数据模式敏感,并产生对手期望的输出。 它会产生安全风险,在这种风险中,对手可以为了自己的利益而强制实施模型行为。 合成数据生成可用于创建中毒数据,然后用于实施数据中毒攻击。
示例
低资源数据中毒
根据原文,一组研究人员发现,只需非常有限的资源,任何人都可以向少量网页添加恶意数据,而这些网页的内容通常是为人工智能训练而收集的(如维基百科网页),足以导致大型语言模型生成错误答案。
示例
图像修改工具
根据原文,研究人员开发了一种名为 "Nightshade "的工具,它能以破坏计算机视觉的方式修改图像,但人类仍然无法看到。 当这些 "中毒 "的修改过的图像被用于训练人工智能模型时,模型可能会产生不可预测的意外结果。 该工具的创建是为了保护知识产权免受未经授权的图片搜刮,但文章也强调,用户可能会滥用该工具,故意上传 "有毒 "图片。
来源:
母主题: 人工智能风险图集
我们提供了媒体报道的例子,以帮助解释基金会模式的许多风险。 新闻界报道的许多事件或仍在发展中,或已得到解决,参考这些事件可以帮助读者了解潜在的风险,并努力减少风险。 强调这些例子仅供参考。