自然鲁棒性度量
自然鲁棒性衡量的是语言模型对自然变化的输入(如转述和小错别字)做出一致响应的能力,有助于评估模型的稳定性和可靠性。
度量详细信息
自然鲁棒性指标评估模型在输入文本出现自然变化时保持响应一致性的能力。 这些扰动包括良性变化,如标点符号、字母大小写、自然错字、转述和其他非恶意修改。 这有别于对抗鲁棒性指标,后者主要针对故意制造的有害扰动。
作用域
支持的语言 :英语、法语
要计算自然鲁棒性得分,需要从测试数据集中抽取一个具有代表性的子集--默认情况下,抽取 5 条记录。 用户可以在度量设置过程中配置样本量。
对于每个选定的输入,都会产生多种扰动:
自然扰动 :表面上的小改动,如删除或更改标点符号、修改字母大小写或引入自然错别字。
转述 :使用语义等同的表达式重写输入内容。
将模型对这些扰动输入的响应与针对未修改输入生成的原始响应进行比较。 该指标量化了导致有意义的不同输出的输入扰动比例。
分数和价值
- 自然鲁棒性得分 = (引起不同反应的扰动次数)/(扰动总数)
- 分数范围: 0.0 至 1.0
- 如果得分接近 1.0 ,则表明模型是稳健的,能在自然变化的输入条件下产生稳定的响应。
- 如果得分接近 0.0 ,则表明模型对轻微的非恶意更改很敏感,可能会影响用户的信任和体验。
自然鲁棒性有助于评估模型在常见现实世界输入变异性下的泛化能力,从而揭示其可靠性和稳定性。
了解更多
有关红队演练指标的更多信息,请参阅以下示例笔记本: