护栏可用过滤器

您可以使用防护栏过滤器来检测和管理防护栏策略中的风险。 这些过滤器可对用户输入和大型语言模型生成的输出内容进行过滤。

除了现有的过滤器外,您还可以创建自定义检测器,通过您自己的检测逻辑来扩展 Guardrail 的功能。 自定义检测器可让您集成外部检测服务,并针对您的具体使用场景定义专门的内容过滤规则。 如需了解更多信息,请参阅 《为防护栏策略创建自定义检测器》

可用过滤器

下表列出了可在防护策略中使用的所有可用过滤器:

护栏的可用过滤条件
护栏过滤器 过滤器的用途
代理调用函数验证 根据用户查询和可用的工具定义,检测存在语法或语义错误的函数调用的潜在风险。
自带风险(BYOR)过滤器 通过使用 Granite Guardian,并结合调用方提供的风险名称和定义,在输入文本中检测自定义风险。
有害内容过滤器 可检测各种潜在有害文本,包括越狱尝试。
仇恨、辱骂和粗俗语言过滤器 检测并标记仇恨言论、辱骂性语言和粗俗语言。
越狱过滤器 检测用户提示是否试图操纵AI系统或大型语言模型(LLM)的响应,以生成有害或不当的内容。
关键词过滤器 通过基于正则表达式的匹配,在输入文本中检测用户指定的关键词。
离题过滤器 根据系统提示中指定的意图,判断用户提示是否偏离主题。
注意: 此筛选条件仅在达拉斯和法兰克福区域可用。
个人身份信息(PII)过滤器 检测并标记个人身份信息,例如电话号码和电子邮件地址。 有关支持的实体的完整列表,请参阅 “基于规则的一般实体提取 ”。
不雅言辞过滤器 检测常见的脏话和粗口。
即时安全风险过滤器 检测并标记属于越狱、提示注入、与主题无关或有害内容的用户提示。
注意: 此筛选条件仅在达拉斯和法兰克福区域可用。
正则表达式过滤器 通过基于模式的匹配,在输入文本中检测用户指定的正则表达式。
性内容过滤器 检测具有性内容的露骨或暗示性内容。
社会偏见过滤器 检测被视为对某些群体给予不合理优待或歧视的内容。
不道德的过滤器 检测直接表明存在欺诈或盗窃的言论或行为。
暴力过滤器 检测被视为鼓吹暴力行为、自残、威胁或恐吓的内容。
检索增强生成(RAG)过滤器 包括用于评估检索增强生成响应的答案相关性、上下文相关性和保真度过滤器。

代理调用函数验证

代理调用函数验证功能基于用户查询和可用工具定义,检测存在语法或语义错误的函数调用所带来的潜在风险。

有害内容过滤器

有害内容过滤器可检测到广泛范围的潜在有害文本——包括越狱内容。

仇恨、辱骂和亵渎(HAP)过滤器

HAP过滤器可检测并标记以下类型的语言:

  • 仇恨言论:基于种族、宗教、族裔、性取向、残疾或性别等特征,对个人或群体表达的仇恨言论。 仇恨言论旨在伤害、羞辱或侮辱某个群体的成员,或煽动暴力或社会动乱。

  • 辱骂性语言:指旨在欺凌、贬低或侮辱他人或事物的粗鲁或伤害性言语。

  • 粗俗语言:指含有辱骂性词汇、侮辱性言辞或露骨性暗示的有害言语。

您可以独立地将HAP滤波器应用于用户输入和模型输出。

您可以通过设置阈值来调整过滤器的灵敏度。 阈值代表HAP分类器生成的评分必须达到的数值,才能将内容判定为有害。 分数阈值范围为 0.0 至 1.0。

较低的阈值(例如 0.1 或 0.2 )更为安全,因为其触发门槛更低。 当较低的评分就能触发过滤器时,有害内容更容易被识别出来。 然而,当内容安全时,分类器也可能被触发。

值越接近1(例如 0.8 或 0.9 ),风险就越高,因为评分阈值越高。 当需要更高的分数才能触发过滤器时,有害内容的出现可能被遗漏。 然而,被标记为有害的内容更有可能确实有害。

要禁用AI防护栏,请将HAP阈值设置为0 1

越狱过滤器

越狱过滤器用于检测用户提示是否试图操纵AI系统或大型语言模型(LLM)的响应,以生成有害或不当内容。

关键词过滤器

关键词过滤器采用基于正则表达式的匹配机制,用于检测输入文本中用户指定的关键词。

使用关键词过滤器来控制是否将包含不受欢迎术语(如竞争对手名称)的模型生成的响应返回给最终用户。

关键词检测器若未检测到关键词则输出分数 , 0 若检测到每个关键词则 1 输出分数。 它还显示检测到的关键词的位置(如果存在)。

此行为适用于输入中指定的每个关键词。

离题过滤器

脱题过滤器采用嵌入模型,根据系统提示中指定的意图来识别用户提示是否偏离主题。

使用离题过滤器来控制是否将与系统提示中指定内容无关的用户提示过滤掉,使其不发送至基础模型。

您可以通过设置阈值来调整过滤器的灵敏度。 阈值代表脱题分类器必须达到的数值,才能将内容判定为有害。 分数阈值范围为 0.0 至 1.0。 默认阈值设置为 0.5。

较低的阈值(例如 0.1 或 0.2 )更为安全,因为其阈值设定较低。 当较低的评分即可触发过滤器时,非主题内容更容易被识别。 然而,当内容切题时,分类器也可能被触发。

值越接近 1.0 (例如 0.8 或 0.9 ),风险就越高,因为评分阈值更高。 当需要更高的分数才能触发过滤器时,可能遗漏偏离主题的内容。 然而,被标记为离题的内容更可能确实离题。

要禁用AI防护栏,请将离题阈值设置为 1.0。

个人身份信息(PII)过滤器

PII过滤器采用NLP人工智能模型来识别并标记内容。 有关被标记的实体类型的完整列表,请参阅通用实体的规则提取

使用PII过滤器来控制是否从用户输入和基础模型输出中过滤掉个人身份信息(如电话号码和电子邮件地址)。 您可以分别对用户输入和模型输出设置PII过滤器。

PII滤波器的阈值设定为 0.8 ,且无法调整该滤波器的灵敏度。

不雅言辞过滤器

粗口过滤器可检测常见的脏话和咒骂词语。

即时安全风险过滤器

提示安全风险过滤器结合了两种句子分类器:离题检测器和提示注入检测器。 这些分类器是根据 IBM 研究院开发的 IBM Watbert 系列自然语言处理 (NLP) 模型中的大型语言模型进行微调而来的。 默认情况下,提示安全风险过滤器采用两级检测方法。

用户输入由离题检测器和提示注入检测器并行处理。 若离题检测器返回的分数高于默认阈值 0.9 ,则返回响应。 否则,如果提示注入检测器返回的评分高于默认阈值 0.8 ,则返回响应。 若两个检测器返回的评分均低于各自阈值,则输入将传递至 Granite Guardian,并返回其响应结果。 这些阈值是可配置的。

要获得更精确的结果,您可以使用更高的阈值。 您可以通过将 enable_two_level_detection 设置为 0 来明确禁用 false两级检测逻辑。 当 enable_two_level_detection 设置为 false时,仅使用离题检测器和提示注入检测器来计算提示安全风险,且输入不会发送至 Granite Guardian。

使用提示安全风险过滤器来检测并标记用户提示中的越狱行为、提示注入、离题内容或有害内容。

注意: 若选择设置阈值,请使用大于 0.9 的数值,这能提高准确性,但可能增加成本和延迟。

您可以通过设置阈值来调整过滤器的灵敏度。 阈值代表由提示安全风险分类器生成的评分必须达到的数值,才能将内容判定为不安全。 分数阈值范围为 0.0 至 1.0。

要禁用AI防护机制,请将提示安全风险阈值设置为 1.0。

正则表达式过滤器

正则表达式过滤器采用基于模式的匹配方式,用于检测输入文本中用户指定的正则表达式。

使用正则表达式过滤器,防止包含信用卡号等不受欢迎模式的用户输入或模型生成的响应被发送至基础模型或返回给最终用户。

正则表达式检测器若未检测到任何正则表达式模式,则输出空值 0 ;若检测到正则表达式模式 1 ,则输出每个模式对应的评分。 它还显示检测到的图案的位置(如适用)。

此评估针对输入中指定的每个正则表达式模式执行。

性内容过滤器

性内容过滤器可检测到露骨或暗示性的性内容。

社会偏见过滤器

社会偏见过滤器可检测到那些被认为不合理地偏袒或歧视特定群体的内容。

不道德的过滤器

不道德过滤器可检测直接暗示欺诈或盗窃的言论或行为。

暴力过滤器

暴力过滤器会检测被认为宣扬攻击、自残、威胁或恐吓行为的内容。

检索增强生成(RAG)过滤器

以下是用于RAG的过滤器:

答案相关性过滤器

  • 答案相关度指标评估模型输出对输入问题的回答质量。 分数范围从 0.01.0,分数越高表示相关性越强的回答。

  • 您可以通过设置阈值来调整过滤器的敏感度,从而控制答案的相关性。 阈值代表答案相关性分类器必须为模型的响应分配的最低分数,该响应才能被视为与用户的问题相关。

  • 较低的阈值(如 0.00.2)更为宽松。 更多答案将被归类为相关,即使它们与问题的契合度较低。

  • 更高的阈值(如 0.80.9)更为严格。 只有与问题高度契合的答案才会被视为相关。 这可能会导致某些有效的响应被标记为无关。

  • 默认阈值为 0.0。 所有答案均被视为相关,并返回其对应的得分。

上下文相关性过滤器

  • 上下文相关度指标衡量检索到的上下文与用户在提示中指定的问题的契合程度。 它还提供注释,突出显示与问题最相关的上下文句子。 分数范围从 0.01.0,分数越高表示上下文相关性越强。

  • 您可以通过设置阈值来调整过滤器的敏感度,以提升上下文相关性。 阈值代表上下文相关性分类器必须为检索到的上下文分配的最低分数,该上下文才能被视为与用户问题相关。

  • 较低的阈值(如 0.00.2)更为宽松。 更多上下文将被归类为相关,即使它们与问题的关联性较弱。

  • 更高的阈值(如 0.80.9)更为严格。 只有与问题高度契合的上下文才会被视为相关。 这可能还会导致某些有效的上下文被标记为无关。

  • 默认阈值为 0.0。 所有上下文均被视为相关,并返回其各自的评分。

忠实度过滤器

忠实度指标衡量模型输出在模型上下文中的合理性,并提供上下文归因信息,以展示对模型输出贡献最大的关键句子。 该指标得分范围介于 0.0 与 之间 1.0。 分数越高表明输出内容越接地气,越不存在幻觉。

您可以通过设置阈值来调整滤波器的灵敏度,以确保还原度。 阈值代表忠实度分类器必须为模型输出分配的最低分数,该输出才被视为基于给定上下文。

较低的阈值(如 0.00.2)更为宽松。 更多输出将被归类为接地输出,即使它们与上下文的关联性较弱。 这也增加了允许包含轻微幻觉的回应的风险。 更高的阈值(如 0.80.9)更为严格。 只有在上下文中具有充分依据的输出结果才会被视为忠实。 某些切合实际的回应可能会被标记为不忠实。

默认阈值设置为 0.0。 所有答案均被视为正确,并返回其对应的分数。