规则实验室
Rule 实验室是文本分析工作台中的一个交互式工具。 您可以在 “资源编辑器 ”选项卡中找到它。 在将文本链接分析(TLA)规则应用于完整数据集之前,请使用它来测试和优化这些规则。
如果您想创建新的文本链接规则,或者想了解在文本链接分析过程中某些句子是如何被匹配的,可以使用一段示例文本来对文本链接规则进行模拟测试。 您可以在“规则实验室”中运行模拟。 它提供了一个测试环境,您可以在其中验证您的 TLA 规则与示例文本数据的匹配情况。 Rule 实验室可帮助您理解规则的行为,并优化规则,以确保它们能够准确捕捉您期望的模式。 您可以使用 Rule Lab 快速修改规则并重新运行模拟,从而优化模式匹配,而无需处理整个数据集。
使用 Rule 实验室
您可以在“规则实验室”中通过输入示例文本数据,然后对该示例运行提取流程来执行测试。 Rule实验室使用的语言资源和提取设置与全文链接分析流程完全一致。 这些相似的设置有助于确保测试结果能够准确反映规则日后在您的完整数据集上的应用情况。 然后,您可以查看样本文本的文本链接分析结果,以便更好地了解匹配机制。
在提取过程中,样本文本会被解析成句子。 然后,这些句子会被分解成词元。 随后,系统会应用您的 TLA 规则,在分词后的文本中识别匹配的模式。 最终结果显示了每个样本的标记,以及与从文本中提取的模式匹配的任何 TLA 规则。
- 令牌
词元是指在提取过程中识别出的单词或词组。 new yorkinworksunclemyMy uncle works in New York例如,在句子中,提取过程中可能会发现以下词元:、、、、、和。 此外, uncle 可以作为概念提取并标记为
<Unknown>,而 new york 也可以作为概念提取并标记为<Location>。 所有概念都是符号,但并非所有符号都是概念。 标记还可以是其他宏、字面量字符串以及未提取的单词。 只有那些被输入的单词或短语才能作为概念。- 宏
宏是一组可重用的文本链接分析规则元素,它通过使用 (
|) 运算符OR将类型、字符串、其他宏以及类似值组合在一起。宏的值区分大小写m每个宏都有一个唯一的名称,且名称前缀为小写字母,例如mTopic。 当文本链接分析规则引用宏时,该宏的名称前会加上$,例如$mTopic。 宏名称区分大小写。您在多个 TLA 规则中复用了宏。 如果您使用宏来构建 TLA 规则,这有助于将复杂的规则分解为可重用的模块,从而简化 TLA 规则。 这样,您就可以在一个宏中更新共享逻辑,而无需编辑多个 TLA 规则。
生成新的 TLA 规则
您可以点击 “生成规则 ”,根据仿真结果自动生成新规则。 新规则使用了您示例文本中确定的实际标记和类型。 SPSS Modeler 执行以下操作以创建新的 TLA 规则:
- 它将示例文本用作 TLA 规则的示例。
- 它会自动使用匹配到的前六个令牌,按顺序生成输出。 此自动化功能可免去您手动添加规则基本信息的步骤。 不过,该规则可能还需要进一步修改。
例如,在句子 “不提供电视、互联网或Wi-Fi” 中,每个词元都会被解析(
<wifi><or><internet><,><TV><no><provided>)。随后,这些词元会被赋予类型,并按照它们出现的精确顺序用于该规则的输出中:#@# no TV, internet or wifi provided [pattern(40)] name=generated_rule_40 value=$mMiscNeg $mTopic $SEP $mTopic $mCoord $mTopic $mSupport output(1)=$1\t#1\t$2\t#2\t$3\t#3\t$4\t#4\t$5\t#5\t$6\t#6 - 它将模拟过程中输入或与宏匹配的标记插入到规则定义中。
- 当一个标记同时匹配宏和类型值时,它会优先处理宏,从而简化了规则结构。
mTopic例如,在句子 “我喜欢披萨” 中 ,“披萨” 被输入为<Unknown>,并与宏 匹配。 在这种情况下,mTopic将 用作生成的规则中的元素。
生成规则后,您可以返回“规则实验室”,使用您的样本测试新规则,以验证该规则是否能正确匹配该模式。