关联规则背景

关联规则挖掘在事务中检测频繁模式和规则。关联规则挖掘的熟知算法包括 Apriori 和 FP-Growth。对于分析存储过程,首选 PrefixSpan 算法,因为它具有可伸缩性。

Apriori 算法通过执行连续迭代来搜索频繁项目集。这些迭代有系统地考虑不断增大的项目集。但是,对于大型数据集或低阈值,识别的候选项数可能会过多。

与 Apriori 算法不同,PrefixSpan 算法搜索整个模式集,但避免创建非必要的候选项。此外,对项目进行排序以及前缀投影可以大大减小投影数据库的大小。这些方法还可以提高处理效率。