朴素贝叶斯背景

您可以轻松快捷地应用朴素贝叶斯分类算法,因为它不像大多数算法那么复杂。

虽然其分类准确度不如更复杂的算法,但是可以获得相似的结果,而所需时间只是几分之一。为了计算属性值的条件类概率,朴素贝叶斯分类算法使用贝叶斯定理。这种概率称为后验类概率

朴素贝叶斯分类算法如下所示:

分子称为贝叶斯分子,分母称为贝叶斯分母。计算基于先验类概率. 可以根据类的联合逆条件属性值概率,直接根据数据估算这些概率:

可以将每个属性的条件属性值概率相乘,高效计算联合逆条件属性。. 您可以假定类的属性有条件地独立,直接从数据估算这些概率。实际上,这项假定可能不符合事实,这就是此算法称为“朴素”的原因。虽然违反此假定会导致概率计算不准确,但这些违例可能不会影响预测准确度。预测可能准确,即使用于计算的概率不正确也是如此。经证实,在多个不符合独立性假定的领域,朴素贝叶斯分类器可以生成不错的预测结果。

因此,当类中某个属性值的估算概率为 0 时,这个类的后验概率也计算为 0。如果此条件对于所有的类都成立,那么无法进行预测。为了防止出现此问题,您可以将零概率替换为足够小的正数。如果在类 中,不存在属性 的值等于 的实例,那么概率 可以设置为存在这样一个实例时所估算概率的一半。避免此问题的更精良方法是使用经修正的概率估算技术。此技术称为 估算。在此估算中,以针对几个假设实例假设的先验频率来扩充每个类的属性值频率。另外,还会针对训练实例观测每个类的属性值频率。没有关于领域的特定知识时,对于特定类中的所有属性值,假定这些先验频率相等。此外,还假定包括的假设实例数等于可能属性值的数目。