漂移评估指标
特征漂移评估指标用于测量重要特征的值分布变化。
度量详细信息
特征漂移是一种漂移 v2 评估指标,用于评估机器学习模型的数据分布变化。
作用域
漂移功能仅评估机器学习模型。
人工智能资产的类型 :机器学习模型
分数和数值
特征漂移指标分数表示重要特征的值分布变化。
- 最佳成绩 : 0.0
- 比率:
- 0:价值分配没有变化
- 超过0:价值分配变化增加
评估流程
通过测量连续和离散值的概率分布,对分类和数值特征进行漂移计算。 为了确定数字特征的离散值,使用二进制对数来比较每个特征的不同值数量与每个特征的值总数。
测算
以下二进制对数公式用于识别离散的数字特征:
如果 distinct_values_count 小于 total_count 的二进制对数,则该特征被识别为离散的。
詹森·香农距离是库勒巴克-李布尔(KL)散度的标准化形式,用于衡量一个概率分布与另一个概率分布之间的差异。 詹森·香农距离是一个对称的分数,且总是具有有限的值。
以下公式用于计算两个概率分布(基线(B)和产量(P))的詹森·香农距离:
重叠系数是通过测量两个概率分布之间的交集总面积来计算的。 为了测量分布之间的差异,从1中减去交集或重叠区域,以计算漂移量。
重叠系数的计算公式如下:
𝑥 是一系列等距样本,涵盖
域,从基准数据与生产数据的最低值之和到基准数据与生产数据的最高值之和。
是两个连续的𝑥样本之间的差值。
是样本点𝑥处生产数据密度函数的值。
是样本点𝑥的基线数据密度函数的值。
总变化距离用于测量两个概率分布(基线(B)和产量(P))对同一交易分配的概率之间的最大差异,如下式所示:
如果两个分布相等,则它们之间的总变化距离为0。
总变化距离的计算公式如下:
𝑥 是一系列等距样本,涵盖
域,从基准数据与生产数据的最低值之和到基准数据与生产数据的最高值之和。
是两个连续的𝑥样本之间的差值。
是样本点𝑥处生产数据密度函数的值。
是样本点𝑥的基线数据密度函数的值。
分母代表生产和基准数据密度函数图下的总面积。 这些总和是域空间积分的近似值,这两个项都应该是1,总和应该是