Introducir la métrica de evaluación de la desviación de metadatos

La métrica de desviación de metadatos de entrada mide el cambio en la distribución de los metadatos de texto de entrada LLM.

Detalles de métrica

La desviación de metadatos de entrada es una métrica de evaluación de desviación de la v2, que puede ayudar a medir los cambios en sus datos a lo largo del tiempo para garantizar resultados consistentes para su modelo.

Los siguientes tipos de metadatos de texto de entrada LLM se miden con la desviación de metadatos de entrada:

Recuento de caracteres : Número total de caracteres en el texto introducido. Recuento de palabras : Número total de palabras en el texto introducido. Recuento de tokens : Número total de tokens en el texto introducido. Recuento de frases : Número total de frases en el texto introducido. Longitud media de las palabras : Longitud media de las palabras en el texto introducido. Longitud total de las palabras: Longitud total de las palabras en el texto introducido. Longitud media de las frases : Longitud media de las frases en el texto introducido

Ámbito

La desviación de metadatos de entrada evalúa solo los activos de IA generativa.

  • Tipos de activos de IA : plantillas de mensajes
  • Tareas de IA generativa :
    • Resumen de texto
    • Clasificación de texto
    • Generación de contenido
    • Extracción de entidades
    • Respuesta a preguntas
  • Idiomas disponibles : inglés

Puntuaciones y valores

La puntuación de desviación de metadatos de entrada indica el cambio en la distribución de los metadatos de texto de entrada LLM.

  • Rango de valores : 0.0-1.0
  • Mejor puntuación posible : 0.0
  • Ratios :
    • A las 0: No se detecta ningún cambio.
    • Más de 0: Se detecta un cambio creciente.

Proceso de evaluación

Watsonx.governance calcula la desviación de los metadatos de entrada midiendo el cambio en la distribución de las columnas de metadatos. La columna de recuento de tokens de entrada, si está presente en la carga útil, también se utiliza para calcular la desviación de metadatos de entrada. También puede optar por especificar cualquier campo meta al añadir registros a la tabla de carga. Estos metacampos también se utilizan para calcular la desviación de los metadatos de entrada.

Cómo calcularlo

La siguiente fórmula de logaritmo binario se utiliza para identificar columnas de metadatos de entrada numérica discreta:

Se muestra la fórmula del logaritmo binario

Si el logaritmo neperiano ( distinct_values_count ) es menor que el logaritmo binario del logaritmo neperiano ( total_count), la característica se identifica como discreta.

La siguiente fórmula de distancia de Jensen-Shannon se utiliza para calcular la desviación de los metadatos de entrada para columnas de metadatos de entrada discretas:

Se muestra la fórmula de distancia de Jensen Shannon

La distancia de Jensen-Shannon es la forma normalizada de la divergencia de Kullback-Leibler (KL) que mide cuánto difiere una distribución de probabilidad de la segunda distribución de probabilidad. La distancia de Jensen-Shannon es una puntuación simétrica y siempre tiene un valor finito.

Se muestra la divergencia de KL es la divergencia KL.

Las fórmulas de distancia de variación total y coeficiente de superposición se utilizan para calcular la deriva de los metadatos de entrada para columnas de metadatos de entrada continuas.

La distancia de variación total mide la diferencia máxima entre las probabilidades que dos distribuciones de probabilidad, la línea de base (B) y la producción (P), asignan a la misma transacción, como se muestra en la siguiente fórmula:

Se muestra la fórmula de distribución de probabilidad

Si las dos distribuciones son iguales, la distancia de variación total entre ellas se convierte en 0.

La siguiente fórmula se utiliza para calcular la distancia de variación total:

Se muestra la fórmula de la distancia de variación total

  • 𝑥 es una serie de muestras equidistantes que abarcan el dominio de se muestra circunflejo f y que van desde el mínimo combinado de los datos de referencia y producción hasta el máximo combinado de los datos de referencia y producción.

  • se muestra el símbolo d(x) es la diferencia entre dos muestras 𝑥 consecutivas.

  • explicación de la fórmula es el valor de la función de densidad para los datos de producción en una muestra 𝑥.

  • explicación de la fórmula es el valor de la función de densidad de los datos de referencia para una muestra 𝑥.

El denominador explicación de la fórmula representa el área total bajo los gráficos de la función de densidad para los datos de producción y de referencia. Estas sumas son una aproximación de las integraciones sobre el espacio de dominio y ambos términos deben ser 1 y el total debe ser 2.

El coeficiente de superposición se calcula midiendo el área total de la intersección entre dos distribuciones de probabilidad. Para medir la diferencia entre distribuciones, se resta la intersección o el área de superposición de 1 para calcular la cantidad de desviación. La siguiente fórmula se utiliza para calcular el coeficiente de solapamiento:

Se muestra la fórmula del coeficiente de superposición

  • 𝑥 es una serie de muestras equidistantes que abarcan el dominio de se muestra circunflejo f y que van desde el mínimo combinado de los datos de referencia y producción hasta el máximo combinado de los datos de referencia y producción.

  • se muestra el símbolo d(x) es la diferencia entre dos muestras 𝑥 consecutivas.

  • explicación de la fórmula es el valor de la función de densidad para los datos de producción en una muestra 𝑥.

  • explicación de la fórmula es el valor de la función de densidad de los datos de referencia para una muestra 𝑥.