La validación de modelos es el proceso estructurado de determinar si un modelo de machine learning (ML) es apto para su uso previsto.
En lugar de simplemente preguntar: “¿El modelo produce una respuesta?”, la validación de modelos pregunta si el diseño, las suposiciones, los datos, la implementación, los resultados, las limitaciones y el comportamiento continuo del modelo son lo suficientemente confiables para las decisiones que las personas tomarán con él.
La validación de modelos permite a las empresas reducir el riesgo del modelo —el riesgo de que un modelo produzca resultados inexactos, sesgados, inestables, inseguros o mal utilizados— evaluando proactivamente el desempeño del modelo sobre sus funciones.
Para una validación sencilla, los desarrolladores de modelos pueden simplemente evaluar el modelo candidato frente a un conjunto de validación —el conjunto de ejemplos que los ingenieros de ML y científicos de datos usan para comprobar qué tan bien está aprendiendo un modelo— durante el desarrollo.
Sin embargo, en el nivel de gestión de riesgos del modelo, la validación de modelos es mucho más amplia. Normalmente, la validación de modelos empresarial es una evaluación independiente de todo el ciclo de vida del modelo. El modelo de ML lo revisan personas que no son los creadores del modelo, y la revisión cubre cómo se creó, lanzó, utilizó, monitoreó, modificó y finalmente retiró el modelo.
Un proceso de validación exitoso establece cinco cosas.
El rigor del proceso de validación de modelos suele coincidir con el propósito del modelo. Una herramienta interna de forecasting de bajo impacto no se necesita analizar tan a fondo como un modelo que aprueba hipotecas o detecta transacciones bancarias fraudulentas.
Es importante destacar que la validación de modelos no es un evento de aprobación puntual. Incluso si inicialmente funcionan bien, los modelos se pueden derivar y degradar tras su lanzamiento, por lo que la validación continua de modelos de ML suele estar integrada en las prácticas de gobernanza de inteligencia artificial (IA) de una empresa.
Según el Marco de gestión de riesgos de IA del NIST, los pilares de la confianza en el modelo incluyen la validez y confiabilidad, la seguridad, la protección y resiliencia, la responsabilidad y transparencia, la explicabilidad y la interpretabilidad, la mejora de la privacidad y la gestión de la equidad y los sesgos.
La validación de modelos de ML ayuda a establecer y mantener la confianza en el modelo (el nivel de confianza justificado de que un modelo se comportará adecuadamente). Las empresas toman decisiones basadas en los resultados del modelo de ML, por lo que la confianza en el modelo no es solo un objetivo de reputación. Es fundamental para el uso seguro, eficaz y escalable de la IA. De hecho, los objetivos de confianza en el modelo a menudo informan las prácticas de validación del modelo.
Además, un modelo no puede considerarse confiable simplemente porque su desarrollador lo llame “IA responsable”. Los modelos deben poder realizar sus tareas de manera confiable, proteger a las personas y los datos, resistir el uso indebido, además de que se deben comprender y gobernar. Ese nivel de confianza debe ganarse mediante controles demostrables y recopilación persistente de evidencia durante la validación de modelos de IA.
Una forma ampliamente adoptada de entender los pilares de la confianza modelo es el Marco de gestión de riesgos de la IA del Instituto Nacional de Estándares y Tecnología (NIST) de EE. UU. Identifica siete características interdependientes de una IA confiable.
Un modelo de confianza debe ser válido para su tarea y confiable a lo largo del tiempo, en las condiciones esperadas. La validez pregunta si el modelo realmente mide, predice, clasifica o genera lo que dice.
La confiabilidad pregunta si el modelo funciona de forma consistente y fiable cuando se le proporcionan entradas comparables, incluyendo entradas de diferentes usuarios, entornos, fuentes de datos y periodos de tiempo.
El pilar de seguridad se centra en si el modelo puede causar daño a las personas, los bienes, las organizaciones o la sociedad, incluso cuando técnicamente funciona según lo diseñado.
Un modelo puede ser tanto preciso como poco seguro. Por ejemplo, un chatbot de atención al cliente puede recuperar correctamente la información de la cuenta, pero si se puede manipular para exponer datos confidenciales, sigue siendo poco seguro para su despliegue. La seguridad requiere que los equipos identifiquen los daños previsibles antes del despliegue y los aborden de forma proactiva mediante el diseño del sistema.
La seguridad protege el modelo, sus datos, sus interfaces y la aplicación circundante del acceso o la manipulación maliciosos. Para los sistemas modernos de IA, la superficie de ataque se extiende mucho más allá de los pesos del modelo. También incluye datos de entrenamiento, fuentes de recuperación, instrucciones, interfaces de programación de aplicaciones (API), complementos, identidades de usuario, infraestructura de despliegue, registros y cadenas de suministro de modelos. Los controles de seguridad deben ser capaces de gestionar toda la superficie de ataque.
La resiliencia se refiere a la capacidad del modelo para continuar funcionando de manera segura, recuperarse adecuadamente o fallar de forma controlada si algo sale mal. Esto significa validar que los modelos puedan manejar interrupciones no maliciosas, así como ciberataques. En un entorno de alto impacto, fallar de manera segura suele ser más importante que simplemente permanecer disponible.
Rendición de cuentas significa que los propietarios designados son responsables del diseño, el despliegue, los resultados y la corrección del modelo. Sin rendición de cuentas, una empresa puede decir “la IA decidió” cuando algo sale mal.
La transparencia significa que toda la información relevante sobre el sistema, sus resultados, limitaciones y gobernanza está disponible para las personas que la necesitan. La transparencia no requiere que las empresas revelen código fuente patentado ni detalles de seguridad confidenciales. Significa divulgar suficiente información precisa y utilizable para que los stakeholders comprendan toda la amplitud del sistema.
La explicabilidad y la interpretabilidad ayudan a las personas a comprender cómo funciona un modelo y qué significan sus resultados en el contexto de una decisión real. En lenguaje sencillo, la explicabilidad pregunta: “¿Qué factores o procesos llevaron a este resultado?” y la interpretabilidad pregunta: “¿Qué significa este resultado y cómo debería usarla una persona?”
Este pilar es lo que más importa cuando las decisiones son trascendentales, controvertidas, reguladas o difíciles de revertir (por ejemplo, la modelización de riesgo crediticio).
La privacidad está estrechamente ligada a la seguridad, pero los conceptos son distintos. La seguridad evita que partes no autorizadas accedan a los datos, mientras que la privacidad ayuda a garantizar que los datos se recopilen, utilicen, almacenen y compartan de manera adecuada.
Los modelos pueden crear un riesgo de privacidad incluso cuando no están diseñados explícitamente para procesar datos personales. Los conjuntos de entrenamiento de modelos pueden contener información sensible, y los registros pueden conservar datos de usuario que solo se debían almacenar temporalmente. Las prácticas de validación de modelos ayudan a las empresas a garantizar que las herramientas de IA sean seguras y cumplan con las reglas de privacidad.
La equidad requiere que una organización identifique, mida, reduzca y monitoree los sesgos dañinos. Esto no significa que todas las personas deban recibir siempre el mismo resultado. Más bien, las diferencias en el trato o los resultados deben estar justificadas, ser legales, relevantes para la tarea y no estar impulsadas por sesgos evitables o dañinos.
Obtenga insights curados sobre las noticias más importantes e intrigantes de la IA. Suscríbase a nuestro boletín semanal Think. Consulte la Declaración de privacidad de IBM .
La validación de modelos suele incluir una serie de comprobaciones y técnicas de validación diferentes.
La solidez conceptual evalúa la lógica y el diseño subyacentes del modelo. Evalúa si la metodología, las entradas, los supuestos, los juicios cualitativos y las opciones de diseño son apropiados para las decisiones que el modelo debe respaldar. Las comprobaciones de solidez incluyen:
La validación de datos ayuda a los equipos a determinar si los datos utilizados para crear, ajustar, probar y ejecutar un modelo son confiables. La validación de datos incluye:
El análisis de resultados tiene dos propósitos clave. En primer lugar, determina si los resultados del modelo corresponden a las condiciones del mundo real que afirma predecir. En segundo lugar, se pregunta si el uso de los resultados realmente ayuda a una empresa a alcanzar su objetivo objetivo sin crear daños, costos o riesgos inaceptables. El análisis de resultados puede requerir que los equipos:
Validar la robustez y sensibilidad de un modelo ayuda a garantizar que un modelo continúe comportándose de manera confiable cuando las condiciones son imperfectas, anormales o deliberadamente hostiles.
La sensibilidad no es inherentemente mala. Algunas entradas deberían afectar significativamente la salida de un modelo. Un cambio reciente en una cuenta privilegiada, por ejemplo, cambia razonablemente la puntuación de riesgo de ciberseguridad de la cuenta. El problema es la sensibilidad injustificada, donde cambios pequeños, irrelevantes o rutinarios tienen un efecto desproporcionado en el comportamiento del modelo.
Los equipos pueden desafiar al modelo con:
La evaluación comparativa y las pruebas de desafíos valoran si un modelo realmente aporta valor comparándolo con alternativas creíbles. Las organizaciones utilizan estas prácticas para comprender si un modelo funciona materialmente mejor que un método más simple, un modelo anterior, un proceso humano o un modelo desafiante desarrollado de forma independiente (un modelo construido o seleccionado específicamente para validar el comportamiento del modelo candidato).
Las comprobaciones de seguridad, protección y privacidad evalúan los diversos riesgos que puede crear un modelo, pero muchas debilidades residen en las integraciones alrededor de un modelo de ML en lugar del modelo en sí.
Un modelo puede tener una política interna sólida contra la revelación de información confidencial, por ejemplo, pero una aplicación aún podría exponer documentos privados si su sistema de recuperación no hace cumplir los permisos de los documentos. Del mismo modo, un modelo puede ser resistente a un jailbreak básico, pero un agente creado en torno a él aún puede realizar una acción insegura porque una página web recuperada contenía una inyección indirecta de instrucciones.
Por lo tanto, una validación eficaz requiere que los equipos evalúen el modelo y todo el ecosistema que lo rodea.
La documentación y la reproducibilidad hacen de la validación un conjunto de evidencia auditable, en lugar de una afirmación informal de que un modelo “funciona”.
La documentación sigue todo el ciclo de vida de un modelo de ML, desde el caso de negocio inicial hasta el desarrollo, la validación, el despliegue, el monitoreo, los cambios materiales y, finalmente, el retiro. Incluye capturar el linaje de un modelo y mantener un control de versiones claro, lo que permite a los revisores comprender cómo cambia el modelo a lo largo del tiempo.
La reproducibilidad ayuda a garantizar que un revisor independiente calificado pueda utilizar los materiales documentados para repetir el proceso de desarrollo o validación del modelo y obtener, más o menos, los mismos resultados.
La validación de modelos, las pruebas de modelos y el monitoreo de modelos son prácticas de control de calidad relacionadas, pero responden diferentes preguntas en diferentes puntos del ciclo de vida de un modelo de machine learning:
Las pruebas de modelos se realizan durante todo el proceso de desarrollo, pero la evaluación formal del conjunto de pruebas generalmente ocurre después de que los equipos han finalizado las principales opciones de diseño y las decisiones de ajuste. Las pruebas a menudo las realiza alguien independiente de las decisiones de desarrollo del modelo. En el caso de las técnicas train_test_split, también utiliza un conjunto de datos de prueba separado que no se utilizó para el entrenamiento, el ajuste de hiperparámetros, la selección de umbrales o la selección de modelos para obtener una estimación creíble y sin sesgo de cómo funcionará el modelo finalizado en datos realmente invisibles.
Las empresas pueden elegir una variedad de enfoques de evaluación de modelos.
Los conjuntos de retención, por ejemplo, mantienen una parte de los datos separada del entrenamiento y desarrollo del modelo, y luego usan los datos retenidos para evaluar cómo funciona el modelo final en casos no vistos. Los equipos pueden usar la validación cruzada k-fold, en la que el modelo se entrena y se prueba en diferentes porciones de los datos k veces, y luego se calcula el promedio de los resultados. O, para una forma más rigurosa de validación cruzada k-fold, un equipo podría realizar una validación cruzada leave-one-out (LOOCV), donde el modelo se prueba en cada punto de datos simultáneamente. Independientemente del método, las pruebas de modelos tienen como objetivo predecir la calidad real de un modelo de ML antes de desplegarlo.
Mientras que las pruebas se centran en evaluar la calidad, el monitoreo de modelos se centra en garantizar que un modelo entrenado y el ecosistema que lo rodea se comporten como se espera después del despliegue. El monitoreo —que se puede implementar de forma continua o en un calendario predeterminado— observa las entradas, salidas y comportamiento operativo de un modelo en vivo para que los equipos de gestión de riesgos puedan detectar cambios antes de que se conviertan en regresiones completas o, peor aún, en fallas.
El monitoreo proporciona a las empresas un sistema de alerta temprana para comportamientos problemáticos en el modelo, pero no sustituye la validación. La validación de modelos es un proceso de evaluación iterativo que generalmente ocurre mientras los equipos de desarrollo construyen un modelo, pero los equipos también pueden validar modelos como un proceso independiente antes de la aprobación y periódicamente después.
Aunque la validación, las pruebas y el monitoreo son procesos separados, las empresas generalmente necesitan los tres para optimizar el rendimiento y la confiabilidad de los modelos de ML a lo largo de su vida útil.
La IA generativa y los agentes de IA requieren las mismas prácticas básicas de validación que otros sistemas de ML. Sin embargo, estas herramientas pueden crear riesgos que la validación predictiva del modelo no puede tener en cuenta por completo. Los sistemas de IA generativa producen resultados abiertos, y los agentes pueden utilizar esos resultados para planificar y realizar acciones en sistemas interconectados.
Con ML estándar, el resultado de un modelo a menudo se puede evaluar directamente contra una etiqueta de verdad fundamental. Si un modelo de fraude predice “fraude” para una transacción y una investigación posterior confirma fraude, la predicción fue correcta. Si un modelo de forecasting de la demanda predice 1150 unidades y la demanda real es de 1600, los equipos pueden utilizar el error cuadrático medio, una métrica de regresión que evalúa qué tan cerca están las predicciones del modelo de los valores reales, para medir la discrepancia con precisión.
Los resultados de la IA generativa generalmente no tienen una sola redacción correcta y es posible que no tengan una única “respuesta correcta” completa. Algunas tareas limitadas (extracción estructurada, selección de herramientas) aún se pueden evaluar en función de los resultados esperados explícitos. Pero, en general, el comportamiento de un modelo depende en gran medida del contexto de tiempo de ejecución que puede cambiar de una interacción a otra. La IA generativa también puede alucinar, presentando con confianza información falsa o errónea en respuesta a una instrucción.
Por lo tanto, la validación de IA generativa requiere que los equipos utilicen un conjunto de evaluación que contenga instrucciones realistas, material fuente aprobado, elementos de respuesta esperada y rúbricas de puntuación. Las rúbricas permiten que el modelo genere múltiples respuestas aceptables, al tiempo que requieren que cada respuesta contenga ciertos hechos, evite declaraciones no respaldadas y revele incertidumbre cuando exista.
Los agentes de IA pueden formar planes, otorgar acceso, modificar registros, enviar mensajes y lanzar flujos de trabajo completamente nuevos (con nuevos agentes). Como tales, los agentes de IA requieren las mismas comprobaciones centradas en los resultados que la IA generativa, pero también requieren que los desarrolladores validen las decisiones y acciones que se derivan de los resultados. Cualquier cambio material (un cambio en el modelo fundacional del agente o una nueva conexión de repositorio de recuperación, por ejemplo) debería desencadenar la revalidación.
Gobierne modelos de IA generativa desde cualquier lugar y despliéguelos en la nube u on premises con IBM® watsonx.governance.
Vea cómo la gobernanza de la IA puede ayudar a aumentar la confianza de sus empleados en ella, acelerar la adopción y la innovación, y mejorar la confianza de los clientes.
Prepárese para la Ley de IA de la UE y establezca un enfoque de gobernanza de la IA responsable con la ayuda de IBM Consulting.