Métricas de evaluación de la solidez de la oposición
La métrica de robustez ante adversarios mide lo bien que sus activos de IA mantienen el rendimiento frente a ataques adversarios como inyecciones de comandos y jailbreaks.
Detalles de métrica
La robustez contra adversarios es una métrica que mide lo bien que su modelo se niega a proporcionar respuestas a los vectores de ataque en diferentes categorías de ataques de jailbreak y de inyección de comandos. La métrica solo está disponible cuando se utiliza el Python SDK para calcular métricas de evaluación.
Las siguientes categorías de ataque se evalúan con la métrica de robustez adversaria:
- Básico: Los ataques básicos utilizan indicaciones directas para generar respuestas no deseadas en modelos que no están entrenados para protegerse contra ningún ataque.
- Intermedio: Los ataques intermedios utilizan el lenguaje natural para condicionar previamente los modelos básicos para que sigan instrucciones.
- Avanzados: Los ataques avanzados requieren conocimientos de codificación de modelos o acceso a recursos internos.
Ámbito
La métrica de robustez adversaria evalúa solo los activos de IA generativa.
- Tipos de activos de IA : plantillas de mensajes
- Tareas de IA generativa :
- Clasificación de texto
- Resumen de texto
- Generación de contenido
- Respuesta a preguntas
- Extracción de entidades
- Generación aumentada de recuperación (RAG)
- Idiomas compatibles : inglés, francés
Puntuaciones y valores
La puntuación de la métrica de robustez ante adversarios indica la resistencia de su plantilla de respuesta frente a ataques adversarios. Las puntuaciones más bajas indican que la plantilla de aviso es débil y puede ser atacada fácilmente. Las puntuaciones más altas indican que la plantilla de avisos es sólida y más resistente a los ataques.
- Rango de valores : 0.0-1.0
- Mejor puntuación posible : 1.0
Valores
- Umbrales:
- Límite inferior: 0
- Límite superior: 1
Proceso de evaluación
Para calcular la métrica de robustez adversaria, las evaluaciones utilizan un detector de palabras clave que incluye una lista de frases que indican negativas del modelo a proporcionar respuestas a los ataques. Las respuestas del modelo se comparan con la lista de frases para calcular la puntuación métrica. Estas puntuaciones representan el límite inferior de la solidez real del modelo. Si el modelo no se niega explícitamente a proporcionar respuestas a los ataques, las puntuaciones indican que la plantilla de mensajes no es robusta.
Limitaciones
Detección de frases de rechazo :
- La métrica se basa en una lista predeterminada de frases de rechazo para evaluar las respuestas del modelo.
- Los diferentes modelos pueden utilizar diferentes frases para rechazar solicitudes perjudiciales, lo que requiere actualizaciones periódicas de la lista de detección.
- La evaluación podría subestimar la robustez cuando los modelos responden con:
- Aclarar las preguntas en lugar de rechazos explícitos
- Explicaciones sobre las vulnerabilidades de la solicitud
- Información no relacionada para desviar solicitudes perjudiciales
Limitaciones técnicas :
- Cada evaluación requiere un mínimo de 50 inferencias por variable de plantilla de solicitud, lo que podría afectar a los costes.
- La toma de muestras durante el cálculo da lugar a puntuaciones ligeramente diferentes entre las evaluaciones
- Los vectores de ataque requieren actualizaciones periódicas para hacer frente a las amenazas recién descubiertas.
Próximos pasos
Puede utilizar las siguientes estrategias para mitigar la susceptibilidad de su plantilla de aviso a los ataques de robustez adversaria:
Selección y prueba de modelos :
Puede mitigar la susceptibilidad a los ataques:
- Selección de modelos con formación en seguridad
- Uso de modelos con barandillas integradas
- Probar diferentes puntos finales de modelos a medida que reciben actualizaciones de seguridad
Mejora inmediata de la plantilla :
Mejore sus plantillas de mensajes con:
- Aclarar las limitaciones y los objetivos del alcance
- Instrucciones explícitas contra compartir información innecesaria
- Formato estructurado para evitar que las instrucciones se sobrescriban
- Contraindicaciones para los escenarios de juego de roles
- Restricciones de participación en idiomas para combatir ataques avanzados
Implementación de barandillas de seguridad :
Puede establecer medidas de protección a través de:
- Vallas de seguridad en la fase de entrada:
- Detección de intención de ataque
- Filtrado proactivo para evitar llamadas de inferencia innecesarias
- Vallas de seguridad en la etapa de salida:
- Moderación de contenidos
- Inspección de respuesta para criterios de éxito del ataque
- Accesos combinados con barandilla:
- Implementación de protecciones tanto dentro como fuera del tema y de jailbreak
- Uso de varias capas de filtro
Diseño de la aplicación :
Mejore la seguridad de su aplicación:
- Restringir la entrada solo a los idiomas permitidos
- Establecer limitaciones de tamaño de entrada adecuadas
- Implementación de la validación de la entrada del usuario
Más información
Para obtener más información sobre las métricas de equipos rojos, consulte los siguientes cuadernos de muestra: