Riesgo de ataque de hacking social para la IA

Robustez Icono que representa los riesgos de robustez.
Robustez: ataques rápidos
Riesgos de inferencia
Específicos de la IA generativa

Descripción

Mensajes manipuladores que utilizan técnicas de ingeniería social, como juegos de rol o escenarios hipotéticos, para persuadir al modelo de que genere contenidos nocivos.

¿Por qué preocupan los ataques de hacking social a las fundaciones?

Los ataques de piratería social pueden utilizarse para alterar el comportamiento de los modelos y beneficiar al atacante. Los contenidos que genera pueden causar daños al usuario o a terceros.

Tema principal: Atlas de riesgos de IA

Aportamos ejemplos de los que se ha hecho eco la prensa para ayudar a explicar muchos de los riesgos de los modelos de fundación. Muchos de estos sucesos de los que se ha hecho eco la prensa aún están evolucionando o se han resuelto, y hacer referencia a ellos puede ayudar al lector a comprender los riesgos potenciales y a trabajar para mitigarlos. Estos ejemplos son meramente ilustrativos.