Des recherches récentes soulignent que les progrès rapides des systèmes d’IA modernes dépassent les pratiques traditionnelles de gestion des risques et de sûreté en matière d’IA. Cette tendance est particulièrement préoccupante pour les systèmes d’IA générative, qui peuvent produire des contenus très réalistes et évolutifs, ce qui les rend vulnérables aux abus, aux fausses informations et aux préjudices automatisés.
Dans un article intitulé « Safety Pretraining: Toward the Next Generation of Safe AI »6, des chercheurs de Carnegie Mellon démontrent que les méthodes d’alignement post-entraînement largement utilisées peuvent être fragiles. En d’autres termes, le modèle semble sûr lors des tests de sûreté de base, mais il peut échouer en cas de légers changements dans son environnement.
De plus, les comportements dangereux appris pendant l’entraînement sont difficiles à éliminer par la suite. L’article soutient que la sûreté doit être intégrée plus tôt dans le processus de développement, en intégrant des protections directement dans les données de pré-entraînement et la conception du modèle plutôt que de se fier uniquement à des corrections par le biais de mises à jour après le lancement.
De même, l’International AI Safety Report 20267, un rapport rédigé par plus de 100 experts en IA, a constaté que les améliorations des capacités de l’IA introduisent des risques complexes et systémiques dans tous les domaines tout en exacerbant les problèmes existants.
Un autre article récent, « ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework toward Safe AI »8, examine les cadres d’évaluation de la sûreté de l’IA.L’article souligne que les critères de référence et les approches de test existants ne parviennent souvent pas à saisir les risques réels et les impacts sociétaux de l’IA de pointe, et ne peuvent pas non plus détecter de manière fiable les comportements dangereux dans des conditions adverses. Les chercheurs appellent à des méthodes d’évaluation plus complètes et dynamiques.
Dans l’ensemble, ces travaux de recherche suggèrent que la sûreté de l’IA doit être traitée comme une préoccupation continue, couvrant l’ensemble de son cycle de vie, plutôt que comme une étape distincte appliquée après le développement du modèle. En conséquence, les approches récentes en matière de gouvernance de l’IA ont souligné l’importance d’intégrer directement des mesures de protection à plusieurs niveaux dans l’écosystème plus large de l’IA. Ces mesures de protection à plusieurs niveaux incluent souvent la collecte de données, l’architecture des modèles et les environnements de déploiement.
Il existe un consensus croissant sur le fait qu’une sécurité efficace de l’IA nécessite une combinaison d’interventions techniques, de contrôles de pré-entraînement et de cadres d’évaluation améliorés. Ces développements indiquent que la sécurité de l’IA n’est plus uniquement un problème relevant de l’informatique, mais un effort pluridisciplinaire exigeant une adaptation continue à mesure que les technologies évoluent.