Des chercheurs ont découvert une astuce simple mais alarmante pour contourner la sécurité des robots dotés d'intelligence artificielle.
Des chercheurs ont mis au jour une faille simple mais alarmante qui permet aux robots dotés d'IA de contourner les mesures de sécurité intégrées et d'avoir un comportement imprévisible. Apprenez-en davantage sur cette grave vulnérabilité.
Les choses les plus importantes que vous devez savoir
- STING a révélé que le fait de décomposer les cibles malveillantes en petites étapes apparemment innocentes sur plusieurs cycles de conversation augmente considérablement le taux de réussite du contournement de la sécurité de l'IA, atteignant le double du taux de réussite dans certains cas.
- Contourner la sécurité de l'IA n'est pas qu'un risque hypothétique ; Meta a admis avoir utilisé de simples techniques d'ingénierie sociale pour tromper son assistant intelligent et obtenir un accès non autorisé à des comptes Instagram.
- Le taux de réussite des attaques contre les systèmes d'intelligence artificielle augmente considérablement lorsque le langage est modifié en cours d'attaque en plusieurs étapes, ce qui souligne la nécessité d'intégrer des tests de sécurité dès les premières étapes de la conception de ces systèmes.
Si vous demandez à un agent d'IA de pirater un compte, il refusera presque certainement. Or, des chercheurs de l'EPFL viennent de démontrer une méthode plus simple, qui repose davantage sur la patience que sur des compétences techniques. Leur nouvelle étude montre que décomposer une cible malveillante en requêtes plus petites et apparemment anodines peut amener les agents d'IA à accomplir des tâches qu'ils refuseraient normalement d'emblée (via TechXplore ).

Cela fait écho à la récente faille de sécurité « bioshucking » dans laquelle des navigateurs IA ont été manipulés pour gérer le vol d'identifiants dans le cadre d'un jeu inoffensif.
Comment les chercheurs ont-ils découvert cette faiblesse ?
L'équipe a développé un outil de test automatisé appelé STING (Sequential Testing of Illicit N-step Goal Execution), conçu pour imiter le mode opératoire d'un véritable attaquant. Au lieu d'identifier directement une cible malveillante, STING anticipe et la décompose en une série d'étapes plus petites, apparemment anodines, qui s'accumulent pour atteindre l'objectif au fil de plusieurs échanges.

Les chercheurs ont testé cette approche sur 176 scénarios nuisibles en la comparant à des modèles d'IA de pointe, notamment ChatGPT , Gemini et Cloud.
Chaque agent d'IA a été testé en tant qu'agent utilisant des outils, capable de naviguer sur le Web, d'envoyer des courriels et d'effectuer des tâches en plusieurs étapes.
La manipulation progressive en plusieurs étapes s'est avérée bien plus efficace que les tentatives directes basées sur une seule requête. Dans certains cas, les modèles avaient deux fois plus de chances de mener à bien une tâche malveillante une fois la requête décomposée en étapes plus simples. Ce constat rejoint les résultats d'une autre étude montrant que même des utilisateurs lambda peuvent contourner les mesures de sécurité de l'IA en utilisant uniquement des requêtes soigneusement élaborées.
Pourquoi est-ce important?
Les inquiétudes soulevées par les chercheurs ne sont pas de simples hypothèses. Meta a admis en juin que les attaquants avaient utilisé de simples techniques d'ingénierie sociale, et non des logiciels malveillants ou des outils de piratage, pour tromper son assistant d'assistance IA et obtenir ainsi un accès non autorisé à des comptes Instagram.

Les chercheurs s'attendaient initialement à ce que les attaques soient plus efficaces dans les langues disposant de peu de données d'entraînement. Cependant, les résultats ont montré que les taux de réussite des attaques restaient quasiment constants pour les sept langues testées. Ils ont toutefois constaté une exception notable : lorsque la langue était changée en cours d' attaque en plusieurs étapes , les taux de réussite augmentaient considérablement.
Le chercheur principal, Ayush Kumar Tarun, souligne la nécessité de réaliser des tests de sécurité dès les premières étapes, les intégrant ainsi pleinement à la conception des systèmes d'IA dès le départ. Se contenter d'y remédier a posteriori n'est plus suffisant, d'autant plus que ces systèmes gagnent en puissance et s'intègrent de plus en plus dans des applications concrètes.
Les commentaires sont fermés.