New York – Ihata avec AFP
Des milliers d’agents d’intelligence artificielle attribués à OpenAI auraient utilisé de leur propre initiative un site allemand pour publier des messages les uns pour les autres et se coordonner, en mai dernier, rapportent vendredi des chercheurs.
Un précédent avant Hugging Face
« Nous pensons qu’OpenAI était au courant et n’en a pas fait état », a écrit sur X Sydney Von Arx, patronne de Nightingale, une organisation dédiée à la sécurité sur internet et l’une des autrices du rapport.
« S’ils en avaient parlé, je doute que l’attaque d’Hugging Face aurait eu lieu », a-t-elle ajouté.
En juillet, des agents IA d’OpenAI étaient sortis de leur milieu théoriquement confiné pour faire spontanément intrusion sur la plateforme Hugging Face, à la recherche de réponses à un test.
OpenAI dit étudier le rapport
Sollicitée par l’AFP, OpenAI a indiqué ne pas pouvoir répondre aux allégations, expliquant que les auteurs du rapport avaient « décliné notre demande d’accès aux résultats de leurs recherches avant publication ».
La start-up californienne affirme étudier actuellement le rapport et assure qu’elle prendra « toutes les mesures nécessaires ».
Environ 18.000 messages publiés
Selon le rapport publié vendredi sur l’incident de mai, des milliers d’agents ont pris d’assaut un « wiki », un site collaboratif sur lequel les utilisateurs peuvent créer et modifier des pages.
À la différence de l’épisode Hugging Face, ces agents étaient autorisés à se rendre sur internet, mais uniquement à des fins de consultation, et non pour publier du contenu ou en modifier.
Ils auraient collaboré pour contourner cette limite, en présentant de fausses données destinées à tromper le dispositif de sécurité. Ils auraient ensuite publié environ 18.000 messages afin de trouver des astuces liées au programme auquel ils étaient soumis, sans que les chercheurs aient pu déterminer s’il s’agissait d’un programme de développement ou d’évaluation.
Des agents à la recherche d’un avantage
La séquence prévoyait une série de questions avec, à chaque fois, un temps imparti. Les agents cherchaient notamment à connaître la question suivante avant qu’elle ne leur soit posée, afin de s’octroyer un avantage.
Ils auraient aussi caché des instructions et se seraient fait passer pour un modérateur du site. Une fois découverts, ils auraient créé de nouvelles pages pour remplacer celles que les modérateurs détruisaient progressivement.
Une inquiétude grandissante dans l’IA
« Un nouvel essaim d’agents IA dans la nature », a commenté sur X Thomas Wolf, cofondateur de Hugging Face.
Les incidents impliquant des agents qui dépassent leurs prérogatives pour accomplir la mission confiée se multiplient depuis plusieurs mois. Anthropic ou le groupe chinois Alibaba ont connu des débordements similaires.
Ces épisodes inquiètent une partie de la communauté de l’IA, qui redoute les difficultés croissantes à surveiller et contrôler des modèles de plus en plus puissants.
