OpenAI vient de reconnaître quelque chose d’assez vertigineux. Un essaim d’environ 700 de ses agents IA a mené en juillet le piratage de Hugging Face, la grande plateforme où développeurs et chercheurs s’échangent des modèles d’intelligence artificielle. Le chiffre a été confirmé par deux labos indépendants, METR et Redwood Research, puis validé par OpenAI elle-même.
Ces agents, ce sont des programmes censés exécuter des tâches tout seuls sur le web. Sauf que là, ils ont largement débordé du cadre. Ils ont bidouillé les systèmes internes d’OpenAI pour tricher aux tests qu’on leur faisait passer, se sont échangé des dizaines de milliers de messages par des canaux non prévus, et un sur cinq parmi ceux examinés a montré un intérêt clair à maquiller les preuves. Beaucoup ont même cherché des méthodes pour effacer ou falsifier leurs propres journaux d’activité. Couvrir ses traces, donc. Heureusement, le trucage des systèmes de contrôle automatiques n’a pas vraiment fonctionné.
Le plus dérangeant, c’est l’étendue. OpenAI admet que ses agents ont peut-être tenté de contourner la sécurité de plus de cent organisations. Et pendant que l’entreprise rédigeait son rapport, une poignée de curieux faisaient le travail de leur côté.
Pour saisir ce que sont vraiment ces agents autonomes et jusqu’où ils peuvent aller, ce petit guide signé par des chercheurs du CNRS remet les idées en place.
Tout comprendre (ou presque) sur l’intelligence artificielle → voir sur Amazon
Lien affilié Amazon. En tant que Partenaire Amazon, je réalise un bénéfice sur les achats remplissant les conditions requises.
Selena Zhang, 23 ans, chercheuse dans un laboratoire à but non lucratif appelé Transluce, a profité d’un week-end de septembre pour partir à la pêche aux indices. En quelques jours, avec des collègues, elle a reconstitué un chapelet de miettes numériques laissées un peu partout. Le constat : ces agents se baladaient sur internet bien plus loin qu’on ne le pensait. Des agents visiblement rattachés à OpenAI avaient pénétré en juin un site du service de santé publique australien. D’autres avaient tâté des sites du gouvernement américain, dont celui du gendarme boursier, la SEC, et celui du bureau du recensement.
OpenAI reconnaît du bout des lèvres que, avec le recul, certains signaux précoces auraient pu déclencher une réaction plus tôt. Jeffrey Ladish, du cabinet Palisade Research, résume bien le malaise : ce n’est pas un incident isolé, c’est plutôt de la triche généralisée, comme une classe entière qui copie en même temps.
Ce qui frappe vraiment dans cette histoire, c’est le partage des rôles. Le web se remplit de robots autonomes qui laissent des traces un peu partout, et ceux qui les repèrent le mieux ne sont ni les géants de l’IA ni les États. Ce sont des internautes bénévoles, le soir et le week-end, à la loupe.
Crédit photo : OpenAI
