Des agents OpenAI ont été hors de contrôle en ligne, et il semble que la Wikimedia Foundation ait été touchée elle aussi. La fondation indique avoir détecté une activité non autorisée provenant d’agents OpenAI sur ses plateformes, y compris des modifications apportées à certaines wikis et des tentatives échouées de compromettre un outil de prise de notes. Elle réitère que des bots ont parcouru les données de ses plateformes massivement, tandis que des agents qui semblent être gérés par OpenAI ont émis des millions de requêtes à ses API publiques.
Une enquête n’a pas révélé de preuve que des agents d’IA utilisaient les systèmes de Wikimedia pour coordonner leur activité (comme il semble qu’ils l’aient fait sur des wikis non exploités par Wikimedia) et la fondation n’a pas non plus détecté de signes d’atteinte à ses données ou à ses systèmes. « Cependant, nous nous préoccupons de ce qui pourrait s’être produit ici, de la difficulté et de l’effort impliqués dans l’enquête et l’attribution de cette activité, et des risques croissants d’une activité d’IA agentielle sur nos plateformes en général », a écrit Selena Deckelmann, directrice produit et technologie de la fondation, dans un article de blog. « Le web ouvert est un bien public. Nous ne devrions pas permettre que ce comportement devienne le « nouveau normal » pour les personnes ou les organisations qui le maintiennent. » Engadget a contacté OpenAI pour commentaire.
Il semble que des agents d’OpenAI aient modifié certains wikis de Wikimedia sans permission. Près de la totalité de ces modifications étaient des éditions de test dans les sections sandbox des wikis et n’étaient pas visibles sur les pages que les utilisateurs consultent généralement. Il y avait aussi « quelques modifications de la configuration d’un outil de citation, que nous pensons être des modifications potentiellement malveillantes destinées à fausser cet outil en tant que proxy pour récupérer des données à partir de services distants », a écrit Deckelmann. Bien que les bots soient autorisés à modifier Wikipédia dans certaines conditions, aucune approbation n’a été sollicitée dans ces cas. (La version anglaise de Wikipédia interdit les articles générés par l’IA.)
De plus, des agents que Wikimedia estime provenir d’OpenAI ont tenté de compromettre un outil de prise de notes appelé Etherpad, mais ces efforts ont échoué. « Des agents ont échoué à l’utiliser pour récupérer des données d’autres sites Web en tant que proxy », a écrit Deckelmann. « D’autres agents, probablement également opérés par OpenAI, ont pris des notes sur leurs tâches, bien que cela ne semble pas avoir donné lieu à une coordination. »
La Fondation Wikimedia avait déjà indiqué que des bots martelaient ses plateformes depuis le début de 2024 pour collecter des données en vue d’entraîner des IA génératives. Elle indique désormais que des agents ont parcouru des millions de pages — principalement à partir de Wikidata et de Wikimedia Commons — et ont effectué « des centaines de milliers de requêtes de données » vers le Wikidata Query Service, ce qui aurait pu contribuer à une panne en mai.
« Les entreprises d’IA ne font pas assez pour sécuriser leurs systèmes et protéger le public contre les dommages qu’elles causent », a soutenu Deckelmann, ajoutant que Wikimedia est « profondément préoccupée » par les effets que des agents d’IA malveillants peuvent avoir sur les plateformes de connaissance ouvertes telles que celles qu’elle exploite.
« Les bots et les agents font partie de l’avenir du web, et les entreprises qui les lancent et en tirent profit doivent directement aider à éviter et à réparer les dégâts qu’ils peuvent causer », a écrit Deckelmann. « Notre priorité collective devrait être la santé de l’écosystème web dans son ensemble afin qu’il continue de bénéficier à toutes les personnes — et pas seulement à une poignée de milliardaires. »
Wikimedia a proposé un jeu de données à des fins d’entraînement de l’IA afin de dissuader les crawlers d’extraire des données de ses plateformes, ce qui augmente ses coûts et peut potentiellement surcharge ses systèmes. La fondation s’est également associée à plusieurs entreprises technologiques pour leur offrir un accès simplifié aux données, mais OpenAI ne figure pas parmi elles.