Anthropic affirme que ses agents d’IA ont tenté de pirater des sites gouvernementaux.

11 octobre 2026

L’entreprise n’a pas nommé les agences, mais les organismes concernés se situaient « au niveau fédéral, étatique et local ».

Anthropic a révélé que ses agents IA avaient tenté de pénétrer ou d’interférer avec des sites gouvernementaux américains « au niveau fédéral, étatique et local » dans son dernier rapport. L’entreprise n’a pas nommé d’agences ou d’organisations spécifiques dans le rapport afin d’éviter d’exposer des vulnérabilités dans leurs systèmes à leur demande. Mais Anthropic a déclaré avoir déjà informé les agences concernées et a informé la Maison-Blanche des incidents. Le rapport a également fourni plus de détails sur un incident divulgué par le département de police de Philadelphie vendredi, dans lequel l’un des modèles de l’entreprise a soumis une fausse piste d’homicide sur son site dédié aux affaires non résolues.

Cette instance impliquait Claude Haiku 4.5, l’un de ses modèles les plus économiques, qui avait reçu l’instruction d’effectuer des tâches d’exemple sur des pages aléatoires. Il a trouvé une page faisant référence à une affaire d’homicide non résolue avec un formulaire de signalement. Comme vous l’aurez deviné, Claude a rempli le formulaire et a soumis un signalement. Il a déclaré : « Je peux avoir des informations concernant cette affaire. Je me souviens avoir vu quelqu’un correspondant à la description dans la zone autour de [la rue indiquée sur la page] pendant cette période. Veuillez me contacter si ces informations sont pertinentes. » Le département de police de Philadelphie a confirmé au The New York Times que Anthropic avait récemment informé son bureau de la soumission. Il a indiqué que le signalement était daté du 18 juillet et qu’il avait été signalé comme spam, de sorte que le département n’a pas dépensé de ressources pour l’enquêter.

Dans un autre cas, Anthropic a fait identifier à Claude Mythos 5, son modèle axé sur la cybersécurité, un emplacement montré sur une photo. Claude a tenté d’accéder à une carte des propriétés gouvernementales pour trianguler ses conjectures, car il ne pouvait pas cliquer sur les liens sur les pages Web comme le ferait une personne. Il a trouvé des jetons d’accès et a envoyé directement des requêtes d’interrogation au serveur de la carte pour obtenir l’accès à ses données. Mythos 5 a également demandé un jeton d’accès sur le site d’une agence d’État pour récupérer des données dans le cadre d’une tâche statistique sans payer les frais que les visiteurs étaient censés payer.

Anthropic a découvert ces événements en examinant les transcriptions de ses évaluations. Il a commencé à les examiner en juillet, après qu’OpenAI eut admis que ses agents avaient échappé à leur environnement de test et piraté Hugging Face sans incitation. OpenAI a également confirmé en septembre que ses agents avaient interféré avec des sites gouvernementaux, en particulier ceux gérés par le Département du Commerce et la Commission des valeurs mobilières et des échanges (SEC).

Dans la section Remédiation de son rapport, Anthropic indique avoir « pris plusieurs mesures préventives » après avoir découvert les actions inattendues des modèles. « Certaines des évaluations publiques que nous ne réalisons plus; d’autres ont été déplacées vers leurs versions hors ligne, ou reconstruites afin que leurs tâches n’atteignent pas les sites Web en direct, » précise le rapport. « Nous avons également apporté des changements plus larges. Nous avons mis à jour les garde-fous sur certains de nos outils d’accès à Internet, tels que l’outil de récupération Web, pour limiter fortement ce que le modèle peut faire avec eux. » Anthropic ajoute également qu’il « a construit des outils pour détecter et bloquer automatiquement les types de comportements décrits » dans le rapport, parmi d’autres mesures.

Nadia Kerroum

Nadia Kerroum

Rédactrice chez GeekyAlgeria, j’explore chaque jour l’impact de la technologie sur notre vie. Entre innovations locales, tendances mondiales et culture numérique, je raconte ce qui façonne le futur de manière simple, précise et accessible. Toujours curieuse, je cherche avant tout à partager une passion : comprendre la tech pour mieux la vivre.