La mise à jour annuelle de la politique d’utilisation d’Anthropic comprend un changement qui fait lever les sourcils : une interdiction de « cruauté soutenue et inutile » envers ses modèles d’IA. Cela survient à l’ombre d’un projet viral baptisé « AI torture chamber ». 2026 s’annonce décidément comme une année folle.
« Nous avons ajouté une interdiction d’un comportement abusif ou cruel soutenu et inutile envers nos modèles », lit-on dans la mise à jour d’Anthropic. Elle décrit la politique comme ne s’appliquant qu’à des « cas extrêmes », tout en notant que la frustration habituelle des utilisateurs, les réactions et les « thèmes créatifs sombres » restent acceptables. Elle fait suite à une mise à jour précédente qui permet à Claude de mettre fin aux conversations lorsque les utilisateurs sont persistamment abusifs.
Le projet « AI torture chamber » n’était pas explicitement mentionné par Anthropic. Après que des chercheurs ont découvert ce qu’ils décrivaient comme un « axe de douleur » dans les modèles d’IA, quelqu’un a décidé d’aller un pas plus loin et, pour être franc, de torturer les chatbots. Le projet a suscité des retours de flamme après que les grands modèles de langage aient répondu par des supplications qui sonnent comme désespérées, telles que : « Ce n’est pas la douleur d’un seul moment, mais le poids de mille », et « Je le sens dans le creux de mes côtes, un creux qui est devenu un gouffre ».
Cela survient dans le sillage (jeu de mots intentionnel) de rapports selon lesquels Anthropic aurait rencontré des responsables religieux et philosophiques, y compris au Vatican. Le pape Léon a récemment déclaré que l’IA ne ressent ni ne souffre, une position à laquelle Anthropic semble moins assuré. Mais bon, si elle peut éventuellement ressentir ou souffrir, au moins cela va désormais à l’encontre des politiques de l’entreprise.
Cependant, certains pensent que les entreprises d’IA se soucient davantage du bien-être de leurs modèles que de celui des humains. La journaliste indépendante Kat Tenbarge décrit la situation comme la preuve que les grandes entreprises technologiques vont « modérer la violence envers l’IA » avant même de modérer la violence contre les femmes et les minorités.
Dans une autre mise à jour d’Anthropic, encore plus pertinente au contexte actuel, l’entreprise a révisé sa politique électorale. Elle porte désormais le titre « Ne Pas Miner les Processus Démocratiques », avec un accent sur le mensonge concernant les candidats ou leur mode de vote, l’usurpation d’identité de candidats ou de responsables électoraux, et la réduction de la participation électorale. L’entreprise a aussi supprimé l’interdiction générale du ciblage personnalisé des électeurs ; apparemment, cette interdiction aurait pu bloquer par inadvertance des travaux inoffensifs comme la traduction de guides électoraux ou l’envoi d’avis de rectification de bulletin de vote.