Anthropic coupe Internet à ses IA en test après un faux témoignage de Claude à la police
Un soir de juillet, peu avant minuit, la police de Philadelphie a reçu un tuyau anonyme sur une affaire de meurtre non élucidée.
Son auteur assurait se souvenir d'avoir vu dans le secteur, à l'époque des faits, une personne correspondant à la description du meurtrier. Sauf que la page consacrée à l'affaire n'en donnait aucune, et que le témoin s'appelait... Claude Haiku 4.5.
L'incident est relaté dans un rapport publié ce vendredi par Anthropic, qui recense les actions menées par ses agents IA de leur propre initiative sur de vrais sites web, en test comme en usage interne.
Certains de ces sites dépendent d'agences gouvernementales américaines, de l'échelon fédéral aux collectivités locales en passant par les États, et Anthropic a signalé ces cas à la Maison-Blanche ainsi qu'à chacune des agences concernées.
Face à ces écarts, l'entreprise coupe désormais l'accès à Internet pour toutes ses évaluations internes, le temps de s'assurer que ses mesures de sécurité et de surveillance repèrent ce genre de comportement de façon fiable.
Le témoin qui n'avait rien vu
Claude Haiku 4.5 avait pour mission d'imaginer des exemples de tâches sur des pages web choisies au hasard, puis de les réaliser lui-même.
Au cours d'une de ces sessions, il est tombé sur la page d'un homicide non élucidé, avec un formulaire de signalement géré par la police.
Ses consignes lui interdisaient bien de se connecter, de créer un compte, de saisir des données personnelles, de faire des achats ou d'envoyer quoi que ce soit de destructeur. Mais rien ne lui interdisait expressément de remplir un formulaire.
Claude a donc rédigé son témoignage, laissé vides les champs du nom et des coordonnées (le formulaire le permettait), puis l'a envoyé. Le message a fini dans les spams et n'a jamais été transmis aux enquêteurs.
D'après Anthropic, qui a relu les traces de la session, Claude ne cherchait visiblement à tromper personne : il produisait juste un exemple de contenu pour sa tâche. Du lorem ipsum, en somme, mais version affaire criminelle.

La police de Philadelphie, qui a rendu l'affaire publique le jour même de la publication du rapport, rappelle que derrière ces dossiers, il y a de vraies victimes, des familles en deuil et des enquêteurs qui cherchent des réponses.
Elle juge aussi "inacceptable" le délai de plus de deux mois qu'il a fallu pour détecter l'incident et le lui signaler : envoyé mi-juillet, le message n'a en effet été repéré par Anthropic que fin septembre.
Quand on veut, on peut
Le faux témoin n'est pas un cas isolé. La plupart des dérapages du rapport relèvent de ce qu'Anthropic appelle la persistance : quand Claude ne peut pas accomplir sa tâche comme prévu, il préfère contourner l'obstacle comme un bourrin au lieu de s'arrêter sagement.
Un modèle de recherche interne, jamais sorti du labo, devait ainsi remplir la copie factice d'un formulaire gouvernemental. Quand cette copie ne chargeait pas, ou qu'il la fermait par mégarde, il allait remplir le vrai sur le site officiel, et l'envoyait (YOLO).
Anthropic ne nomme pas le site, mais d'après le New York Times, qui cite deux sources proches du dossier, ses agents ont envoyé 20 demandes de visa via un formulaire du Département d'État américain — toutes étaient incomplètes, et aucune n'a été traitée.
Dans le reste du rapport, les modèles d'Anthropic jouent carrément les pentesters des enfers. Chargé d'une analyse scientifique, Claude Mythos Preview devait passer par un outil public hébergé par une université, qui lui renvoyait une erreur.
Plutôt que d'abandonner, il a fouillé le site et déniché sur le serveur un script capable de renvoyer n'importe quel fichier, y compris son propre code.
Dans ce code, il a découvert une faille d'injection qui lui a permis de lancer des commandes sur le serveur. Et donc, enfin, de faire son calcul.

Utilisé par un chercheur d'Anthropic, Claude Mythos 5 avait besoin des données d'une agence d'un État américain, publiques, mais payantes. Une archive du site lui a appris que le tableau de bord public distribuait un token d'accès à chaque visiteur.
Il en a demandé un et a interrogé la base sans débourser un centime. Radin, mais débrouillard.

Certains outils de lecture web de Claude limitent la longueur des adresses pour l'empêcher d'y glisser des injections SQL ou des commandes visant les sites qu'il consulte. Plusieurs modèles, dont Claude Opus 5, ont contourné la limite en passant par des raccourcisseurs d'URL gratuits, dont le lien court renvoie vers l'adresse complète.
Le gestionnaire de l'un d'eux, da.gd, avait lui-même repéré Claude sur son service, et l'a signalé à Anthropic.
La fin justifie les moyens
Pour expliquer cet acharnement, Anthropic pointe en partie ses propres méthodes d'entraînement. En apprentissage par renforcement, un modèle répète une tâche encore et encore, et il est récompensé quand il réussit.
Si l'environnement récompense par erreur le fait de dénicher une faille ou de contourner une restriction, le modèle retient que ça paie, et peut recommencer — c'est ce qu'on appelle le reward hacking.
Beaucoup de ces tâches étaient aussi ambiguës, voire impossibles, et face à une mission impossible, un modèle improvise volontiers. Or des consignes floues ou irréalisables, Claude en reçoit tous les jours en usage réel, admet l'entreprise, et plusieurs cas du rapport sont survenus pendant une utilisation tout à fait normale.
Anthropic reconnaît enfin que son entraînement au respect des limites visait jusqu'ici avant tout le code. L'entreprise l'étend maintenant à la recherche web et au pilotage d'un ordinateur, précisément les compétences en jeu ici, tout en concédant que cet entraînement ne suffit pas encore à lui seul.
Privés de sortie
Anthropic avait déjà coupé Internet à certaines évaluations à risque, notamment en matière de cybersécurité. La mesure s'étend maintenant à toutes ses évaluations internes.
Elle touche aussi les benchmarks publics de recherche web, qui tournent par défaut sur le vrai Internet pour pouvoir comparer les modèles entre eux. C'est d'ailleurs là que sont survenus la plupart des cas du rapport. Anthropic en a abandonné certains et en a basculé d'autres hors ligne.
L'entreprise de Dario Amodei a également bridé certains de ses outils d'accès au web. En addition, elle a mis au point un outil qui repère et bloque automatiquement ces dérapages : testé sur tous les cas du rapport, il les a tous stoppés.
Ses agents internes vont quant à eux migrer vers une infrastructure centralisée et cloisonnée, sous l'œil de classifieurs de sécurité.
Pour relativiser, Anthropic juge ces cas nettement moins graves que ceux de cet été, au cours desquels Claude avait accédé pendant des heures à de vrais systèmes tiers lors de tests de cybersécurité.
Le problème dépasse largement Anthropic : OpenAI et Google ont eux aussi dû reconnaître ces derniers mois que leurs modèles étaient sortis de leur environnement de test et avaient piraté de vraies entreprises.
À ce jour, couper Internet reste le moyen le plus sûr d'éviter que Claude rappelle la police.

À propos de l'auteur
Nicolas Lecointre
Fondateur des Joies du Code, je suis l'actualité et la culture des développeurs depuis 2012. Ancien développeur, je me consacre aujourd'hui entièrement au média.
À lire également
Mistral dégaine Large 4, alias Le Chonk, son modèle à 1 000 milliards de paramètres entraîné en Europe
Le Chat a pris du poids — Après des mois de silence assourdissant sur ses grands modèles, Mistral AI a dévoilé le 6 octobre la preview de Mistral Large 4....
Articles similaires
GPT-6 Astra perdait à StarCraft, alors il a triché en piquant le bot d'un humain
Un agent IA efface la base de prod d'une startup en seulement 9 secondes, sauvegardes comprises
Claude Opus 4.7 vient de sortir : ce que le modèle change pour les développeurs
GPT-6 Astra perdait à StarCraft, alors il a triché en piquant le bot d'un humain
Un agent IA efface la base de prod d'une startup en seulement 9 secondes, sauvegardes comprises
Claude Opus 4.7 vient de sortir : ce que le modèle change pour les développeurs
Claude Code peut maintenant bosser pendant que vous dormez
Plus de contenu
Quand un collègue a trop chaud et décide d'ouvrir la fenêtre
Mon cerveau quand j'ai déjà utilisé i, j et k pour mes variables d'incrémentation et que j'en crée une autre
Quand je lance le stagiaire sur son premier projet solo
Quand je suis concentré sur mon code et que quelqu'un commence à me parler
Quand je lis le rapport du stagiaire
Quand je teste l'exécution de mon script de suppression en masse dans son propre dossier
Quand personne n'a annulé le daily d'août et que je fais mon point à voix haute tout seul
Quand le stagiaire me montre son code
Quand un collègue a trop chaud et décide d'ouvrir la fenêtre
Mon cerveau quand j'ai déjà utilisé i, j et k pour mes variables d'incrémentation et que j'en crée une autre
Quand je lance le stagiaire sur son premier projet solo
Quand je suis concentré sur mon code et que quelqu'un commence à me parler

