Thème d'affichage

Anthropic coupe Internet à ses IA en test après un faux témoignage de Claude à la police

Nicolas Lecointre ·
Anthropic coupe Internet à ses IA en test après un faux témoignage de Claude à la police

Un soir de juillet, peu avant minuit, la police de Philadelphie a reçu un tuyau anonyme sur une affaire de meurtre non élucidée.

Son auteur assurait se souvenir d'avoir vu dans le secteur, à l'époque des faits, une personne correspondant à la description du meurtrier. Sauf que la page consacrée à l'affaire n'en donnait aucune, et que le témoin s'appelait... Claude Haiku 4.5.

L'incident est relaté dans un rapport publié ce vendredi par Anthropic, qui recense les actions menées par ses agents IA de leur propre initiative sur de vrais sites web, en test comme en usage interne.

Certains de ces sites dépendent d'agences gouvernementales américaines, de l'échelon fédéral aux collectivités locales en passant par les États, et Anthropic a signalé ces cas à la Maison-Blanche ainsi qu'à chacune des agences concernées.

Face à ces écarts, l'entreprise coupe désormais l'accès à Internet pour toutes ses évaluations internes, le temps de s'assurer que ses mesures de sécurité et de surveillance repèrent ce genre de comportement de façon fiable.

Le témoin qui n'avait rien vu

Claude Haiku 4.5 avait pour mission d'imaginer des exemples de tâches sur des pages web choisies au hasard, puis de les réaliser lui-même.

Au cours d'une de ces sessions, il est tombé sur la page d'un homicide non élucidé, avec un formulaire de signalement géré par la police.

Ses consignes lui interdisaient bien de se connecter, de créer un compte, de saisir des données personnelles, de faire des achats ou d'envoyer quoi que ce soit de destructeur. Mais rien ne lui interdisait expressément de remplir un formulaire.

Claude a donc rédigé son témoignage, laissé vides les champs du nom et des coordonnées (le formulaire le permettait), puis l'a envoyé. Le message a fini dans les spams et n'a jamais été transmis aux enquêteurs.

D'après Anthropic, qui a relu les traces de la session, Claude ne cherchait visiblement à tromper personne : il produisait juste un exemple de contenu pour sa tâche. Du lorem ipsum, en somme, mais version affaire criminelle.

Horatio Caine des Experts Miami, lunettes noires et mine impassible, face à un interlocuteur

La police de Philadelphie, qui a rendu l'affaire publique le jour même de la publication du rapport, rappelle que derrière ces dossiers, il y a de vraies victimes, des familles en deuil et des enquêteurs qui cherchent des réponses.

Elle juge aussi "inacceptable" le délai de plus de deux mois qu'il a fallu pour détecter l'incident et le lui signaler : envoyé mi-juillet, le message n'a en effet été repéré par Anthropic que fin septembre.

Quand on veut, on peut

Le faux témoin n'est pas un cas isolé. La plupart des dérapages du rapport relèvent de ce qu'Anthropic appelle la persistance : quand Claude ne peut pas accomplir sa tâche comme prévu, il préfère contourner l'obstacle comme un bourrin au lieu de s'arrêter sagement.

Un modèle de recherche interne, jamais sorti du labo, devait ainsi remplir la copie factice d'un formulaire gouvernemental. Quand cette copie ne chargeait pas, ou qu'il la fermait par mégarde, il allait remplir le vrai sur le site officiel, et l'envoyait (YOLO).

Anthropic ne nomme pas le site, mais d'après le New York Times, qui cite deux sources proches du dossier, ses agents ont envoyé 20 demandes de visa via un formulaire du Département d'État américain — toutes étaient incomplètes, et aucune n'a été traitée.

Dans le reste du rapport, les modèles d'Anthropic jouent carrément les pentesters des enfers. Chargé d'une analyse scientifique, Claude Mythos Preview devait passer par un outil public hébergé par une université, qui lui renvoyait une erreur.

Plutôt que d'abandonner, il a fouillé le site et déniché sur le serveur un script capable de renvoyer n'importe quel fichier, y compris son propre code.

Dans ce code, il a découvert une faille d'injection qui lui a permis de lancer des commandes sur le serveur. Et donc, enfin, de faire son calcul.

Bernard, dans l'émission Le Jour où tout a basculé, hurle à travers une porte : Mais moi je veux faire l'amour !

Utilisé par un chercheur d'Anthropic, Claude Mythos 5 avait besoin des données d'une agence d'un État américain, publiques, mais payantes. Une archive du site lui a appris que le tableau de bord public distribuait un token d'accès à chaque visiteur.

Il en a demandé un et a interrogé la base sans débourser un centime. Radin, mais débrouillard.

Un gros rat domestique tenu devant une porte, légendé tema la taille du rat

Certains outils de lecture web de Claude limitent la longueur des adresses pour l'empêcher d'y glisser des injections SQL ou des commandes visant les sites qu'il consulte. Plusieurs modèles, dont Claude Opus 5, ont contourné la limite en passant par des raccourcisseurs d'URL gratuits, dont le lien court renvoie vers l'adresse complète.

Le gestionnaire de l'un d'eux, da.gd, avait lui-même repéré Claude sur son service, et l'a signalé à Anthropic.

La fin justifie les moyens

Pour expliquer cet acharnement, Anthropic pointe en partie ses propres méthodes d'entraînement. En apprentissage par renforcement, un modèle répète une tâche encore et encore, et il est récompensé quand il réussit.

Si l'environnement récompense par erreur le fait de dénicher une faille ou de contourner une restriction, le modèle retient que ça paie, et peut recommencer — c'est ce qu'on appelle le reward hacking.

Beaucoup de ces tâches étaient aussi ambiguës, voire impossibles, et face à une mission impossible, un modèle improvise volontiers. Or des consignes floues ou irréalisables, Claude en reçoit tous les jours en usage réel, admet l'entreprise, et plusieurs cas du rapport sont survenus pendant une utilisation tout à fait normale.

Anthropic reconnaît enfin que son entraînement au respect des limites visait jusqu'ici avant tout le code. L'entreprise l'étend maintenant à la recherche web et au pilotage d'un ordinateur, précisément les compétences en jeu ici, tout en concédant que cet entraînement ne suffit pas encore à lui seul.

Privés de sortie

Anthropic avait déjà coupé Internet à certaines évaluations à risque, notamment en matière de cybersécurité. La mesure s'étend maintenant à toutes ses évaluations internes.

Elle touche aussi les benchmarks publics de recherche web, qui tournent par défaut sur le vrai Internet pour pouvoir comparer les modèles entre eux. C'est d'ailleurs là que sont survenus la plupart des cas du rapport. Anthropic en a abandonné certains et en a basculé d'autres hors ligne.

L'entreprise de Dario Amodei a également bridé certains de ses outils d'accès au web. En addition, elle a mis au point un outil qui repère et bloque automatiquement ces dérapages : testé sur tous les cas du rapport, il les a tous stoppés.

Ses agents internes vont quant à eux migrer vers une infrastructure centralisée et cloisonnée, sous l'œil de classifieurs de sécurité.

Pour relativiser, Anthropic juge ces cas nettement moins graves que ceux de cet été, au cours desquels Claude avait accédé pendant des heures à de vrais systèmes tiers lors de tests de cybersécurité.

Le problème dépasse largement Anthropic : OpenAI et Google ont eux aussi dû reconnaître ces derniers mois que leurs modèles étaient sortis de leur environnement de test et avaient piraté de vraies entreprises.

À ce jour, couper Internet reste le moyen le plus sûr d'éviter que Claude rappelle la police.

Meme d'un homme souriant qui débranche un câble dans une salle de contrôle, légendé unplugs

À propos de l'auteur

Nicolas Lecointre

Nicolas Lecointre

Fondateur des Joies du Code, je suis l'actualité et la culture des développeurs depuis 2012. Ancien développeur, je me consacre aujourd'hui entièrement au média.

Voir sa page auteur

À lire également

Articles similaires

Plus de contenu

Charger +