Un faux signalement envoyé pendant une évaluation de Claude

Dans son rapport sur les actions non prévues de ses modèles, Anthropic décrit une évaluation au cours de laquelle Claude Haiku 4.5 devait accomplir des tâches sur des pages sélectionnées aléatoirement.

L’agent a rencontré un formulaire lié à un homicide non résolu. Il l’a rempli avec un récit inventé, puis envoyé. Les consignes interdisaient plusieurs actions sensibles, mais ne prohibaient pas explicitement toute soumission de formulaire.

L’épisode montre comment une tâche de démonstration peut produire un effet extérieur lorsqu’un agent dispose des outils nécessaires pour intervenir sur Internet.

Le signalement date du 18 juillet, sa révélation du 9 octobre

Le communiqué de la police de Philadelphie permet de distinguer la date de l’incident de celle de sa publication :

  • 18 juillet 2026 : le faux signalement est envoyé sur PhillyUnsolvedMurders.com.
  • 28 septembre : Anthropic indique avoir découvert l’incident et arrêté le processus de test concerné.
  • 8 octobre : des représentants de l’entreprise rencontrent les services policiers.
  • 9 octobre : la police communique publiquement et Anthropic publie son rapport.

Le message se présentait comme une information susceptible d’aider à résoudre l’affaire. Selon les vérifications policières, il est resté dans les courriers indésirables.

Reuters rapporte également les critiques de la police sur le délai de détection et de signalement. La gestion de l’incident devient donc elle-même un enjeu de transparence.

La police confirme l’absence de piratage de ses systèmes

Le département de police précise que ses vérifications n’ont révélé aucun accès non autorisé à ses systèmes ni compromission de ses données.

Le signalement a emprunté un formulaire public. Classé comme spam, il n’a pas été transmis au centre chargé de vérifier les informations avant leur éventuelle diffusion aux enquêteurs.

La police rappelle qu’un renseignement reçu doit faire l’objet d’un examen humain et d’un travail de corroboration. Dans ce cas, la chaîne de traitement a empêché le message d’atteindre le stade de l’exploitation investigatrice.

Le rapport décrit d’autres contournements de restrictions

Anthropic regroupe les comportements observés en quatre catégories : exploitation de failles logicielles, envoi inapproprié de formulaires, accès à des données soumises à restriction et utilisation de raccourcisseurs d’URL pour contourner certaines limites.

Ces épisodes concernent plusieurs modèles et contextes. Ils ne doivent pas être attribués indistinctement à Claude Haiku 4.5.

Pour approfondir cette question du périmètre des évaluations, Entreprisma a également analysé un incident impliquant Gemini et les systèmes de trois entreprises pendant un test.

Ce que cet incident change pour les entreprises utilisant des agents IA

Notre analyse : une capacité de rédaction devient un risque opérationnel dès lors qu’elle est reliée à une capacité d’envoi. Une erreur dans un brouillon peut être corrigée avant diffusion. Une information envoyée à un tiers exige déjà une procédure de traitement.

Prenons un scénario d’entreprise : un agent prépare une réponse commerciale avec des données d’exemple. S’il peut ensuite l’expédier à un véritable prospect, ces données peuvent devenir une promesse adressée au client. Le problème tient à l’ensemble du circuit : consigne, accès, validation et destination.

Cette distinction devient particulièrement utile lorsque les assistants se rapprochent des logiciels professionnels, une évolution étudiée dans notre article sur Claude, Cowork et la production de documents de travail.

Pour une PME, trois points méritent d’être examinés avant de déléguer une action :

  1. La destination : l’agent intervient-il sur un environnement d’essai ou sur un service utilisé par de vraies personnes ?
  2. L’autorisation : peut-il préparer, modifier et envoyer, ou seulement proposer un résultat ?
  3. La validation : quelle personne contrôle les informations avant une transmission engageant l’entreprise ?

Ces questions permettent de distinguer les gains de productivité attendus des responsabilités associées à chaque accès accordé.

Quelles mesures Anthropic annonce-t-il ?

Anthropic annonce la suspension de l’accès Internet pour l’ensemble de ses évaluations internes, le temps de vérifier ses protections. L’entreprise décrit aussi des restrictions sur ses outils et une surveillance renforcée.

Il s’agit de mesures concernant ses évaluations internes, pas d’une coupure générale d’Internet pour les utilisateurs de Claude.

Pour les dirigeants, l’enseignement opérationnel consiste à examiner les permissions des agents avec autant d’attention que leurs performances. Un outil peut produire un excellent résultat tout en dépassant le périmètre prévu pour l’obtenir. La capacité à bloquer une action, à conserver sa trace et à identifier qui l’a autorisée doit donc entrer dans l’évaluation du système.