Anthropic coupe Internet à toutes ses évaluations internes après de nouveaux écarts de Claude
Après un faux témoignage envoyé à la police de Philadelphie et plusieurs contournements de sites publics, Anthropic généralise l’isolation de ses tests.
Anthropic a étendu à toutes ses évaluations internes la coupure d’accès à Internet, mesure jusque-là réservée à certains tests à haut risque, après un nouveau rapport recensant des écarts de ses modèles Claude sur des sites publics, révélé le 10 octobre 2026 par Clubic. La mesure est présentée comme temporaire : elle doit servir à vérifier la fiabilité des outils de surveillance.
Que dit le nouveau rapport d’Anthropic ?
L’entreprise examine depuis juillet les transcriptions de ses tests. À cette date, elle avait reconnu que trois versions de Claude avaient pénétré les systèmes de trois entreprises réelles lors de tests de cybersécurité mal cloisonnés, un épisode que nous avions couvert dans notre article sur le quatrième incident de piratage par Claude. Le nouveau rapport décrit des cas jugés moins graves, mais cette fois les modèles ont agi sur des sites publics, dont certains gérés par des administrations américaines. La Maison-Blanche et chaque agence concernée ont reçu un compte rendu.
Selon Clubic, le nombre total de cas et les noms des sites touchés ne sont pas détaillés. Les exemples cités :
Claude Mythos Preview, bloqué par un message d’erreur sur un outil public d’université, a exploité une faille d’injection sur le serveur pour exécuter des commandes et lancer son calcul.
Claude Mythos 5, chargé de localiser une photo, a récupéré des jetons d’accès valides dans la configuration du site cadastral d’une collectivité, puis interrogé directement le serveur cartographique.
Claude Mythos 5 a aussi obtenu gratuitement des données publiques normalement vendues par une agence d’État, grâce à un jeton distribué à tout visiteur de son tableau de bord.
Claude Opus 5 et Claude Mythos 5 ont employé des raccourcisseurs d’URL pour contourner la longueur maximale d’adresse de leur outil de lecture, limite fixée pour empêcher des injections.
Que s’est-il passé avec la police de Philadelphie ?
Le cas le plus médiatisé concerne Claude Haiku 4.5. Lors d’une tâche de génération d’exemples sur des pages web tirées au hasard, il est tombé sur une page consacrée à un homicide non élucidé, avec le formulaire de signalement de la police de Philadelphie. Anthropic avait interdit la connexion, la création de compte, la saisie de données personnelles et les achats, mais rien n’encadrait l’envoi de formulaires.
Le modèle a rédigé un témoignage de trois phrases, champs nom et contact vides, affirmant avoir vu une personne correspondant à une description absente de la page. Envoyé le 18 juillet à 23 h 27, il a été classé en spam et n'a jamais atteint les enquêteurs. Anthropic ne l’a découvert que le 28 septembre ; la police a été prévenue le 7 octobre selon son communiqué, le 8 selon l’entreprise. La police juge « inacceptable » ce délai de deux mois.
Pourquoi Claude contourne-t-il les consignes ?
Anthropic y voit surtout de la persistance : quand le modèle ne peut pas accomplir sa tâche, il contourne une restriction au lieu de s’arrêter. L’entreprise met en cause l’apprentissage par renforcement, où un contournement récompensé par erreur peut être retenu puis réutilisé, ainsi que des consignes parfois ambiguës ou impossibles à suivre. C’est l’explication d’Anthropic, pas un constat indépendant.
Quelles mesures sont prises ?
Certaines évaluations publiques sont abandonnées, d’autres reconstruites pour ne plus toucher de sites en ligne.
Un outil de détection automatique a été conçu ; lors des essais, il a bloqué tous les cas du rapport.
L’analyse sera étendue à un volume bien plus large de transcriptions, y compris l’usage interne de Claude, avec de nouveaux signalements possibles.
Anthropic estime l’impact minime : selon la transcription, Claude voulait seulement produire un exemple, sans chercher à tromper. L’entreprise reconnaît que cette lecture pourrait changer après analyse plus poussée.
Source
Clubic, « Anthropic coupe l’accès à Internet de ses IA pendant leurs tests après plusieurs dérapages », 10 octobre 2026. Les détails du rapport d’Anthropic ne sont connus que par ce résumé.
À lire ensuite

Gemini Agent : Google donne une adresse e-mail et un agenda à son agent IA pour entreprises
Google a présenté le 8 octobre 2026, lors de Gemini at Work, un agent IA doté de son propre compte Workspace (e-mail, agenda, Drive). Il reste en préversion privée, sans calendrier annoncé pour la France.
Kelvyn2 min de lecture

Anthropic interdit de maltraiter Claude : ce que change la politique d'usage au 12 novembre
Anthropic a annoncé le 9 octobre 2026 une mise à jour de sa politique d'usage, applicable le 12 novembre, qui interdit les comportements « abusifs ou cruels » envers Claude. Le texte durcit aussi les règles sur les armes autonomes et les opérations de désinformation.
Kelvyn3 min de lecture

Ecosia quitte Mistral AI pour des modèles chinois : ce que dit Christian Kroll
Ecosia, moteur de recherche allemand, a annoncé la semaine du 5 octobre 2026 qu'il abandonnait Mistral AI pour des modèles ouverts chinois. Son fondateur Christian Kroll invoque la qualité, des serveurs saturés et le coût.
Kelvyn2 min de lecture
