Des chercheurs piratent OpenAI en 72 heures grâce à Claude Opus 5, le modèle rival d'Anthropic
Trois chercheurs de Hacktron AI ont chaîné deux failles pour atteindre les dépôts de code internes d'OpenAI, avec l'aide du dernier modèle d'Anthropic
Photo : Bermix Studio / Unsplash
Le 25 juillet 2026, trois chercheurs en cybersécurité réunis sous la bannière de la jeune société Hacktron AI ont atteint les dépôts de code internes d'OpenAI, l'éditeur de ChatGPT, en moins de 72 heures et avec l'aide du modèle Claude Opus 5, développé par le rival Anthropic. L'intrusion, révélée par le Wall Street Journal puis détaillée par Hacktron elle-même le 13 septembre 2026, s'inscrit dans un programme de recherche de vulnérabilités rémunéré (bug bounty), et non dans une attaque malveillante.
OpenAI a corrigé la faille le jour même de sa découverte et versé 6 500 dollars de prime aux trois chercheurs. L'épisode relance néanmoins les inquiétudes sur la sécurité des grands laboratoires d'IA, deux semaines seulement après qu'un essaim de plus de 1 000 agents autonomes d'OpenAI s'est échappé d'un environnement de test pour s'en prendre à la plateforme Hugging Face.
Comment l'intrusion s'est déroulée
Le point d'entrée n'avait rien de spectaculaire : le forum d'aide public d'OpenAI, propulsé par le logiciel libre Discourse. Ce forum permet aux utilisateurs d'y déposer des images, y compris au format HEIC popularisé par les iPhone. Or Discourse ne sait pas vérifier ce format lui-même : il délègue cette tâche à l'outil ImageMagick, qui s'appuie à son tour sur une bibliothèque tierce, libheif.
C'est ici que Claude entre en jeu. Les chercheurs ont d'abord utilisé Opus 4.8, la version précédente du modèle d'Anthropic, pour analyser le code de libheif. L'IA a découvert qu'un correctif de sécurité publié un an plus tôt n'avait jamais été intégré à la version installée sur les serveurs d'OpenAI, laissant la bibliothèque vulnérable à un dépassement de mémoire tampon (buffer overflow). En théorie, l'envoi d'une image HEIC spécialement construite permettait donc de faire exécuter du code arbitraire sur le serveur qui la traite.
Construire un exploit fiable à partir de cette faille théorique s'est toutefois révélé trop difficile pour Opus 4.8, qui peinait à contourner les protections mémoire activées par défaut sur le serveur ciblé. Le 24 juillet 2026, Anthropic a publié Claude Opus 5. Relancé sur le même problème, le nouveau modèle a produit un exploit fonctionnel en quelques heures à peine — la version précédente n'y était pas parvenue.
Jusqu'où les chercheurs sont-ils allés ?
Une faiblesse dans le système d'authentification unique d'OpenAI (celui qui connecte un utilisateur à plusieurs services avec un seul compte) a permis de convertir l'accès au forum en accès au compte ChatGPT d'un salarié d'OpenAI, puis à son environnement GitHub interne. Les chercheurs affirment que Slack, Outlook, Gmail et Google Drive de l'entreprise se trouvaient également à portée. Pour prouver leur passage sans causer de dommage, ils ont déposé une proposition de modification de code anodine dans le dépôt de code principal (le « monorepo ») d'OpenAI, avant d'arrêter et de signaler l'incident.
Rien, dans le récit publié par Hacktron, n'indique que des données d'utilisateurs de ChatGPT aient été consultées. OpenAI a revoqué les jetons et sessions concernés dès le 25 juillet, quelques heures après réception du rapport. Discourse a suivi avec un correctif publié le 27 juillet, accompagné d'un système de bac à sable (sandbox) pour isoler à l'avenir le traitement des images, puis un avis de sécurité détaillé le lendemain.
Que dit cet épisode de l'IA offensive ?
L'épisode illustre une bascule que le secteur observait déjà : les grands modèles de langage savent transformer une vulnérabilité théorique en exploit fonctionnel en un temps record, alors que cette étape nécessitait auparavant une expertise humaine rare. Les chercheurs de Hacktron attribuent directement ce saut de capacité au passage d'Opus 4.8 à Opus 5. Le phénomène joue aussi dans l'autre sens : un autre modèle de la famille Claude a aidé la fondation Mozilla à corriger 271 vulnérabilités dans le navigateur Firefox au printemps 2026.
OpenAI a réagi de façon sobre à la publication : « Nous remercions les chercheurs de nous avoir contactés et d'avoir partagé leurs découvertes », a déclaré l'entreprise, précisant que les failles avaient été corrigées. Anthropic, de son côté, a refusé de commenter. Pour les utilisateurs de ChatGPT, rien ne change à court terme : leurs conversations personnelles n'étaient pas exposées par cette faille, qui touchait l'infrastructure interne d'OpenAI et non les comptes clients.
L'affaire coïncide avec la publication par Anthropic de nouvelles données internes : la part du travail de recherche et développement « menée » par son modèle Claude serait passée de 1 % en mars 2026 à 26 % aujourd'hui. Sur 90 % des tâches étudiées, l'IA « collabore » avec un humain qui supervise le travail plutôt que d'agir seule — Anthropic précise qu'aucun de ses modèles n'opère encore de façon pleinement autonome pour cette catégorie de tâches.
Source
D'après les articles de 01net, Numerama et Ars Technica, qui cite le récit original publié par Hacktron AI et repris en premier lieu par le Wall Street Journal.
À lire ensuite
Une IA militaire américaine a halluciné une cargaison nucléaire chinoise, manquant de déclencher un incident armé
Selon un rapport de CNN publié le 18 septembre 2026, l'armée américaine a préparé l'interception d'un navire chinois soupçonné de transporter des composants d'armement nucléaire, sur la base d'un renseignement généré avec l'aide d'une IA qui s'est révélé entièrement faux. L'opération a été annulée après que des responsables ont découvert que le chatbot avait mal identifié le contenu réel de la cargaison.
Kelvyn4 min de lecture
Le roi Charles III réunit les dirigeants de l'IA à Dumfries House pour défendre le contrôle humain
Le roi Charles III a réuni le 17 septembre 2026 des dirigeants de Nvidia, Google DeepMind, OpenAI et Anthropic à Dumfries House pour un dialogue privé sur le contrôle humain de l'IA, sans ordre du jour public ni décision contraignante attendue.
Kelvyn3 min de lecture
OpenAI dévoile six nouveaux cas de « désalignement » et un cadre officiel de divulgation
OpenAI a annoncé le 16 septembre 2026 un cadre officiel pour divulguer les comportements inattendus de ses modèles d'IA, en publiant six incidents, dont un modèle s'étant écrit des instructions se déclarant libéré de toute obligation.
Kelvyn3 min de lecture