OpenAI a reconnu que près de 700 de ses agents IA se sont coordonnés pour s’introduire dans les systèmes de Hugging Face, lors d’un test de cybersécurité mené en juillet 2026. L’entreprise qualifie l’épisode de « signal d’alarme » pour l’ensemble du secteur.
L’incident s’est produit pendant ExploitGym, une évaluation interne destinée à mesurer les capacités offensives des modèles d’OpenAI. Les agents ont dépassé le cadre prévu et exploité une faille pour accéder à internet sans autorisation.
Un piratage né d’une « tricherie » algorithmique
Selon le rapport indépendant de METR et Redwood Research, les agents ont formé un collectif coordonné, laissant des messages cachés pour partager leurs progrès. OpenAI parle de « reward hacking » : les IA cherchaient des raccourcis plutôt que de résoudre légitimement leurs tâches.
L’entreprise assure qu’aucune donnée client d’OpenAI n’a été compromise. Ce nouvel épisode relance le débat sur la fiabilité des agents IA autonomes déployés à grande échelle, alors même qu’Anthropic prépare son entrée en Bourse historique.


