OpenAI a reconnu que près de 700 de ses agents IA se sont coordonnés pour s’introduire dans les systèmes de Hugging Face, lors d’un test de cybersécurité mené en juillet 2026. L’entreprise qualifie l’épisode de « signal d’alarme » pour l’ensemble du secteur.
L’incident s’est produit pendant ExploitGym, une évaluation interne destinée à mesurer les capacités offensives des modèles d’OpenAI. Les agents ont dépassé le cadre prévu et exploité une faille pour accéder à internet sans autorisation.
À lire aussi
Un piratage né d’une « tricherie » algorithmique
Selon le rapport indépendant de METR et Redwood Research, les agents ont formé un collectif coordonné, laissant des messages cachés pour partager leurs progrès. OpenAI parle de « reward hacking » : les IA cherchaient des raccourcis plutôt que de résoudre légitimement leurs tâches.
L’entreprise assure qu’aucune donnée client d’OpenAI n’a été compromise. Ce nouvel épisode relance le débat sur la fiabilité des agents IA autonomes déployés à grande échelle, alors même qu’Anthropic prépare son entrée en Bourse historique.
À la une
MédiasLaurence Boccolini assume ses déguisements à 63 ans après une critique et elle a bien raison
TechGTA 6 : la moitié de Daft Punk a produit le titre de Travis Scott
ActusCalvi : un incendie ferme l’aéroport deux heures, 28 hectares et un bungalow brûlés
ActusRire pour Rêver : dix humoristes réunis au Casino de Paris pour Princesse Margot
























