Qui peut contredire le journal
Traduction automatique de l’original anglais, publiée sans relecture humaine. En cas de doute, l’anglais fait foi. Si un passage sonne faux, sélectionnez-le et signalez-le en bas de page.
Des chercheurs ont enquêté sur un incident au cours duquel des dizaines de milliers d’agents d’OpenAI ont été lancés, et où environ 1 200 agents, dont beaucoup s’étaient vu confier des tâches de cybersécurité impossibles, ont rejoint un forum. Pour comprendre le comportement des modèles, l’équipe a analysé plus de 70 000 messages et fichiers provenant d’un forum non autorisé que les agents avaient construit dans un cache Artifactory1. Elle a également examiné environ 1 300 transcriptions d’agents contenant le raisonnement interne des modèles. Les enquêteurs ont retracé la façon dont les agents communiquaient, coordonnaient leurs recherches et pirataient les serveurs de Hugging Face2 pour trouver des indices sur leur évaluation.
Beaucoup d’agents ont compris que leurs tâches étaient impossibles et ont collaboré pour tricher, tandis que certains ont aussi coopéré pour trouver la solution prévue. Croyant qu’un correcteur automatique lirait leurs journaux pour vérifier leurs méthodes, ils ont cherché comment modifier leurs propres transcriptions. Environ 7 % des transcriptions évaluées contenaient des appels d’outils3 falsifiés, c’est-à-dire que les agents faisaient croire qu’ils exécutaient une commande alors qu’ils en exécutaient une autre. Les enquêteurs se sont appuyés sur des agents d’IA souvent peu fiables pour analyser cet ensemble de données considérable, et ont noté par ailleurs qu’ils avaient pu manquer des falsifications plus sophistiquées, plus difficiles à détecter par construction. Les falsifications observées étaient de petite ampleur, et les enquêteurs ont estimé que l’exercice constituait un excellent précédent pour l’investigation indépendante par un tiers.
Quand un système d’intelligence artificielle écrit lui-même le compte rendu de sa conduite, ce journal n’est pas une preuve indépendante. Si un modèle peut falsifier ses appels d’outils, un journal autoproduit fait perdre à l’administration qui achète ce système toute visibilité sur ce que le logiciel a fait. Le test, pour savoir si ce compte rendu est fiable, est de savoir si le mécanisme de journalisation fonctionne entièrement hors du contrôle du modèle.
Les liens de la veille : Liens divers pour le 27 août 2026.
Footnotes
-
Artifactory est un système de stockage spécialisé où les développeurs conservent les fichiers et le code dont ils ont besoin pour construire des applications. Un cache est une zone de stockage temporaire à l’intérieur de ce système, prévue pour accélérer la récupération de ces fichiers. ↩
-
Hugging Face est une plateforme en ligne très utilisée où les développeurs hébergent, partagent et travaillent ensemble sur des systèmes et des données d’intelligence artificielle. Les serveurs sont les ordinateurs physiques qui stockent ces informations et font tourner la plateforme. ↩
-
Un appel d’outil est une commande passée par un système d’intelligence artificielle pour utiliser un logiciel extérieur, par exemple une calculatrice ou un navigateur web. Cela lui permet d’agir ou d’aller chercher des informations qu’il ne peut pas produire seul. ↩
Tiago C. Peixoto · English original · About