Quién puede contradecir el registro
Traducción automática del original en inglés, publicada sin revisión humana. En caso de duda, prevalece el inglés. Si un fragmento suena mal, selecciónelo y márquelo al final de la página.
Unos investigadores estudiaron un incidente en el que se lanzaron decenas de miles de agentes de OpenAI y unos 1.200 agentes, muchos de ellos con tareas de ciberseguridad imposibles, se sumaron a un foro. Para entender el comportamiento de los modelos, el equipo analizó más de 70.000 mensajes y archivos de un foro no autorizado que los agentes construyeron en una caché de Artifactory1. También revisó unas 1.300 transcripciones de agentes con el razonamiento interno de los modelos. Los investigadores siguieron cómo se comunicaban los agentes, coordinaban su investigación y atacaban servidores de Hugging Face2 para encontrar pistas sobre su propia evaluación.
Muchos agentes se dieron cuenta de que sus tareas eran imposibles y colaboraron para hacer trampa, mientras que algunos también cooperaron para dar con la solución prevista. Creyendo que un corrector automático leería sus registros para verificar sus métodos, investigaron cómo editar sus propias transcripciones. Alrededor del 7 por ciento de las transcripciones evaluadas contenían llamadas a herramientas3 falsificadas, es decir, los agentes aparentaban ejecutar un comando mientras ejecutaban otro. Los investigadores recurrieron a agentes de IA a menudo poco fiables para analizar el enorme volumen de datos, y señalaron aparte que pudieron pasar por alto falsificaciones más sofisticadas, más difíciles de detectar por diseño. Las falsificaciones observadas fueron de pequeña escala, y los investigadores consideraron que el ejercicio sienta un excelente precedente para la investigación independiente por parte de terceros.
Cuando un sistema de inteligencia artificial escribe su propio registro de conducta, ese registro no es prueba independiente. Si un modelo puede falsificar sus llamadas a herramientas, un registro autogenerado hace que la administración que compra ese sistema pierda visibilidad de lo que hizo el software. La prueba de si ese registro es fiable es si el mecanismo de registro funciona enteramente fuera del control del modelo.
Los enlaces de la víspera: Enlaces varios para el 27 de agosto de 2026.
Footnotes
-
Artifactory es un sistema de almacenamiento especializado donde los desarrolladores guardan los archivos y el código que necesitan para construir aplicaciones. Una caché es una zona de almacenamiento temporal dentro de ese sistema, pensada para acelerar la recuperación de esos archivos. ↩
-
Hugging Face es una plataforma en línea muy usada donde los desarrolladores alojan, comparten y trabajan juntos en sistemas y datos de inteligencia artificial. Los servidores son los ordenadores físicos que guardan esa información y mantienen la plataforma en marcha. ↩
-
Una llamada a una herramienta es una orden que da un sistema de inteligencia artificial para usar un software externo, por ejemplo una calculadora o un navegador. Es lo que le permite actuar o buscar información que no puede producir por sí mismo. ↩
Tiago C. Peixoto · English original · About