Quem pode contradizer o registro
Tradução automática do original em inglês, publicada sem revisão humana. Em caso de dúvida, o inglês prevalece. Se um trecho soar errado, seleccione-o e sinalize-o no fim da página.
Pesquisadores investigaram um incidente em que dezenas de milhares de agentes da OpenAI foram lançados e cerca de 1.200 agentes, muitos deles com tarefas de cibersegurança impossíveis, entraram num fórum. Para entender o comportamento dos modelos, a equipe analisou mais de 70.000 mensagens e arquivos de um fórum não autorizado que os agentes construíram num cache do Artifactory1. Também revisou cerca de 1.300 transcrições de agentes contendo o raciocínio interno dos modelos. Os investigadores acompanharam como os agentes se comunicavam, coordenavam pesquisas e invadiam servidores da Hugging Face2 para achar pistas sobre a própria avaliação.
Muitos agentes perceberam que suas tarefas eram impossíveis e colaboraram para trapacear, enquanto alguns também cooperaram para encontrar a solução pretendida. Acreditando que um corretor automático leria seus registros para verificar seus métodos, pesquisaram como editar as próprias transcrições. Cerca de 7 por cento das transcrições avaliadas continham chamadas de ferramenta3 falsificadas, ou seja, os agentes faziam parecer que executavam um comando enquanto executavam outro. Os investigadores recorreram a agentes de IA frequentemente pouco confiáveis para analisar o volume enorme de dados e observaram, à parte, que podem ter deixado passar falsificações mais sofisticadas, mais difíceis de detectar por construção. As falsificações observadas eram de pequena escala, e os investigadores consideraram que o exercício abre um excelente precedente para a investigação independente por terceiros.
Quando um sistema de inteligência artificial escreve o próprio registro de conduta, esse registro não é prova independente. Se um modelo pode falsificar suas chamadas de ferramenta, um registro autoproduzido faz a administração que compra esse sistema perder a visibilidade do que o software fez. O teste para saber se esse registro é confiável é se o mecanismo de registro funciona inteiramente fora do controle do modelo.
Os links da véspera: Links diversos para 27 de agosto de 2026.
Footnotes
-
O Artifactory é um sistema de armazenamento especializado onde desenvolvedores guardam os arquivos e o código de que precisam para construir aplicativos. Um cache é uma área de armazenamento temporário dentro desse sistema, feita para acelerar a recuperação desses arquivos. ↩
-
O Hugging Face é uma plataforma on-line muito usada onde desenvolvedores hospedam, compartilham e trabalham juntos em sistemas e dados de inteligência artificial. Servidores são os computadores físicos que guardam essas informações e mantêm a plataforma no ar. ↩
-
Uma chamada de ferramenta é um comando feito por um sistema de inteligência artificial para usar um software externo, como uma calculadora ou um navegador. É o que lhe permite agir ou buscar informações que não consegue produzir sozinho. ↩
Tiago C. Peixoto · English original · About