Un nuevo banco de pruebas sobre gov.uk halla que los chatbots responden en general bien y casi nunca dicen no lo sé
Traducción automática del original en inglés, publicada sin revisión humana. En caso de duda, prevalece el inglés. Si un fragmento suena mal, selecciónelo y márquelo al final de la página.
Unos investigadores extrajeron 2.781 páginas de gov.uk y generaron de ellas 22.066 pares de pregunta y respuesta, nueve por página, escritos para sonar como personas reales preguntando por prestaciones, impuestos o inmigración. Después pasaron 11 modelos, entre ellos Claude, Gemini, ChatGPT, Llama, Qwen y Kimi, por 7.355 de esos pares, puntuando cada respuesta dividida en afirmaciones factuales, cada una cotejada con la página.
La mayoría de las respuestas eran buenas. Los fallos son el hallazgo: las notas oscilan mucho de una pregunta a otra, y un pequeño número de malas respuestas arrastra la media de cada modelo por debajo de su rendimiento habitual. Claude 4.5 Haiku obtuvo la nota más alta sin ejemplos resueltos y también escribió más que nadie. Los modelos de pesos abiertos como Qwen aguantaron el paso a los comerciales. Todos los modelos ofrecieron más información de la que había en la página, y darles ejemplos resueltos no lo corrigió, bajando a veces la precisión.
Casi ningún modelo dijo nunca “no lo sé”, y Qwen3-32B no se negó ni una sola vez. El test difícilmente podía mostrar otra cosa. Cada pregunta se generó a partir de una página que la responde, y el detector de negativas de los propios autores se equivoca alrededor de una vez cada 150, más que casi todas las tasas de negativa que registró. Lo que hace un modelo cuando ninguna página cubre a la persona que pregunta queda fuera de lo que este test puede ver.
Los propios autores nombran el otro límite: las respuestas de referencia salen de gov.uk tal como estaba, y empiezan a quedarse viejas en cuanto cambian las reglas.
Tiago C. Peixoto · English original · About