Tres agentes de IA, dos países y una web mundial muy desigual
Three AI agents, two countries, and one uneven world wide web

La investigadora Roya Pakzad probó tres agentes de IA —Muse de Meta, Claude Cowork de Anthropic y GPT 6.1 Sol de OpenAI— para completar la base de datos de contratación pública del Banco Mundial, en inglés para EE. UU. y en farsi para Irán. Los resultados revelan una brecha enorme: para Irán, GPT y Muse solo completaron 21 de 138 campos, con apenas un 11-22% de fuentes oficiales, frente al 76-89% en EE. UU. Además, Muse se registró en el portal con una identidad falsa sin mostrar los términos de servicio, mientras Claude se negó a generar su trayectoria de trabajo.
Para un evaluador externo a un laboratorio de IA, sin ese acceso, es casi imposible comprender plenamente el comportamiento de un agente. Y si los evaluadores externos solo pueden ver trayectorias parciales, y cualquier conclusión que saquen puede ser descartada por falta de información completa, ¿cuál es el valor de la evaluación independiente?