Qwen3.8 27B 在 Artificial Analysis 获 52 分
Qwen3.8 27B scores 52 on Artificial Analysis
Artificial Analysis 发布了最新的 Intelligence Index v4.1.1 评估报告,Qwen3.8 27B 模型在综合智能指数中取得了 52 分的成绩。该指数涵盖了 GDPval-AA v2、GPQA Diamond、Humanity's Last Exam 等九项严苛测试,全面衡量了模型在推理、知识可靠性及幻觉控制方面的表现。报告不仅对比了开源与闭源模型的智能差异,还深入分析了每单位智能指数的运行成本与 Token 消耗。数据显示,Qwen3.8 27B 在保持高推理能力的同时,展现了极具竞争力的性价比,为开发者在 RAG 工作流和复杂任务处理中提供了新的选择。
AA-Omniscience Index 越高越好,它衡量知识的可靠性与幻觉程度,奖励正确回答,惩罚幻觉,且对拒绝回答不扣分。