GLM-5.3 supera benchmarks de inteligência com preço competitivo
GLM-5.3 Artificial Analysis Benchmarks
A Artificial Analysis divulgou uma análise detalhada do GLM-5.3 (max), avaliando seu desempenho em nove benchmarks de inteligência, incluindo raciocínio, conhecimento e uso de ferramentas. O modelo se destaca pelo equilíbrio entre inteligência e custo, com destaque para o índice AA-Omniscience, que mede confiabilidade do conhecimento e alucinações. A análise compara GLM-5.3 com outros modelos, mostrando sua posição em custo por tarefa e eficiência de tokens, além de detalhar preços por token e contexto.
O Índice de Inteligência Artificial Analysis v4.1.1 incorpora 9 avaliações: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR.