big-pickle, el modelo gratuito de OpenCode Zen, supera a todos en el benchmark SWE Atlas QnA

Big Pickle on SWE Atlas – Codebase QnA

El modelo gratuito big-pickle de OpenCode Zen logra un 50.8% de resolución en el benchmark Codebase QnA de Scale AI, superando a todos los modelos con el scaffold Mini-SWE-Agent y a los GPT con Codex en la tabla oficial. Solo los modelos Claude con su scaffold nativo obtienen mejores resultados. La evaluación, realizada con el harness oficial y el juez de Scale, incluye advertencias: un solo intento por tarea, recursos reducidos y la identidad del modelo no confirmada.

Dentro de la clase de scaffold Mini-SWE-Agent — la comparación manzanas con manzanas — esta ejecución supera a todas las entradas de la tabla oficial, y también supera a las entradas GPT con scaffold Codex.

Más de este día

2026-08-16