10种模型组合Three.js任务实测

I tested 10 model/harness combinations on the same Three.js task

我最近在/goal模式下,用同一个Three.js科幻机库构建任务,测试了10种不同的模型与harness组合。任务要求生成包含悬停无人机、动画警示灯和体积雾效的单页HTML文件。从GLM 5.3 Flash Max到Qwen 3.8 27B x-high,配合Codex、OMP、OpenCode及DSH等工具,我记录了生成时间、Token消耗、成功率及工具错误等关键指标。数据揭示了不同组合在效率与质量上的显著差异,例如某些组合耗时极短但Token消耗巨大,而另一些则在代码生成质量上表现更佳。这份实测数据希望能帮助开发者在构建复杂3D场景时,找到最适合的模型与工具搭配。

我一直在测试一个简单的提示词,尝试不同的模型和harness组合,以找出哪一组能产生最佳结果。
  1. onion2k

    Astra 版本似乎用的是 three.js r170,那是 2024 年 10 月的版本。Sol 用的版本更早。GLM 的代码虽然用了最新版,但我怀疑它只是从 jsdelivr 拉取了 three.js@latest,所以不太可能是专门针对那个版本写的代码。Qwen on OpenCode 也是从 jsdelivr 拉取,但锁定在了 r160。

    我觉得这些例子都没用 tone mapping 之类的技术,所以都卡在 sRGB 色彩空间了(AgX 或 ACES 看起来会好得多),也没用 node materials(这对程序化纹理实现很有用),更没做烘焙阴影环境或用后期处理效果之类酷东西。

    它们挺不错,但我觉得这更多是在展示 AI 模型在这类项目上落后了多少,而不是它们有多强。

  2. utopiah

    真希望能有一列显示每个方案的预估成本,并标注具体日期。

    理想情况下,还能找到某种方法(虽然我不确定什么方法最合适),在运行测试前确认哪些内容是公开可用的。如果有比赛(比如 js13k)、书籍里的实时代码示例,甚至是特定主题的模板,结果会大不相同。从视觉上看,这些结果非常非常相似,以至于我不禁怀疑,这究竟是因为提示词简短但描述相对详尽,还是因为总是找到了某个模板并依赖了它。

  3. alvins82

    顺便提一下,在我寻找一款类似 desktop codex/claude 的桌面应用时——https://github.com/openchamber/openchamber——这个似乎是领跑者。我把它和 OMP 搭配使用,通过 https://github.com/alvins82/omp-openchamber-server/

    我想要一个强大的 GUI+harness 组合来运行开源模型,这样新模型出来时我就能立刻使用和测试。

  4. poilcn

    不错。但这些测试引出一个问题:哪些结果是可复现的?是最终视觉效果、耗时、工具调用,还是大部分只是噪音?比如,你试过用同样的组合、模型和 harness 多次运行吗?

  5. rao-v

    小小的选择如何显著影响结果好坏,这点真的很有趣。Astra 和其中一个 GLM 加了明亮的灯光,所以在我眼里看起来好太多了。

    对 Qwen 3.8 的一些结果真心满意(尤其是考虑到我可以用 Q8 运行这个模型)。

    很有趣地看到,在这个任务上,Pi (OMP) 作为 harness 比 Opencode 好多少。

    我很想看到更多结果容易判断但主观性更少的案例。

    我有个玩具项目,想做一个有趣的对战模拟器,让 LLM(或者如果是双人对战就用两个 LLM)编写程序来控制多个机器人(每个机器人有自己的视野和有限的战场上下文),它们必须协同作战。目标是让 LLM 根据当前局势更新代码,在 5 分钟的模拟战斗中大概更新 5-10 次。甚至想探索允许机器人请求重新编程,并根据重编程次数来评分。

同日更多故事

2026-09-08