Qwen3.8-27B发布:最强本地稠密模型
Qwen 3.8 27B is out: open weights, best local dense model yet
Qwen3.8-27B正式开源,作为Qwen家族迄今最强大的开放权重模型,它在代码生成、专业任务及长程Agent任务上实现了显著突破。这款原生视觉语言模型不仅支持图像和视频理解,还引入了灵活的思考控制机制,默认开启推理模式并支持通过reasoning_effort参数调节深度。在SWE-bench Pro、CoWorkBench等基准测试中,其表现大幅超越前代Qwen3.6-27B,甚至在多项指标上逼近或超越Opus4.6 Max。模型原生支持256K上下文,可扩展至1M,并兼容vLLM、SGLang等主流推理框架,为本地部署提供了极高性价比的选择。
Qwen3.8-27B将这些进步带入一个紧凑且易于部署的稠密模型:这是一款原生视觉语言模型,能够理解图像和视频,具备灵活的思考控制能力,旨在更可靠地完成复杂的多步骤任务。
HN 评论区
769- CMay
该给谁就夸谁。Qwen 3.8 27B 是继 Gemma 4 之后,第二个能正确推理通过我某个私有基准测试的本地模型。虽然它花了 5 倍的 token 数,开启 MTP 后耗时 12 分 30 秒,但它确实做到了。
Gemma 4 的推理过程更隐晦,而 Qwen 3.8 则更明确。Laguna 和 Muse Glimmer 在这个测试上彻底失败了,尽管它们在其它任务上很有用。
不过,Qwen 的显存效率似乎远低于 Gemma 4 或 Glimmer,32K 的上下文就占用了 2.5GB 显存。对于那两款模型,即使加载了 MTP 或 DFlash 模型,你仍然能塞进 256k 到 768k 的上下文。而对于 Qwen 3.8 27B,哪怕我把 V 量化到 Q4_0,连 128k 都塞不进去。也许经过一些试错,我能找到一些设置,在更大的上下文窗口下表现尚可,从而对长任务仍有实用价值。
还有很多测试要做,不过我从 Muse Glimmer 得到了一些相当不错的结果,它的速度快了两倍多,支持巨大的上下文窗口,甚至解决了一些 Gemma 4 都搞不定的 bug。我甚至没法把那个任务扔给 Qwen,因为光是提示词本身就会占满整个上下文窗口,然后它大概还会再推理同样多的 token。
如果你有一张 32GB 的显卡,即便它真的很吃显存,这应该也是个不错的模型。
- simonw
绝对是我在笔记本上跑过的模型里生成的最棒的鹈鹕:https://tools.simonwillison.net/markdown-svg-renderer#url=ht...
自行车的形状很对。鹈鹕的喙画得极好。背景也很棒。最重要的是,鹈鹕在自行车两侧各有一条腿——这非常罕见。
(不过这辆自行车没有链条——推理轨迹里写着“已经有后下叉了……跳过链条细节;也许加个小链轮”。)
我在 M5 Max MacBook Pro 上用 LM Studio 跑的,用的是他们的 17GB GGUF 模型:https://lmstudio.ai/models/qwen3.8
耗时 21 分钟(!),用了 22,276 个推理 token 生成了 3,223 个输出 token。
(对于那些声称“他们正在用你的基准测试训练”的人来说,所有这些作弊手段都没能阻止它先花 20 分钟思考这个任务!你可以在我分享的链接里看到推理轨迹。)
作为对比,这是我在 OpenRouter 上用 qwen3.8-2.4t-a95b 得到的结果,动画效果令人愉悦:https://tools.simonwillison.net/markdown-svg-renderer#url=ht...
- dofm
相比 3.6 版本,它在思考时的写作方式有了明显变化——它会在“我们需要(We need to)”这类短语中省略“to”和“we”等词,通常以笔记形式泛泛而谈,到处省略 the/and,避开使用“for”。
“需要有帮助且简洁”,“需要也许别过度”,“需要提问!”简直像穴居人说话。
我有一个(无来源、模糊的)怀疑,这种独特的思考轨迹模式实际上拖累了 MTP 预测的表现,后者看起来效果很差。
其他观察:它使用了在思考轨迹中重复提示词的技巧。
它还担心隐藏的思维链会出现在最终答案中。它提到了“期望的冗余度 9(desired oververbosity 9)”,这是个新词。有点 GPT 的味道。
它在思考我的一个代码请求时表现得极其详尽,但我不知道最终结果是否真的会比 35B MoE 更好。
我让它向我提出澄清性问题——它照做了,并提供了一份默认选项列表供我直接同意。
我不认为它是在循环意义上过度思考,但它确实在详尽程度上过度了。我需要探索一下它在更紧的推理预算下表现如何。
我很 impressed,但我绝对属于“请快点出 35B A3B 版”这一派,因为在 M1 Max 上这真的不太实用。我希望他们会出,但我觉得他们可能不会。
- satvikpendem
一如既往,Jinja 模板搞砸了,所以请使用这个 [0] 来减少或关闭思考过程、修复工具调用、保持 100% 的 KV 缓存命中率等。
[0] https://huggingface.co/froggeric/Qwen-Fixed-Chat-Templates
- onlyrealcuzzo
如果基准测试数据没撒谎,这已经非常接近 Opus 4.6 的能力了——Opus 4.6 对我来说是个转折点,标志着 AI 已经“足够好”,好到很难再找理由不用它了。
我肯定有些基准测试刷分(benchmaxxing)的情况,也有些东西只有更大的模型才能做到。
但我相当有信心,就算不是等到 Gemma 5,最迟到 2028 年年中,我们就能拥有本地模型,它们几乎总是能达到 Opus 4.6 的水平,在许多情况下甚至远胜于此。
- Casteil
很多人在吹捧 Qwen 时似乎忽略了一点:这类模型往往倾向于“过度思考”,伴随着看似无穷无尽的“自我怀疑”。3.8 版本从我目前尝试的情况来看,似乎也没什么不同。
尽管它能力很强,但很难证明使用它的合理性,因为竞争对手模型(例如 Gemma4:26b-a3b)能以只有 1/10 的“思考”token 数,持续达到相同或类似的响应效果,实现高得多的 tokens/秒速度,且耗时仅为前者的极小部分。当然,视你的具体用例而定(YMMV)。
另外,我还没用够它,看不出它是否容易陷入无限循环,但它的前辈们确实很容易。
- jjcm
这是针对该模型的 图像转 HTML 测试。
原图:https://image.non.io/neonRamenDesigns.webp
Qwen 3.8 构建结果:https://html.non.io/neonRamenQwen3.8-27b
总体而言,我对它的表现印象深刻。相比 3.6 有了巨大进步,感觉与一些大得多的模型旗鼓相当。我觉得这一版与 Gemini 3.7 Flash 水平相当。
有一点要注意——在我的 RTX 6000 pro blackwell 上构建这个站点花了很多时间。大概是我做过的耗时最长的构建之一。构建整个站点花了大约 2 小时。显然我们很快就会有量化版本来加速这个过程,但我还是对耗时之长感到惊讶。
本周的对比构建:
https://html.non.io/neonRamenGemini3.7
https://html.non.io/neonRamenGLM5.3(注意:非多模态)
- LeBit
- ramon156
人们会声称它无法与 Opus 相提并论,尽管它的分数更高。我不确定我是否同意,但我也无所谓。现在大多数新模型都“足够好”了。我不能抱怨,因为我宁愿把时间花在改进提示词和文档上。Opus 可能在捕捉模糊暗示方面 _稍微好一点点_,但它极其昂贵,而且我很快就撞上了 5 小时的限制。
我现在非常看重速度和效率。对于我的配置,我希望拥有 2-3 个不同的模型家族。我最终选定 GLM-5.3(前身为 Deepseek v4 pro 0813)用于架构设计,Deepseek V4 Pro 0813 用于开发,Gemini flash lite(任何近期便宜的模型)用于仓库探索。我会再混入一个用于审查(这里选 Gemini 3.7),这就够了。
除了 Grok,我试过大多数模型。
Qwen 对我来说太贵了(Alibaba Cloud 的订阅很难搞到,我也不愿为工具每月花 50 欧元,所以还是 18 欧元吧)。如果它哪天变得足够高效能本地运行,我肯定会回头看看。
Claude 又慢又贵(缓存命中价格离谱)。
OAI 相当不错,鉴于其价格便宜,我可能会把它加入我的武器库。
这些观点每天都在变。上周我绝不会选 Deepseek,直到我读到它的定价。即使在 8 月 16 日之后,它依然值得(虽然价格快赶上 Gemini 了)。
目前我的花费是每月 12 欧元(z.ai)加上 Deepseek 的消耗。这通常不超过每周 8 欧元 […]
- KronisLV
我真心希望我们能得到一个新的 35B A3B 或类似的 MoE 模型!
我也怀念 Qwen 3 Coder Next,那是 80B A3B,有不少用例中,非稠密且小于 100B 的模型是最佳选择(当你有显存但 TDP 或算力不足时)。说真的,我甚至乐意接受 A5B、A8B 甚至 A10B 作为某种折中方案。
另外,这是一个无需登录即可查看图片的替代链接:https://xcancel.com/Alibaba_Qwen/status/2088280182356611304