Maple-Preview: 手机端极速推理的开源三值权重模型
Show HN: Maple-Preview – ternary 20B MoE running at 120 tok/s on a iPhone
我们推出了 Maple-Preview,一款原生训练的 20B-A1B 三值权重推理大语言模型。它在保持顶尖性能的同时,在 iPhone 上实现了每秒 127 个令牌的惊人速度,比 Bonsai 27B 快 13 倍。该模型不仅能解决 IMO 级别的数学难题,还具备设备端自适应能力,能通过“梦境”机制学习用户偏好并更新权重。Maple-Preview 证明了低精度无需妥协,为未来高效、个性化的设备端 AI 助手铺平了道路。
我们相信模型运行的精度应当就是它学习的精度,低精度并不意味着性能的妥协。
HN 评论区
49- walrus01
拿 Qwen 3.5 35B-A3B 做对比基准表看起来很奇怪,毕竟 Qwen 3.6 35B-A3B 已经发布一段时间了,而且性能显著更好。
我初读文章时没注意到版本差异!所以这里给像我一样的人提个醒。
- beautiful_apple
“当前低精度方法主要关注将全精度训练的模型转换为更低位宽。我们认为这从根本上就是错误的做法……”
非常期待看到它的表现,我一直对转换现有模型的效果持怀疑态度——看到有一个从头开始在三值格式下训练的模型,真的非常酷。
- arjie
我真希望“小型”LLM 别再那么自信地给出完全错误的答案了。诚然,这算是一个故意选得很冷门的测试,但它那种自信满满地呈现完全错误答案的方式确实让人有点担忧。
“请写 250 个词关于单词 schlong 的词源和历史”
该词的实际起源是中古德语和讲意第绪语的阿什肯纳兹犹太社区。
作为对比,qwen 3.6 35B A3B 在这个测试上表现完美,会给出该词真实起源的扎实描述,以及它如何演变成美式英语中的日常粗俗用语,甚至还会提到美国东北部特定种族/宗教背景的单口喜剧演员和著名公众人物是如何将其引入更广泛使用的。
别只让它回答狭窄的细分科学或技术领域的问题,试着问一些不太常见、不太可能被塞进 20B 参数模型里的内容,看看它表现如何。
聊天测试链接:https://chat.deepgrove.ai/