修复三处Bug,Qwen3.5-122B 变身 Mac Studio 日常主力

Fixed three bugs that made Qwen3.5-122B a daily driver on Mac Studio

修复三处Bug,Qwen3.5-122B 变身 Mac Studio 日常主力

我花了三周时间,只为让 Qwen3.5-122B 在 M3 Mac Studio Ultra 上流畅运行。起初,面对 5 万 token 的长对话,生成首词竟需等上三五分钟,这哪里是聊天,分明是批处理任务。为了摆脱这种等待,我从 DS4 Flash 转向 Qwen3.5-122B,并基于 rapid-mlx 开发了 qMLX。真正的挑战在于修复三个致命 Bug:系统提示词中的时间戳导致缓存失效、中断回复未保存引发上下文断裂、以及检查点存储中的垃圾数据挤占空间。解决这些问题后,长上下文推理从分钟级缩短至秒级,本地 AI 终于能真正胜任长程代码协作。

那不是一个聊天机器人,那只是一个批处理作业,你得去泡杯咖啡等它思考。
  • 作者指出一个反直觉的 Bug:System prompt 中唯一的 message ID 导致 KV cache 因无法进行 byte-exact 匹配而失效,迫使每次交互都进行全量重算。
  • 多位评论者强烈反感文章明显的 AI 生成痕迹,认为这种千篇一律的语调破坏了阅读体验,甚至让人无法在业余时间继续阅读。
  • 有从业者分享科学写作经验,主张先由人类撰写草稿,再让 LLM 仅做微调以消除语法瑕疵,而非完全依赖 AI 生成内容。
  • 技术讨论指出该 KV cache 失效问题并非孤例,mlx-lm 和 llama.cpp 等引擎在混合注意力架构下也存在类似的 re-prefill 缺陷。
  • 关于数据可视化,评论者建议吞吐量图表的 Y 轴也应采用对数坐标,否则无法清晰展示 sublinear taper 特征。

同日更多故事

2026-07-12