突破1.58位:三元LLM存储新方案

Breaking the 1.58-bit Barrier for Ternary LLMs

三元大语言模型(LLM)传统上受限于1.585位的理论存储下限,实际部署中因打包方式往往达到1.625位。研究团队发现,29个三元模型中零值权重占比高达51.5%,这一非均匀分布被长期忽视。为此,他们提出了BITCOS方案,通过自适应布局结合密集存在位图与紧凑符号向量,将存储成本降至1.485位。该方案在26个测试模型中表现优于传统五三元组打包法,并在AVX-512、AVX2及Intel Xe2 GPU上实现了高效解包。实测显示,在真实零密度场景下,矩阵向量乘法性能提升最高达1.28倍,端到端推理吞吐量在CPU和GPU上分别提升1.18倍和1.27倍。

我们测量了29个三元LLM模型的符号分布,发现零值占所有权重的比例高达51.5%。

同日更多故事

2026-09-16