Qwen 3.8 27B 在 Cerebras 跑出 1500 tok/s
Qwen 3.8 27B available on Cerebras at 1500 tokens/s
Cerebras 公开端点现已上线 Qwen 3.8 27B 模型,推理速度高达每秒 1500 个 token。平台明确承诺,所有公开服务均提供未经剪枝的原始模型版本,确保架构不被擅自修改。虽然 Cerebras 在 Hugging Face 上分享了基于 REAP 技术的剪枝模型供研究使用,但生产环境 API 仅保留完整精度。通过选择性权重量化技术,系统在存储时优化了资源占用,而在推理过程中,激活值、注意力机制及 KV 缓存均保持全精度运行,从而在速度与质量之间取得平衡。
我们承诺为所有现有端点提供原始模型服务,绝不通过剪枝技术修改模型架构。