消费级显卡运行 Qwen3.8-Flash-Next
Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

Strata 让你能在普通游戏电脑上运行拥有 1250 亿参数的 Qwen3.8-Flash-Next 模型。无论是 NVIDIA 还是 AMD 显卡,只要显存达到 12GB,配合 32GB 以上内存,即可一键安装。数据完全本地运行,支持聊天、写代码和图像输入。在 RTX 5070 上,生成速度可达每秒 94 个 token,远超人类阅读速度。通过智能分块和猜测验证机制,Strata 巧妙地将庞大模型拆解到显卡、内存和 SSD 中协同工作,让本地 AI 推理变得触手可及。
你的显卡保留了最常用的几千个专家,内存容纳了所有专家,而处理器则同时处理其余部分。