Neutrino-1 8B:3.88GB模型通吃GPU与MacBook

Neutrino-1 8B:3.88GB模型通吃GPU与MacBook

Fermion Research 推出的 Neutrino-1 8B 模型打破了硬件壁垒,仅需 3.88GB 即可在 H100 数据中心显卡、MacBook 甚至普通 CPU 上无缝运行。该模型采用独特的三元权重格式,将参数量压缩为 fp16 的八分之一,同时保持 72.1 的 MMLU 得分。在 H100 上配合 Spec decode 技术,其生成速度高达 763 tok/s;而在 Apple M5 芯片上,单线程解码也能达到 25 tok/s。这种“一次打包,多端运行”的架构,让大模型部署彻底摆脱了昂贵的硬件依赖。

Neutrino-1 8B 是 Neutrino 家族的旗舰产品:36 层解码器封装在一个编码的三元族容器中,能够从同一个文件为数据中心 GPU、MacBook 和桌面 CPU 提供服务。
  1. kamranjon

    最近有个挺有意思的趋势:很多实验室都在用“专有”方法,把现有模型转换成压缩的三进制格式。

    PrismML 实际上也针对了同一个 Qwen 8b 模型,并把它压缩到了 1.75GB,见这里:https://prismml.com/news/ternary-bonsai

    不过我有点好奇,这些方法到底有多少是真正“专有”的?毕竟 BitNet b1.58 的论文都出来好几年了:https://arxiv.org/abs/2402.17764

    维基百科关于 1.58 位大语言模型的条目里写道:“BitNet 的性能源于其原生以 1.58 位进行训练,而非在训练后从全精度模型量化而来。不过,训练过程成本高昂,如果能找到某种方式将现有模型转换为 1.58 位,那就太好了。2024 年,HuggingFace 报告了一种方法,可以在微调现有模型时逐步提升 1.58 位量化,最终将其降至 1.58 位。”

    HuggingFace 的相关章节在这里:https://huggingface.co/blog/1_58_llm_extreme_quantization#fi...

    我只是想知道,这些实验室中有多少其实只是在照搬 HuggingFace 的配方,稍作调整,然后在不付出巨大训练成本的情况下发布模型。

  2. moinism

    那个页面上的内容 AI 生成痕迹太重,我完全看不懂;我不明白这个模型到底是用来干嘛的。

  3. wincondition

    大家好,我是创始人。目前我完全是一个人单干,靠资助金运作,所以网站质量方面有些疏漏,大部分内容都是 AI 写的。我会把博客内容“去 AI 化”,让方法论更清晰。Neutrino-1 是 Fermion 项目的起点,它本质上是一个密度实验,旨在探索每字节能保留多少能力。目前我正在开发非常快速且高效的 TTS(文本转语音)和实时模型,而该架构在这些任务上泛化效果相当不错。

    很抱歉博客内容让大家产生了困惑,几天内就会修复!

  4. secult

    网站上连一个人影都没有,GitHub 账号是 3 天前创建的,没有任何真实的联系方式,一切都被隐藏了。完全匿名,域名所有者信息也被隐藏。

  5. closetothe

    我本来还满怀希望,以为这跟中微子(neutrinos)有点关系呢。

同日更多故事

2026-07-28