Needle2: 14MB 微型智能体大模型

Show HN: Needle2: 14MB agentic LLM for phones, wearables, smart home and robots

Needle2: 14MB 微型智能体大模型

我们发布了 Needle2,一款专为微型设备打造的开源智能体大模型。整个模型仅 14MB,运行会话仅需 28MB 内存,却能在 Raspberry Pi 5、Meta Quest 3S 甚至 ESP32-S3 等无 GPU 设备上实现每秒 500 个 token 的解码速度。基于 Simple Attention Network 架构和 Cactus Quants 无损 2 位量化技术,它在工具调用和设备控制任务上表现卓越,性能媲美 FunctionGemma 等更大模型。无需安装依赖,单二进制文件即可在各类边缘设备上运行,让智能助手真正走进低成本硬件。

边缘 AI 不应只属于昂贵的 Mac 和 PC,真正的边缘是那些成本低于 200 美元的廉价硬件:数十亿 IoT 设备、入门级手机和微型机器人。Needle 的目标就是这些没有 GPU、没有 NPU、仅有几百 MB 内存的设备。
  1. nater5000

    这很酷。我确实认为“微型”LLM 领域被低估了,所以看到这类工作总是令人振奋。我预见在某些场景下会出现一种范式:构建 LLM 层级体系,由能力更强的模型主动训练较小的模型来高效解决特定任务,而像这样的模型或许就是该堆栈中最底层的一环。

    话虽如此,网页演示版的表现并不特别令人印象深刻。无论我输入什么,它似乎都不怎么买账。我完全接受微调是解决之道,但我好奇更大的模型是否能带来额外收益?我知道这完全违背了本项目的初衷,但一个 14MB 的二进制文件占用 28MB 内存,显得过于小且相当随意。

    比如,28MB 的二进制文件能给你带来什么?或者 140MB?亦或是 1.4MB?我猜选择 14MB 是在满足特定需求/性能预期的前提下尽可能最小化体积的结果,但即便是 Pi 5 也有 plenty 的剩余空间。好奇是否有合理的解释(可能我略读帖子时漏掉了)。

  2. dbeardsl

    我的第一个查询:

    > 让这里暖和一点。

    回复:

    > "name": "set_thermostat",

    > "arguments": {

    > "temperature": 65,

    > "mode": "cool",

    > ...

    > "reasoning": "'warmer' implies need for cooling; set_thermostat with temperature 65 (typical warmth) and mode 'cool'.",

    难道是我用错了?

  3. Tiberium

    网页演示的结果挺搞笑的。我很清楚这是一个极其微小、呃,愚蠢的模型,但即便如此:

    查询:HN

    结果:

    {

    "function_calls": [

    {

    "name": "lock_door",

    "arguments": {

    "door": "front door"

    }

    }

    ],

    "reasoning": "User wants to lock the door. No specific door mentioned, so use 'front door' as default.",

    "confidence": 0

    }

    我本以为它至少会对无法理解的查询忽略处理(不调用任何工具)。看起来它确实会这样做,只是并不一致。

  4. arthuqa

    有人能分享一下这类开源微型 LLM 是如何创建的吗?

    创作者是不是拿类似 DeepSeek 的模型,然后删掉大部分神经元来缩减体积?

  5. profsummergig

    这真的很酷——我本来就在想把 `functiongemma-270m-it` 压缩到 1-2 位,以便在浏览器中完美运行。

    你们的 `Fine-tuning` 功能甚至更方便。

同日更多故事

2026-08-10