MicroLLM Lab:在浏览器中运行7个微型LLM

MicroLLM Lab – Try 7 tiny LLM's in the browser

MicroLLM Lab 让你直接在浏览器中运行、测试和对比7个微型语言模型(SLM),无需服务器、零成本、完全本地化。借助 WebGPU 硬件加速,这些模型可在你的设备 GPU 上以 100–300+ tok/s 的速度运行,实现亚10毫秒的首字延迟。所有数据不离设备,隐私无忧。从 PetitGPT 到 SmolLM2,这些 25M–360M 参数的模型经过 Q4 量化,仅需几十MB内存即可运行。无论是快速任务分类、意图识别,还是作为昂贵云模型的边缘层,MicroLLM Lab 都展示了小模型在效率与实用性上的巨大潜力。

前沿模型如 GPT-4 和 Claude 服务成本高达数百万,而紧凑模型(25M–360M 参数)可作为超快、高效的边缘层运行。

同日更多故事

2026-09-28