Homebench:一键评测本地 LLM 速度与质量
Homebench – Benchmark local LLMs for speed, memory, and quality
Homebench 是一款专为本地 LLM 打造的评测工具,只需一条命令即可在终端生成实时排行榜。它支持 Ollama、LM Studio、llama.cpp 和 vLLM 等多种本地推理后端,无需配置或 API 密钥。工具不仅测量 tokens/sec 和首字延迟,还通过精心设计的任务集评估模型在数学、推理及代码理解方面的质量。其独特的缓存机制让重复评测仅需数秒,同时提供硬件适配建议,帮助用户快速判断哪些模型能在当前设备上流畅运行,是本地部署大模型时的得力助手。
克隆即运行,指向你已下载的模型,立刻获得直观答案:哪些本地模型真正出色,以及它们在这台笔记本上的运行速度如何。
- robbomacrae
FYI GitHub URL 返回 404。
我一直在将基准测试集成到 OrcaBot 中,要么在应用本地运行,要么在 orcabot.com 上在线运行。主要是为了提供一个简单的方法来验证我自己发布的基准测试结果。目前有一个运行 SlopCodeBench 的模板。接下来正在做一个 TTS(语音合成)的。
不确定这个领域是否会有太多兴趣。这可能会很烧钱,但像 OpenAI 这样的服务商允许你用这些测试来疯狂消耗你的订阅额度。
- embedding-shape
有趣的是,GitHub 上的这个仓库和用户似乎都被删除了。运行过这个项目的人,如果之前没做过的话,可能得赶紧去检查一下代码和依赖。
- chabes
不错!我最近正好想要这样的工具,但我一直想避免用那种“凭感觉写代码”(vibe coding)的蹩脚方案来解决我的问题,所以看到有人接手做这件事,感觉挺好的。