llama.cpp:本地运行大模型的终极方案

llama.cpp:本地运行大模型的终极方案

llama.cpp 让本地运行大模型变得前所未有的简单。只需运行 llama serve,安装 pi-llama 插件并启动 Pi,系统就能自动发现本地模型,无需任何配置或 API 密钥。所有文件都保留在本地,请求永不离开你的机器。从笔记本电脑到大型集群,llama.cpp 支持各种硬件,包括 Apple Silicon、M Ultra、RTX 5090、H100、MI300 等,提供统一的二进制文件和针对每种 GPU 和 CPU 优化的内核。

文件保留在你的机器上,请求永远不会离开它。
  1. hypfer

    虽然这消息现在有点旧了,但你可能还不知道 llama-server 早就支持多模型了。

    这意味着你(或者说你那个读过 llama.cpp 代码的 AI 代理)可以写一个 ini 文件,指向你的模型,并针对特定硬件优化特定模型的参数。(当然,优化工作得靠你自己测试,不是靠那个 AI)

    然后,任何 API 客户端只需选择模型,系统就会自动处理妥当。

    这软件真不错,拿来就能用。

    __

    你只需要忽略社交媒体上那些盲目跟风命令行参数的做法。

    但你应该听听开发者的建议。

    你已经开启 ngram-mod(或者更准确说是 spec-default)了吗?这功能几乎是零成本的。

  2. karimf

    不太明白为什么它现在又上了首页,但我强烈推荐使用 llama.cpp 在本地运行 AI 模型,除非你有非常特殊的需求,否则它优于其他推理框架。

    ggerganov 和他的团队在保持高质量的同时,还能快速实现新模型和新改进,工作做得非常出色。

  3. imrehg

    llama.cpp 在我的 Framework 13 笔记本上运行得相当不错,但当前这种“快速行动、打破常规、鲜少修复”的时代(抱歉,我是这么感觉的)在这里确实让人很头疼。

    举两个例子:

    - https://github.com/ggml-org/llama.cpp/pull/25863 某人几行代码的改动就破坏了 Framework 笔记本内置 AMD GPU 的原生(ROCm)支持(以及其他集成系统),而任何回滚或正式修复都搁置了近一个月。幸好有变通方案(切换到 Vulkan 而非 ROCm 设备),但这种引入 Bug 的方式以及迟迟不修复的态度,实在让人难以建立信心。

    - LM Studio 内部使用 llama.cpp 处理 GGUF 格式,他们将其作为“运行时”打包进自己的闭源系统中。他们的 ROCm 运行时无法启用 Framework 内置的 AMD GPU,尽管 llama.cpp 版本是支持的。所以他们的运行时一直提示我不支持 AMD GPU——再次强调,解决方案是使用 Vulkan 设备。这个问题至少从一月份起就没修好 https://github.com/lmstudio-ai/lmstudio-bug-tracker/issues/1...

    我想总体而言,这是我见过的最烂的运行时,除了市面上其他的运行时……虽然我还是个粉丝,但在某些情况下,我缺乏足够的知识,或者没有权限去修复问题,这感觉真的很糟糕……

  4. walrus01

    任何建议把 curl 直接 piped 进 bash 的做法都让我很反感。(编辑:我知道,这不完全理性,只是我觉得很奇怪。我们平时经常从各种软件包仓库下载并信任软件,运行代码也是常规操作……)。

    Git clone llama.cpp 然后编译吧,并不难。

    https://github.com/ggml-org/llama.cpp/blob/master/docs/build...

    字面意义上只需要几步基础操作:

    git clone https://github.com/ggml-org/llama.cpp

    cmake -B build

    cmake --build build --config Release

  5. tosh

    我对这个网址有点怀疑,但它也列在 llama.cpp 的 GitHub 上

    https://github.com/ggml-org/llama.cpp

  6. pplonski86

    昨天我安装了 llama.cpp,用来测试我正在构建的本地 AI 数据分析师。我也测试了其他开源 LLM 提供商:Ollama, Jan, vLLM, LM Studio。我有一张较旧的 NVIDIA 显卡(RTX 3070),llama.cpp 的安装过程很顺利,而 vLLM 则要求我重新安装 CUDA 驱动,因为它默认安装了最新版。我很好奇,用不同的推理引擎运行同一个开源 LLM 模型,速度上是否有差异。

  7. equalsione

    如果我说,“我想要一套能用于代理式(agentic)编程工作流的配置,而且必须本地运行”,那么目前最小/最便宜的方案是什么?

    从技术上讲,在各种配置上运行代理是可能的,但似乎存在一个(未定义的)门槛,低于这个门槛的配置就没法用了。

    很多人关于在相对低端硬件上成功运行配置的故事,往往伴随着巨大的妥协,或者在非琐碎场景下就会遇到问题。我发现很难找到共识。

    或者也许我只是不喜欢人们建议的那些几千美元的价格标签……

  8. prologic

    llama.cpp(以及 llama.app)真的比 Ollama 好那么多吗?我只玩过 Ollama,所以非常好奇想听听其他人的真实体验。

同日更多故事

2026-08-12