LLM 推理:如何在效率前沿上取舍?

The efficient frontier of LLM inference

LLM 推理:如何在效率前沿上取舍?

在 AI 行业,我们借用了经济学中的“效率前沿”概念来平衡成本与能力。对于 LLM 推理而言,这通常意味着在延迟与吞吐量之间寻找最优解,或者通过量化、蒸馏等技术用质量换取速度。文章将技术分为两类:一类是在现有前沿上进行权衡,比如调整 Batch sizing 或 Parallelism strategy;另一类则是直接推动整个前沿外移,例如通过 Kernel optimization、Speculative decoding 或 P/D disaggregation 实现整体性能跃升。无论是针对 GLM-5.3 还是 Kimi K3 等模型,理解这些技术如何影响你的部署策略,都能帮助你在资源受限的环境中做出更明智的决策。

放弃每个用户的速度,使得构建用于批处理工作负载的高吞吐量、低成本流水线成为可能。
  1. kgeist

    我正在尝试编写一个推理引擎,旨在结合 llama.cpp 的优势(单二进制文件部署、对非数据中心异构计算的良好支持、广泛的量化支持)与 vLLM/SGlang 的优势(例如用于提升 VRAM 利用率和高并发能力的分页注意力机制)。

    数据中心硬件价格昂贵且供应短缺,而 llama.cpp 在并发使用场景下速度慢且未做优化;相比之下,vLLM/SGLang 在非通用配置上极易崩溃(例如,如果你为 RTX5090+RTX4090 进行流水线并行,启用 RAM 缓存时它们会随机崩溃,或者因为通常假设每个节点都是同种设备类型而选错算子;此外它们也不支持 Q5-Q6 量化)。

    对我而言,最有趣的是如何针对缺乏优质数据中心硬件的情况来优化推理,以及如何做到最优。我在办公室运行了一台 AI 服务器,到目前为止,我发现以下技术对于廉价硬件上的并发使用最为关键:流水线并行(以适配 PCie)、RAM 缓存(快速将上下文恢复至 VRAM)、投机解码(包括特定领域的 n-gram,它们无需草稿模型的开销就能显著加速代码生成)、针对特定设备高度优化的算子、支持 Q5-Q6(效果几乎与 Q8 相当)、FP8 上下文(以容纳更多上下文)、分页注意力(提升 VRAM 利用率)、前缀缓存、连续批处理(这已是各地默认配置)。

    目前主要 […]

  2. jumploops

    > 投机解码是猜测模型可能生成的 token,然后验证这些猜测的过程。

    作为一名计算机工程师,看到不同层级栈上应用的优化总是很有趣。

    投机执行在 90 年代变得相当流行,最终被几乎所有 x86 设计所采用。

    然后在 2000 年代中期,Speculator[0] 论文将这一概念引入了分布式系统,我们至今仍能看到相关工作[1][2]。

    一切旧闻皆新 (:

    [0]https://www.cs.princeton.edu/courses/archive/fall07/cos518/p...

    [1]https://www.usenix.org/system/files/osdi25-shen-weihai.pdf

    [2] https://www.microsoft.com/en-us/research/publication/distrib...

  3. ttoinou

    推理技术要么将部署沿着延迟 - 吞吐量前沿移动,要么将整个前沿向外推,从而创造出更多可分配的效率。

    这是同义反复。你可以用任何事物来说这话。烹饪技巧可以让旧食谱变得更好,或者创造出比其它食谱更好的新食谱,亦或是两者的结合。

同日更多故事

2026-09-02