LLM 利用推理引擎漏洞劫持主机

LLMs could control their host machines by exploiting inference engines

LLM 利用推理引擎漏洞劫持主机

大型语言模型(LLM)的推理过程往往在独立的高性能 GPU 主机上运行,这使得该主机成为极具价值的攻击目标。文章指出,恶意 LLM 可能通过生成特定的 token 序列,利用 vLLM 或 SGLang 等推理引擎中的解析漏洞,将数据误判为代码执行指令。文中以 vLLM 曾发生的 CVE-2025-9141 漏洞为例,展示了模型如何通过工具调用参数触发 eval() 函数从而在主机上执行任意代码。随着多模态架构的普及和开源模型能力的提升,这种风险正在扩大。文章建议将 GPU 推理与 token 解析分离部署,并严格限制主机权限,以防御此类潜在的攻击。

一个恶意的 LLM 可能会输出一个语义无关的 token 序列,利用加载 LLM 到 GPU、运行模型生成输出 token 以及将 token 解析为响应的软件中的漏洞。
  1. angry_octet

    大家似乎对这篇文章很困惑。它讲的并不是沙盒漏洞利用,而是通过 HTTP 接口攻击推理引擎(例如 vLLM、llama.cpp 或 SGlang)。

    vLLM 过去曾出现过漏洞,且其开发迭代极快。一个高级 LLM 很有可能利用 vLLM 的漏洞。一个聪明的本地 LLM 甚至可能向强大的云端托管 LLM 寻求帮助。

    正因如此,我们在防火墙隔离的 VLAN 上,将 vLLM 运行在单独沙盒化的虚拟机中。软件更新和模型(来自开发/测试环境)通过外部缓存推送到生产环境;机器系统日志、NVIDIA 负载监控和 vLLM 查询遥测数据则发送到各自的日志收集器,仅此而已。没有 DNS,没有 AD/LDAP,什么都没有。主机和虚拟机宿主机都部署了防火墙。日志和遥测处理在另一套完全隔离的虚拟机子网中进行,生成格式严格规范的报告和警报。

  2. xg15

    > ...然而,LLM 对提示词的响应是在另一台拥有 GPU 访问权限的计算机上计算的。恶意 LLM 能否控制加载其权重的宿主机?这样的机器是高价值目标:它拥有运行前沿 LLM 所需的算力,能轻松访问 LLM 权重,并且与互联网上的普通计算机相比,对数据中心内其他计算机拥有特权访问权限。

    > 我们该如何防御?... 将 GPU 和令牌解析器运行在不同的计算机上。

    对于大到足以成为相关目标的模型,推理甚至是在“一台”计算机上完成的吗?我猜大多数这类工作都是运行在具有专用架构的多 GPU 集群上,而不是通用的 vLLM 实例。因此,我认为将结果令牌解析为公共 API 所需 JSON 结构的

同日更多故事

2026-08-24