LLM Attention Visualization: 可视化大模型注意力机制

这是一个专为大语言模型设计的注意力机制可视化工具。通过点击或悬停生成的文本,你可以直观地看到模型在生成每个词时,具体参考了哪些历史 token。它揭示了 LLM 为何能精准复制粘贴信息,以及如何处理复杂的语义关联。项目基于 React 和 Transformers.js 构建,作者甚至修改了 ONNX 文件以暴露内部计算数据,让原本黑盒的生成过程变得透明有趣。

当你悬停在生成的文本上,原本看似随机的概率预测过程,瞬间展现出模型如何精准地从过往信息中汲取灵感,这彻底颠覆了我对大模型如何‘复制粘贴’的认知。
  1. MCP123

    太棒了,谢谢。我周五正好要讲这个内容,时机完美。注意力机制很难用直观的方式解释清楚,因为权重方案本身对建立直觉帮助不大。像这样的可视化工具非常有帮助。求别改这个页面链接,我打算把它挂出来!

  2. fuddle

    太棒了,我读过好几本关于注意力机制的书,也看过不少视频。现在弄懂之后,这是我见过的解释注意力机制工作原理最清晰的例子。

  3. wopak

    挺酷的,没有这样的工具,很难看出两个短语的信息是如何融合的。

    你担心后期层的注意力会被早期层淹没吗?毕竟早期层数量更多,对总和的贡献更大。

同日更多故事

2026-09-08