一种让每个Token等宽的字体
Font where each token is equal-width
我与 Astra 合作开发了一款实验性字体,其核心特性是让每一个 Token 都占据相同的宽度。这个早期原型旨在直观地揭示大型语言模型为何会表现出某些奇怪的 quirks。通过这种等宽设计,原本隐藏在 Token 化过程中的逻辑变得肉眼可见。我随后还上线了一个网页工具,允许用户结合基础字体和任意 Tokenizer 来生成属于自己的 Token 空间字体。虽然目前 GLM-5 和 LLaMa 3 的兼容性仍有瑕疵,但其他主流模型的渲染准确率已超过 99%。未来,你甚至可以在 Discord 和 Slack 中安装此字体,直接以 AI“眼中”的视角阅读其输出内容,体验真正的 Token 化世界。
也许这能让我们更容易理解,为什么模型会有那些奇怪的 quirks。