Font macht jedes Token gleich breit – damit du verstehst, warum Modelle spinnen
Font where each token is equal-width
Der Entwickler &. hat mit Astra eine Schriftart gebaut, in der jedes Token eines Tokenizers exakt dieselbe Breite hat. Ein Compiler auf der Webseite erzeugt aus einer Basisschrift und einem frei wählbaren Tokenizer den passenden Token-Space-Font; Anleitungen für Discord und Slack liegen bei. Die meisten Modelle treffen zu über 99 Prozent, GLM-5 und LLaMa 3 sind noch unzuverlässig. Die Idee: KI-Ausgaben so lesen, wie die KI sie geschrieben hat.
OpenType has a 65,536 ligature limit and tokenizers are fucked up so this had to be implemented using GSUB and cmap