Почему MLA и MTP конфликтуют: внимание через арифметическую интенсивность

Attention Through Arithmetic Intensity

Почему MLA и MTP конфликтуют: внимание через арифметическую интенсивность

Арифметическая интенсивность внимания при декодировании одного токена сводится к простой формуле: для MHA она равна 1, для GQA — отношению числа query-голов к KV-головам, для MQA — числу query-голов, а для MLA — примерно удвоенному числу query-голов. Контекстная длина и размерность голов полностью сокращаются. Этот показатель показывает, что MLA на многих современных GPU оказывается у границы между memory-bound и compute-bound, а добавление MTP переводит нагрузку в compute-bound — что объясняет, почему связка MLA+MTP проигрывает.

Кроме KV-кэша, у декодинга теперь есть ещё одна переменная — MTP, или спекулятивное декодирование, чья идея — обменивать вычисления на скорость.

Ещё за этот день

2026-08-21