Почему MLA и MTP конфликтуют: внимание через арифметическую интенсивность
Attention Through Arithmetic Intensity

Арифметическая интенсивность внимания при декодировании одного токена сводится к простой формуле: для MHA она равна 1, для GQA — отношению числа query-голов к KV-головам, для MQA — числу query-голов, а для MLA — примерно удвоенному числу query-голов. Контекстная длина и размерность голов полностью сокращаются. Этот показатель показывает, что MLA на многих современных GPU оказывается у границы между memory-bound и compute-bound, а добавление MTP переводит нагрузку в compute-bound — что объясняет, почему связка MLA+MTP проигрывает.
Кроме KV-кэша, у декодинга теперь есть ещё одна переменная — MTP, или спекулятивное декодирование, чья идея — обменивать вычисления на скорость.