FIBER: новая архитектура GPU ускоряет LLM-инференс до 2.25×

A Thread-Register Decoupled GPU Execution Model for Efficient Tensor Computation

FIBER: новая архитектура GPU ускоряет LLM-инференс до 2.25×

Исследователи из Китая и США представили FIBER — архитектурное расширение для GPU, которое решает проблему неэффективного выполнения тензорных вычислений на современных чипах с Tensor Cores. FIBER вводит понятие «fiber» — исполняемого экземпляра, отделённого от приватных регистров и использующего общий доступ к регистровому файлу SM. Это позволяет динамически масштабировать параллелизм, планировать поток данных на уровне регистров и устранить избыточность в подаче операндов. В сценарии смешанной точности для LLM FIBER достигает ускорения до 2.25× на Ampere, 1.8× на Hopper и 2.09× на Blackwell, а на уровне отдельных ядер — до 2.49×.

Мы выявили фундаментальные узкие места — фиксированный параллелизм и крупнозернистое планирование, которые проявляются в современных AI-нагрузках, чередующих разнообразные операции, отличные от GEMM, с самими GEMM.

Ещё за этот день

2026-08-26