Локальные LLM отвечают на 88,7% запросов, бросая вызов облачному AI

Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

Исследователи из Стэнфорда предлагают метрику intelligence per watt (IPW) — точность на ватт — для оценки локального инференса. Проанализировав более 20 моделей, 8 ускорителей и 1 млн реальных запросов, они выяснили: локальные LLM (до 20 млрд активных параметров) справляются с 88,7% задач, а с 2023 по 2025 год IPW вырос в 5,3 раза. Локальные ускорители вроде Apple M4 Max как минимум в 1,4 раза эффективнее облачных при запуске тех же моделей.

Локальные ускорители достигают как минимум в 1,4 раза более низкого IPW, чем облачные ускорители, запускающие идентичные модели, что выявляет значительный потенциал для оптимизации локальных ускорителей.

Ещё за этот день

2026-09-16