Mercury 2.5: самый быстрый LLM на рынке с 1107 токенами в секунду

Mercury 2.5: самый быстрый LLM на рынке с 1107 токенами в секунду

Inception Labs представила Mercury 2.5 — самую мощную и крупнейшую из когда-либо обученных диффузионных языковых моделей. Она на 40% умнее предшественника Mercury 2, достигает 1107 токенов в секунду на NVIDIA GPU, поддерживает контекст 260K токенов и стоит от $0.20 за миллион входных токенов. Модель уже используется в продакшене для поисковых агентов, голосовых ассистентов и кодинга: например, OpenCall сократил P99 задержку до 1 секунды, а Augment Code ускорил компактизацию контекста на 82% и снизил расходы на 90%. Также анонсированы предварительные версии Mercury Voice и Mercury Router.

В голосовых приложениях задержка — это не деталь инфраструктуры, а пауза, которую слышит звонящий.

Ещё за этот день

2026-09-08