Mercury 2.5:扩散式 LLM 的新标杆

Inception 发布了 Mercury 2.5,这是目前市场上能力最强的扩散式大语言模型。相比前代,其智能水平提升 40%,推理速度在 NVIDIA GPU 上可达每秒 1107 tokens,同时保持极低延迟和成本。该模型已在搜索代理、语音交互及代码助手等生产环境中验证,显著降低了响应时间并压缩了成本。Mercury 2.5 不仅支持 26 万 token 上下文,还推出了 Mercury Voice 和 Mercury Router 预览版,为实时语音和智能路由提供新方案。
在语音领域,延迟不仅仅是基础设施的细节,它是通话者听到的停顿。