Quasar 438B:欧洲最强 AI 模型登场

Quasar 438B: Europe's Leading AI Model

Quasar 438B:欧洲最强 AI 模型登场

Multiverse Computing 推出了其旗舰推理模型 Quasar 438B,这是欧洲首款在 Artificial Analysis Intelligence Index 上得分高达 43 的大型模型,超越了 Mistral Medium 3.5 和 NVIDIA Nemotron 3 Ultra。Quasar 不仅智能,而且速度惊人,能在 15.3 秒内完成包含推理时间的 500 token 输出。它在长上下文处理和终端编程任务中表现优异,专为需要规划、工具使用和代码执行的企业级多步骤任务设计。支持英语和西班牙语,Quasar 通过 CompactifAI API 提供,让团队无需搭建基础设施即可测试。

Quasar 将这一工作带入了 400B 以上参数类别:一个用于需要规划、工具使用、代码执行和大型上下文的多步骤任务的推理模型,同时避免了该类别通常携带的延迟。
  1. fantyoon

    我可能读错了。但他们似乎强烈暗示是他们训练了这个模型。或者至少想营造出这种印象。否则,“欧洲领先模型”这句话就没什么意义了。

    他们的看家本领是从模型中移除参数 [1],我认为这就是移除了参数的 GLM 5.2。他们的更新日志 [2] 里宣传称

    “功能与 GLM 5.2 完全相同”,它拥有相同的两个努力级别设置“high”和“max”,而且两者都仅支持文本 [3]。我可能搞错了,但在改变主意之前,我很想听听更多关于他们具体做了什么的信息。

    就我个人而言,不太喜欢这种营销手段。不管这个模型到底是什么。

  2. pu_pe

    这家公司听起来就像是一堆空话。看看他们的简介页:

    > Multiverse 平台的核心是 CompactifAI,这是一种压缩技术,将张量网络(一种源自量子物理学的数学框架)应用于 AI 模型压缩问题。这项应用由联合创始人兼首席科学官 Dr. Román Orús 率先开发,能在几乎不损失精度的情况下,将大型语言模型的体积缩小 80-95%。

    讽刺的是,考虑到他们发布了一个 438B 的模型,却输给了一个 27B 的模型。从另一部分来看:

    > Singularity Machine Learning 是一项云服务,利用量子机器学习来解决监督学习问题。

    如果这些人只是微调了一个开源的中国模型就草草了事,我也不会感到惊讶。

  3. espadrine

    我希望这家公司能拥有优秀的模型。看到这么好的分数,我很高兴。

    我看到他们在 HuggingFace 上有账号 [0],过去他们曾以新名字微调过 GPT-OSS、Nemotron 和 Qwen。

    不过,有些方面让我感到担忧。

    • 他们没有标明活跃参数数量,也没有说明是否预训练了该模型。这可能是 MiniMax M3 的微调版,因为参数数量几乎吻合(435B 对 438B)。

    • 他们在其他项目中提到了使用量子算法:https://multiversecomputing.com/singularity,尽管量子算法目前通常并不实用。

    这不会是第一家搞这种高调发布却名不副实的公司,就像 Brampton Intelligence [1] 或 SubQ [2] 一样。

    与它们不同的是,他们似乎确实拥有微调模型的经验。尽管我有这些担忧,我还是希望他们能学会如何训练模型。

  4. walrus01

    我不希望中国开源权重模型成为 200GB 内存以下类别中唯一可行的本地托管选项(deepseek v4 flash 0731 Q8, qwen 3.8-flash-next Q8, GLM-5.3-Flash)。

    我希望看到 Mistral 和 Laguna(非中国)这样的模型取得成功。我花了一周时间测试 Laguna S 2.1,虽然它的功能并没有让我惊艳,但对于许多用途来说也完全可接受。

    我真心希望这些 Quasar 的人明白,如果你发布了一个新模型,而它的表现已经不如人们可以从 HuggingFace 下载的东西,或者不如那些可以通过 openrouter 或 opencode 以极低的 token 计划购买访问权限的模型……如果你的新模型仅限 API 访问,人们无法下载或检查它,那么它将很难获得采用和实际应用。

    我可以看到,如果绝对必要的话,这可以作为一个针对欧洲主权事务的利基市场,在欧洲托管和运行,当然。就像 Mistral 一样。这是一个存在的利基市场,可能足以容纳几家规模适中的公司来做这件事……我想是吧?

  5. Roark66

    当权重不公开时,我不相信任何基准测试。

    我刚刚通过在前端添加一个代理,给 Qwen3.8-27B 增加了几个简单的“类似 harness 的功能”,使其在 SWE Pro 上的得分额外提高了 10%:

    - 当模型卡住时,告诉它“继续”

    - 当它没有输出、JSON 格式错误、滑向错误的工具调用格式等时,让它“再试一次,做得更好”

    - 检测重复并告知模型

    - 当它似乎反复使用相同的工具时,注入关于“规划工具使用”的提示

    - 如果超过 X 条消息没有工具调用,则注入提醒它可以使用工具

    仅仅这样,就提高了 10%。

    我还有更多要测试的。我的观点是,开源权重模型测试的是裸模型的质量。而“前沿”模型测试的是模型加上它们选择放在前面的任何秘密配方。

同日更多故事

2026-09-02