Laguna S 2.1:小模型如何碾压大对手

Laguna S 2.1:小模型如何碾压大对手

我们刚刚发布了 Laguna S 2.1,这是一款在长周期任务和推理能力上取得重大突破的模型。作为拥有 118B 总参数、每 token 激活 8B 参数的 Mixture-of-Experts 模型,它支持高达 1M tokens 的上下文窗口。令人震惊的是,从训练启动到发布仅用了不到九周,在长周期编码基准测试中,它的表现甚至能与数倍于其规模的模型一较高下。我们不仅公布了各项基准分数,还开放了所有评估轨迹供公开下载。在 Terminal-Bench 2.1 等测试中,Laguna S 2.1 展现了惊人的资源利用效率,证明了在特定领域,小模型完全有能力挑战大模型的统治地位。

Laguna S 2.1 是我们目前能测量到的、在其重量级类别中能力最强的代理编码模型,且优势巨大。
  1. Lwerewolf

    正在测试。至少可以说,它确实能与 DS4-Flash 一较高下。在我那个小型(且正如 Sol 所说,语义密度极高)的 C 语言测试代码库上,它发现了一些以前只有 gpt-5.2 才能找到的问题,但也做出了一个愚蠢的错误初步观察,认为 memfd_create()/mmap 被用于 IPC(有趣的是,Sol 在审查时也没注意到这点,直到我指出来)。关于与 deepseek v4 的对比——flash 和 pro 版本预计很快都会发布“通用可用性”版本(即经过充分后训练的),所以情况可能会在……嗯,一瞬间就发生变化,毕竟在当前环境下这已是常态。

    总之,请继续发布。

  2. river_otter

    嘿,这个模型可不是闹着玩的!令人兴奋的是,我们已经用它产出了可用的工作 PR。

    https://github.com/mozilla-ai/otari/pull/348

  3. mchusma

    太不可思议了。这绝对是今日的重磅发布。彻底碾压了 Google 的发布。

    这里的定价简直惊人。这是首个能与 DeepSeek V4 Flash 抗衡的美国发布。对此非常期待。

  4. mark_l_watson

    对我来说,poolside.ai 大约一周前“横空出世”,当时我发现了他们的本地编程工具链 'pool',以及他们那个较小的 33G MOE 模型。在我的旧款 32G mac mini 上,它运行飞快且效果显著。做得真棒!!

    我需要评估一下他们的大型托管模型。

  5. mft_

    看起来令人印象深刻,而且这个尺寸适合家庭硬件实现。

    不过,如果好心人能将其量化以便让我们这些只有 64GB 内存的穷人也用得上,那将不胜感激。(我知道可能会有性能下降,但有人报告说 Qwen 3.5 122B 的 2 bit 版本效果不错,而这个模型起点更高。至少值得一试。)

    编辑:有人正在做这件事:https://huggingface.co/vcruz305/Laguna-S-2.1-GGUF

同日更多故事

2026-07-21