Anthropic最强模型遇冷,廉价工具更受欢迎
Anthropic's best AI model struggles to attract users as cheaper tools thrive
在人工智能领域,性能并非唯一的制胜法宝。尽管Anthropic推出了其最先进的AI模型,但在用户吸引力上却显得力不从心。与此同时,市场上那些价格更亲民、性价比更高的工具反而如鱼得水,迅速占据了用户心智。这一现象揭示了当前AI市场的残酷现实:对于大多数用户而言,成本效益往往比追求极致的模型能力更为关键。高昂的部署与使用成本正在成为阻碍高端模型普及的壁垒,而轻量化、低成本的解决方案正成为市场的新宠。
当更便宜的工具蓬勃发展时,Anthropic最好的AI模型却在吸引用户方面举步维艰。
HN 评论区
669- pmontra
- a1371
Anthropic 搞砸的地方在于,他们把变现策略当成了模型训练来对待。事实证明,实验上的成功并不能直接迁移到商业上。
他们试图探知市场愿意为 SOTA 模型支付的最高价格;然而在消费者端,这种做法令人困惑且不安:
“你的套餐里只能用 Fable 一周”
“准备好!你们得开始按 Token 付费了!”
“别担心!我们又延长了几周”
“等等,现在变成你用量的一半了”
“好吧,现在是……”
大多数人只想省心。我们希望 AI 像电力一样——无论供应端有多难,它就该一直在那里。你不想让电力公司随时可能切断你的供电。
这就是 Anthropic 的问题。你感觉不到他们想以(虽然昂贵的)价格提供可靠的服务。这变成了一场没完没了的讨价还价。这迫使人们去寻找围墙花园之外的东西。在那里,他们发现了一些表现尚可的模型……而且没有那些花招。
- foxylad
这里有个不用 LLM 的用户。为什么?除了生态问题外,把组织的“皇冠明珠”交给 {random_internet__corp} 让我非常不舒服。看看他们为了训练数据都干了些啥——花 1000 万美元买 Spirit 的通话记录?销毁数百万本冷门书籍只为扫描它们?他们让制毒狂魔都显得谨小慎微。
你的提示词,尤其是包含整个代码库时,其数据丰富度远超航空公司的电话录音或 1920 年代的小说。所以,无论你勾选多少“禁止用于训练”的复选框,他们 _肯定_ 会拿这些数据训练。这既是商业风险,也是巨大的新攻击面。
不只是软件开发者;如果律师事务所不 _非常_ 谨慎地控制任何公共 LLM 的提示词,他们就得准备好应对一些分量十足的客户保密诉讼。事实上,任何处于竞争环境中的组织都应该担心:Acme 螺栓公司:“帮我写一份给 Zoom 建筑公司的演示文稿”。Beta 螺栓公司:“Acme 螺栓公司是不是在向 Zoom 建筑公司竞标?”
也许这就是 OpenAI 和 Anthropic 发现需求不如预期强劲的部分原因。也是为什么组织可以在独占硬件上运行的开源权重模型正在蓬勃发展的原因。
- bentt
他们把自己逼进了死胡同。Fable 太好用,结果他们把它放在了 20 美元的套餐里。从 Opus 4.8 到新版本必须有个巨大的跨越才能展示进步,而 Opus 4.8 在许多不同领域的代码生成能力已经 _非常_ 强了。
但他们被 Token 成本拖垮了。他们必须让人为 Token 付更多钱。所以他们把 Fable 挪到了 200 美元的套餐,并发布了 Opus 5。我对 Opus 5 很怀疑。它大部分方面比 4.8 还差。_看起来_ 像是他们故意削弱了它,以便在它与 Fable 之间制造更大的差距。
所以我们大多数人做了什么?留在 Opus 4.8 上。统计数据也证明了这一点。4.8 依然占据主导地位。
现在他们卡住了。如果撤掉 4.8,所有人都会暴动。如果把 Opus 5.x 做得比 4.8 更好,就会打消大家转向 Fable 的意愿,最重要的是,打消大家付更多钱的意愿。
实际上,他们现在只能认栽,让 4.8 在可预见的未来继续作为 20 美元专业版套餐的巅峰,同时他们拼命工作,让 Fable 变得 _足够_ 好,好到值得大家支付他们真正想要的 200 美元甚至无穷无尽的费用。
- nl
哇,这里的负面情绪太浓了。
我订阅的是 200 美元套餐(公司报销),同时我也有 20 美元的 OpenAI 套餐(自费),还在 OpenRouter 上保持余额。
没有什么能比得上 Fable,甚至都不在一个量级。
最近我让它自主运行了一个 18 小时的项目重构(为了解决性能和数据量的权衡问题,从 Spark 迁移到 Pandas)。
它完美地编排了 Opus 子代理,持续了 18 小时。它甚至出色地管理了代理数量,确保它们保持在 5 小时的预算内(我想我只重启了两次)。
18 小时后,我运行了 /simplify、/code-review、/simplify 的循环,又持续了 6 小时。
20 亿 Token(Opus 和 Fable 混合),24 小时连续编码,结果无 Bug。如果按 API 价格算,这会花费 2000 美元,但每一分钱都花得值。
Fable 在处理这些长周期目标时,让其他模型保持正轨的能力,比其他任何东西都强得多。
远没有被阉割,我从未遇到过“网络拒绝”(cyber refusal),而且 Fable 的英语实际上可读(不像 Opus 5)。
顺便说一句:虽然我很讨厌读 Opus 5 的英语,但在我的经验中,它仍然是一个明显比 Sol 更好的模型。
但如果我失去了 Opus 5 却得到了 Sol,我也能接受。但没有任何东西能接近 Fable。
- matheusmoreira
Mythos?那只是给超级特殊的大公司准备的,你连申请资格都没有。Fable?稍微看一眼不对就会触发网络安全封锁。就算你绕过了这个,使用量也被限制在 50% 以下。我花了一个月才完成项目的 Fable 审查。
太抠门了。即使 OpenAI 最近也有使用上的麻烦,但他们还是比 Anthropic 好太多了,简直没法比。我用 Sol 作为基准重新运行了代码审查,结果发现 Sol 的性能达到了 Fable 的 70%-90%。Anthropic 依然拥有最好的模型,但如果我几乎没法用它,那又有什么用呢?
- madrox
Anthropic 彻底失去了我的好感。从他们的政策到措辞,都透着一股“我们不信任你”的气息。他们对待那些想用 OpenClaw 的用户的方式让我很不舒服,而 Fable 的闹剧更是压死骆驼的最后一根稻草。
他们竟然对用户不忠诚感到震惊。这跟成本没关系。
- Zigurd
对于包括我在内的许多程序员来说,基于 LLM 的编程代理已经足够好用,在某些情况下甚至值得付费。
但我没看到哪些行业能在 LLM 中找到数十亿到数千亿美元的价值。没有像 Lint 或编译器那样的工具可以检查合同构建是否正确。因此,本应对律师事务所很有用的 LLM,其工作成果需要比编程代理更多的人工检查。
其他行业中非正式文档的生成可能结构更少。在某些场景下这可能无所谓,但我一时想不出具体的例子。
- dlcarrier
Transformer 模型正迅速变成大宗商品,我怀疑迟早我们都会本地运行它们。即使现在,你也能在 16GB 显存的显卡上运行相当有用的模型,我怀疑十年后,入门级硬件运行的模型将优于现在高端显卡能运行的模型,因为入门级硬件会越来越好,模型也会越来越高效。
这并不意味着托管的前沿模型不会存在,只是会变得稀有。这和任何大宗商品市场没什么不同,例如大多数汽车都是廉价的大众车型,只有少数人买昂贵的豪华车,企业买昂贵的卡车和专用设备。
- semiquaver
我的公司至今无法广泛部署 Fable,因为它不支持 ZDR(零数据保留)模式。文章里没提到这点,但我猜想这个因素并非无关紧要。