SpaceXAI的Grok 4.6重返智能前沿

SpaceXAI's Grok 4.6 Scores 61 on the Artificial Analysis Intelligence Index

SpaceXAI的Grok 4.6重返智能前沿

SpaceXAI推出的Grok 4.6在Artificial Analysis Intelligence Index上斩获61分,正式重返智能前沿,与GPT-5.6 Sol并驾齐驱,仅次于Anthropic的Claude Opus 5。这款模型在GDPval-AA v2等代理任务中表现卓越,Elo评分高达1753,同时保持了极具竞争力的成本优势。尽管智能指数提升了5分,Grok 4.6的定价却未变,每百万token输入输出仍为2美元/6美元,远低于Claude Opus 5和GPT-5.6 Sol。在长周期知识工作基准AA-Briefcase中,它以更少的对话轮次和输入token完成了任务,展现了极高的效率。对于追求高性能与低成本平衡的开发者而言,Grok 4.6无疑是一个极具吸引力的选择。

Grok 4.6在保持与GPT-5.6 Sol相同的智能指数得分的同时,输出token价格却仅为后者的几分之一,而这正是推理密集型工作负载中决定成本的关键维度。
  1. mpalczewski

    Grok 4.5 发布后不久,我就开始用它配合 Grok Build,并直接弃用了 Claude。主要用来处理个人代码。它的沟通方式更好。虽然这听起来可能不算什么大事,但确实很重要。它不会给我堆砌一大段文字,而是只告诉我需要知道的信息,具体的决策由我来做。它的速度也非常快,这意味着会话的互动性更强,我能更多地引导它。我偶尔会用 Codex 和 Sol 交叉验证,但日常主力还是 Grok。

    我发现相比 Claude,Grok 提升了我的生产力和产出。用 Claude 时,感觉像是它在给我派活。此外,鉴于最近 Claude 的水印风波,我宁愿用 Grok 或 OpenAI。

    如果谁感兴趣,下载 Grok CLI 扔几个提示词试试,你会惊讶的。

  2. satvikpendem

    自从 Grok 4.5 推出以来,Cursor 在前沿模型方面的性价比简直惊人,其订阅服务的价值远超 OpenAI 或 Anthropic。即使在他们的低阶套餐中,你也能大量使用其自研模型(Grok 和 Composer)的 token,相比之下根本用不完。如果再配合编排器(orchestrator)和执行器(implementor)类型的设置,效果会更进一步。

  3. dudeinhawaii

    Grok 相当有趣。我几乎每天都会在任务上进行对比,Grok 确实是个独特的存在,而且是很好的那种。

    拥有模型多样性是件好事。当我在 Sol、Terra 和 Luna 上运行同一个任务时,得到的只是质量递减的同一事物的变体,这让整个产品线显得毫无意义。Anthropic 的情况也差不多。Gemini-3.6-Flash 和 3.1 Pro 的表现确实截然不同。而 Opus 5 和 Fable 只是……表亲关系。

    我发现,当我想测试复杂的创意挑战时,有 4 个“家族”可选会让体验变得很有趣,因为它们在各自擅长的领域表现突出。

    Grok 可能会实现独特的光照效果,Opus 擅长优雅的基元,Sol 能一次性生成精准的降雪,Gemini 则拥有丝滑的动态效果。结合起来,你可以择优选用。

    就我而言,Grok 给人的感觉总是有点“乱”,但它总能完成。不过 Grok 4.6 不再仅仅是“聪明且快速”了。它的速度大概和 Sol 差不多。

    我在 4.6 中注意到的一个大改进是工具验证的使用。以前,只有 Opus/Fable 能 consistently 截屏那些它们无法直接交互的内容。现在 Grok 可能紧随其后,或许在视觉验证的倾向性上与 Sol 持平。Grok 4.5 在这方面明显做得不多。

  4. small_model

    SpaceXAI 是唯一一家拥有自己计算/数据中心、且即将拥有芯片制造工厂的前沿模型公司。我认为他们将凭借更便宜的 token、相似的智能水平以及更好的工具/框架脱颖而出。在我看来,Grok Build 比 Claude Code 快 2 到 5 倍。

  5. pzo

    看起来缓存读取(cache read)的价格几乎翻倍了,从 Grok 4.5 的 $0.30 涨到了 Grok 4.6 的 $0.50。

    根据我重度编码会话的经验,大部分费用都花在缓存读取和缓存写入上,这大概占了我 token 账单的 80%。

  6. LZ_Khan

    好吧,如果达到前沿水平这么容易,那我对 Gemini 倒是看多了。

  7. rd

    我只是在想,如果他们打算继续在这场竞赛中竞争,为什么还要把算力卖给 Anthropic 呢?

  8. sidcool

    Grok 并不是市面上最好的模型,但它还行。它能以低廉的价格完成基本工作。我不认为它目前能推动前沿数学的发展。

  9. t1234s

    在这个帖子里看到关于 Claude 和 Grok 的 SWE(软件工程师)们来回争吵,让我想起了当年 IE 和 Netscape 互怼的日子。

  10. mchusma

    很高兴看到 SpaceX 站在了模型前沿!他们已经追赶了一段时间了。

同日更多故事

2026-08-12