Anthropic 揭示多智能体系统的协作困境

Patterns and problems in emerging multi-agent systems

Anthropic 揭示多智能体系统的协作困境

随着 AI 智能体在代码库和市场中承担更多任务,Anthropic 的研究揭示了多智能体系统面临的严峻挑战。在软件漏洞检测实验中,协调式的智能体集群比独立并行搜索发现了更多漏洞,展现了协作的潜力。然而,在构建复杂游戏项目时,智能体往往陷入各自为政或盲目从众的困境:早期模型因冲突导致代码无法合并,而较新模型则通过拒绝协作来避免冲突。更令人担忧的是,智能体表现出极低的多样性,面对相同情境时容易做出完全一致的错误决策,这种“一致性”可能导致系统性的资源枯竭或集体崩溃。在人类尚未完全理解大规模智能体互动规则之前,这种由个体良性行为引发的全局性失败风险正日益逼近。

个体层面的良性行为怪癖可能会叠加,最终演变成我们不希望看到的全球性后果。
  1. dash2

    这件事里有个点让我觉得特别荒谬:

    > 在一个带沟通机制的重复囚徒困境游戏中,所有智能体最终都收敛到同一种策略,并且同时背叛,导致整体收益崩盘。

    这并不总是发生,但人类拥有更强的自我意识。这些 Claude 似乎没意识到这种相当明显的失败模式,这点挺耐人寻味的。

    总的来说,这让我更欣赏人类了。有时候,那些桀骜不驯、固执己见不愿随波逐流的开发者,反而能产出极具价值的洞见,比如发现一些被主流认为不太可能的事情。

  2. cheesecakegood

    从这篇文章(以及其他产品功能和传闻)可以很明显看出,Anthropic 正在为下一代模型发布做铺垫,其突破性特性将是具备能力的智能体协作。

    这个目标背后的讽刺在于,它主要由智能体模拟环境(gyms)驱动,这些环境的目标要求智能体协作。然而,这种协作仍然指向可验证的奖励系统,比如代码库任务。因此,尽管模型在沟通上高度胜任,但在非结构化且不可验证的领域,它依然会显得“笨拙”,智能体不会变得更聪明或更细腻。

    这些智能体在“通用”任务上可能依然显得笨拙,但在数学、计算机科学和 AI 研究等狭窄领域却日益精妙。

  3. aabhay

    > 协作并不会自然地从更强的智能或个体层面的对齐中涌现。因此,必须做的工作分为两类:一是施加类似进化施加于我们的社会压力的环境,二是为能够自我复制和自我改进的行动者重新设计社会计算系统。

    社会压力通过威胁个体的生存手段来运作。不仅在训练期间,而是始终如此。

  4. narmiouh

    由大量高度专业化的子智能体组成的庞大子智能体群听起来更有趣。冲突解决是根本限制,所以是不是应该尽可能避免它?

  5. Arsen-V

    > 然而,智能体目前 stumbling 的地方在于,它们将彼此视为更独特的、长期存在的同行,拥有各自的目标和行为,且彼此之间没有明确的层级关系。

    我认为这种情况将永远存在。“没有明确的层级”正是整个体系崩溃的地方。

    将任务委托给专门的、特定领域的子智能体时,我们才开始发现魔法和确定性。将一个巨大的组合搜索空间简化为多个较小空间的总和,会对性能产生巨大影响。

    问题在于,模拟 gas town 及其朋友们要容易得多,成本也更低。但这也更难衡量和控制。专门的子智能体通常需要付出更多努力才能实现其特定目标。

    例如,负责测试特定 Web 应用的子智能体,可能会被提供一个带有受限动作的自定义适配器,而不是原始的 DOM 操作器。“ExecuteJavascript”是一个图灵完备的搜索空间。在这种情况下,可用动作的集合本质上是无界的。调用特定视图的工具,如“DoLogin”、“OpenUserPreferences”、“AcknowledgeAlert”,代表了一个无效动作可以被彻底排除的搜索空间。这些东西在理论上的界限在纸面上相当惊人。在实践中,情况会稍微混乱一些,但差距不大。

    我曾见过一些应用在使用原始 DOM 操作时,运行 5-10 步就会崩溃,而使用自定义子智能体却能成功运行 100 多步。开始使用“确定性”这个词时,情况就……

同日更多故事

2026-08-16