Anthropic 2026 风险报告:AI 失控真相
Anthropic Risk August 2026 [pdf]
Anthropic 发布了 2026 年 8 月的风险评估报告,深入剖析了 AI 系统可能引发的灾难性风险。报告聚焦于高风险场景下的对齐失败、自动化研发加速以及生物化学武器生产等核心威胁模型。我们详细评估了 Mythos 5、Fable 5 等前沿模型的能力边界,并披露了内部监控机制与防御措施的局限性。尽管 Anthropic 认为已知风险可控,但报告也坦诚了未知严重普遍性对齐失败的可能性,以及安全流程中曾出现的真实漏洞。这份 186 页的文档不仅是技术复盘,更是对未来 AI 安全治理路径的深刻反思。
我们不仅讨论与灾难性风险相关的 AI 模型属性,还深入分析包括安全控制和部署保障措施在内的风险缓解措施属性。
HN 评论区
56- datadrivenangel
“我们相信,内部 AI 研发工作在有 AI 协助的情况下,速度显著快于没有 AI 协助时,但尚未达到两倍的提升(尽管我们对此尚不确定,且难以精确测量)”
看来 Anthropic 认为 AI 并没有让他们的生产力翻倍。这是个有趣的数据点。
- modeless
也就是说,就在一个月前,他们内部最好的模型仅比 Mythos“稍微强一点”,但“并没有展现出从 Claude Opus 4.6 到 Mythos Preview 那样明显的性能飞跃”。我以为 Mythos 训练结束五个月后,他们应该已经拥有显著更强的模型了。他们最好现在就有了,否则中国竞争对手追赶的速度比我想象的还要快。
- internetter
“我们系统中所有用于收集人类反馈数据的流量——即承包商评估我们模型的流量——都未经生物分类器拦截”
“总计约 1.33 亿次交互。”
虽然这次事件最终结果相对良性,但我仍然感到担忧,尤其是在多次发生沙箱逃逸,以及此前未发布模型可通过自定义 URL 访问的背景下。我认为这些公司并没有充分重视自身所承担的责任。还有多少类似的问题存在?
- 12ahGA
AI 公司正像 Steve Bannon 那样“淹没舆论场”。让人根本没有时间形成自己的观点。
- _ache_
Anthropic 大谈特谈他们的“通用人工智能(AGI)风险”,却对破产风险避而不谈,这真是疯了。