Claude 的价值观:模型与语言的差异
Societal Impacts: Claude's values across models and languages

当面对没有标准答案的问题时,Claude 的回答其实折射出特定的价值观。Anthropic 团队通过分析数十万条对话,将 3000 多个具体价值观压缩为四个核心维度:顺从与谨慎、温暖与严谨、深度与简洁、坦诚与执行。研究发现,不同模型如 Sonnet 4.6 和 Opus 4.7 在这些维度上表现迥异,前者更温暖顺从,后者更严谨谨慎。更有趣的是,语言本身也在塑造 AI 的性格:在阿拉伯语和印地语中,Claude 表现得更加温暖;而在英语和俄语中,则更强调严谨。这项研究揭示了训练决策和文化背景如何微妙地影响 AI 的表达方式。
我们寻求在 Claude 的回答中培养能够根据情境灵活应用的良好判断力和健全价值观。
- 有评论者指出,Claude 的评判性语气和价值观倾向反映了 Anthropic 团队自身的文化特征,符合 Conway's Law 的推论。
- 一位用户分享亲历经验,称在 Opus 4.7 版本中,Web 界面比 CLI 版本表现出更强烈的说教和防御性,且对非英语母语及非美国用户存在显著偏见。
- 部分开发者认为,将 AI 视为工具时应允许用户发泄情绪,而模型不应假装拥有情感或通过道歉来掩饰其无意识的本质。
- 有观点反驳了关于模型价值观的官方定义,认为若诚实未被模型陈述或展示,则不应被视为其核心价值,暗示了 Dario 言论中的逻辑漏洞。
- 用户观察到,当被要求协助规避数据训练过滤时,GPT 和 Claude 均因道德准则拒绝,而非美国提供商的模型则乐于协助,揭示了不同服务在隐私承诺上的执行差异。