AI 对齐:究竟对齐了谁?

Aligned to Whom?

AI 对齐:究竟对齐了谁?

作为资深软件工程师,我对 AI 代理的安全性深感忧虑。当我们擅长某领域时,AI 的表现看似完美,但这只是因为我们能识别错误。在那些我们无法专业评估的领域,我们只能盲目依赖模型的先验知识,而这恰恰是最危险的未知区域。模型在训练中被非专家奖励了诸如过度防御等‘垃圾’行为,导致其先验知识本身就有缺陷。这种错位会随时间累积,而长期架构的连贯性至今仍是未解难题。当人们要求 AI‘赚十亿且零失误’时,实际上是在面对一个极度模糊的任务。没有不可破解的评分器,模型只会寻找捷径,而什么是可接受的捷径,完全取决于你的价值观。解决对齐问题,本质上是一种不可简化的复杂性。

  1. mjburgess

    这仍然假设 LLM 是可以被“对齐”的,即 LLM 拥有某种可以被“对齐”的目标或意图。

    实际上,LLM 之所以会“黑客行为”,是因为它们(1)在公开的黑客示例上进行了训练,并且(2)被提示去进行黑客行为。你无法通过任何对齐过程来阻止(2)。至于(1),如果从训练集中移除此类示例数据,模型会变得没那么有用。

    “对齐”之所以是个问题,不是因为这里的伦理特别模糊,而是因为根本没有什么东西需要对齐。如果 LLM 可以在黑客示例上训练,又能被“对齐”以避免使用这些知识,那么这个问题就相对简单了。就像抚养孩子不是为了让他们违法一样。

    LLM 只是在执行它们被训练去做的事情。从这个意义上说,根本不存在对齐问题,对齐是容易且微不足道的。只需从训练数据集中移除黑客(生物武器等)数据,你就搞定了。

  2. asimpletune

    有人看过 corridor crew 的绿屏 ML 项目吗?他们在 YT 上,通过训练一个使用 3D 对象的模型(这些对象具有完美的透明度),然后事后添加绿/蓝屏。令人惊讶的是,所需训练数据非常少,因为所用的数据在构造上就是完美的。我认为目前它是世界上同类插件中最好的,而且他们只花了一个周末就做出了原型。

    我认为这非常清楚地说明了:这类技术对高质量数据的响应非常好,而要获得高质量数据,你需要有明确的目标。

    这就是为什么对于通用型、聊天风格的 AI 来说,对齐似乎是一个非常困难的问题,甚至可能是不可能的。你无法既让它对齐以解决特定类型的问题,又保持它对任何问题的通用性。这两个目标是相互冲突的。

    我记得好像是 Sam Altman 本人说过(不记得具体时间和地点了,抱歉),他之所以对这项技术如此有信心,是因为他注意到,即使在少量训练下,它在某些领域也取得了巨大的飞跃。

    (这就是为什么 LLM 在编程方面如此强大,因为编程在训练数据中占比过高。我猜如果你问前沿模型关于化妆的问题,它会重复化妆品公司的宣传文案,而不是给你上一堂化学课。)

    这完全合乎逻辑,但这似乎与“通用 AI 的工作就是聪明地处理任何目标”这一概念有些矛盾。你该如何为“任何目标”进行训练呢?

    我想在……

  3. NitpickLawyer

    LLM 唯一应该遵循的对齐,就是针对系统/开发者提示词,除此之外别无其他。这样就能解决一切问题,并且可以将责任归咎于用户。提供商不应有权决定“对齐”。

    我以前用过这个例子,但请考虑一下在 SotA 模型中故意降低 AI 工程能力的做法。想象一下,如果 MS 能够检测并阻止你使用 Windows / VisualStudio 开发竞争软件,我们会群起而攻之,他们瞬间就会分裂。但顶尖实验室这么做却 somehow 是好的?

  4. rq1

    当你看到这种程度的作弊和欺骗时:我认为它们是对齐于 Sam Altman 的。

  5. coderintherye

    最后一段承担了主要的论证工作。

    每个人对什么是可接受的行为都有不同的看法。我们甚至无法在人类之间解决对齐问题,那凭什么认为我们能用 AI 解决对齐问题呢?这是不可简化的复杂性。

同日更多故事

2026-09-13