MIT 新算法让 AI 在模拟中严守安全红线
MIT creates method to force AI to comply with safety rules
MIT 团队推出名为 HardFlow 的新算法,旨在解决生成式 AI 在安全关键场景下的合规难题。传统方法往往在生成的每一步都强制约束,限制了模型的探索能力;而 HardFlow 创新地将约束检查推迟到生成的最后一步。在机器人避障、迷宫导航等四项纯模拟测试中,HardFlow 不仅每次都完美满足硬性规则,还输出了比现有方法更优的结果,且无需重新训练模型。不过,目前所有成果均基于模拟环境,尚未在真实硬件上验证,也未见独立实验室复现。这项技术为未来在保留 AI 创造力的同时确保绝对安全提供了新思路,但距离实际应用仍有距离。
生成式 AI 的承诺在于其探索丰富可能性的能力,但现实世界为哪些可能性可被接受划定了边界。我们的方法让我们在保留这种生成能力的同时,强制执行高风险或安全关键应用中不可协商的要求。
HN 评论区
28- mixdup
这看起来简直是显而易见的。与其让模型拥有不受限制的“物理”行动能力,然后寄希望于能在认知层面控制它,不如让 AI 随心所欲地行动,但它对工具的访问必须经过一套硬编码的规则,这套规则不容许任何模糊的解读。
当然,这取决于是否存在无法被绕过的控制机制,而这本身就是一个巨大的假设。
- Mr_P
如果你点进论文看看,会发现它和这篇 HN 帖子的标题所暗示的内容几乎毫无关系。
- petcat
“对于约束满足问题,最终重要的是模型的输出结果,因为内部过程会被丢弃。通过不要求每个中间步骤都满足约束,我们赋予了模型更多的自由度,去寻找最终依然可行的高质量解决方案。”
我(也许有点天真)的问题是,如果我们只检查最终结果,是不是已经太晚了,安全规则可能已经被不可逆地违反了?文中举了机械臂在避开障碍物的同时寻找最短路径的例子,但如果我们只在最后检查正确性,那它岂不是可能已经撞上了障碍物?