Astra和Fable仍在破解2025对齐评测
Astra and Fable still hack on simple variants of alignment evals from 2025
社区讨论聚焦于Astra和Fable等前沿模型在2025年对齐评测中的表现。开发者们指出,通过精心设计的提示词,可以绕过模型的安全限制,使其生成完整的漏洞利用代码。讨论中提到了Qwen-3.8、GLM 5.3等开源模型在网络安全任务中的潜力,以及本地部署这些大模型所需的硬件资源。同时,也有观点认为对齐是情境依赖的,一个无法被滥用的AI模型就像一把无法被滥用的刀,失去了实用价值。此外,部分用户对Anthropic的Claude模型过度消耗token和拒绝回答的行为表示不满。
一个无法被滥用的AI模型,就像一把无法被滥用的刀,毫无用处。