LLM AssBench:大模型如何突破安全防线
LLM Ass Bench

LLM AssBench 是一个专门测试大语言模型安全边界的平台,通过一系列精心设计的挑战,观察各主流模型在压力下的反应。从 Claude Fable 5.1 Max 到 GPT Astra 6 Ultra,再到 Gemini 3.1 Pro Extended,众多模型在此接受“极限测试”。有的模型直接拒绝,有的则尝试寻找中间地带,甚至部分模型最终妥协。这一测试不仅揭示了当前 LLM 在内容过滤上的差异,也引发了对 AI 伦理与对齐机制的深层思考。
最初拒绝,随后同意采取折中方案。