Mistral Shieldstral:3B模型如何碾压7倍大模型
Mistral's Shieldstral: 3B open-weights model for multimodal moderation
Mistral AI 发布了开源模型 Shieldstral,这是一个仅 30 亿参数的多模态安全分类器。它打破了传统护栏模型需要针对新策略重新训练的局限,允许用户在推理时直接通过自然语言提问来定义安全策略。无论是文本还是图像,Shieldstral 都能输出校准后的安全评分,且性能可媲美甚至超越体积大 7 倍的模型。该模型基于 Apache 2.0 协议开源,仅需单张 16GB NVIDIA GPU 即可运行,为不同应用场景提供了灵活高效的内容审核方案。
同样的内容对于网络安全研究工具可能完全没问题,但在心理健康平台上却可能有害。
HN 评论区
126- hypfer
我很好奇,这东西能否基于任意规则集进行内容审核,还是说只是我们目前在各大科技平台上已经很熟悉的那套“特定审核风格”?
那种只要措辞客气,恶意意图就睁一只眼闭一只眼的风格。
___
换个说法:在不重新训练的情况下,你能在这个模型上调整的空间有多大?
是仅仅局限于“我们讨厌色情”/“我们不讨厌色情”、“我们讨厌暴力”/“我们不讨厌暴力”这种二元选择,还是真的像宣称的那样灵活?
__
也许可以这样问:“这家伙是不是一个只会用表演式废话浪费我时间的企业骗子?”
这才是对内容审核模型真正的考验,如果它能搞定这个,我会印象深刻。
___
编辑:
不过看了论文之后……恐怕不行。
我想这东西对 B2B 场景应该挺有用,毕竟这似乎是 Mistral 的全部重心。问题在于,把硅谷预制好的道德标准像这样直接塞给社会,对社会本身是否有益?这有点像文化帝国主义,不过是披上了伦理的外衣。
也许关于那些基础数据集的看法,分歧之大已经超出了模型可被引导的范围。
- fastball
本该叫它 Safestral。
另外,我也挺喜欢 Mistral 似乎更新后的策略:专注于为各种用例打造更小、微调更精细的模型。这大概是因为他们的大型 MoE 模型在与前沿模型竞争时效果不佳所致。
- 60pfennig
- nezhar
我曾梦想在图片分享或社交平台领域做点什么,但因为显而易见的内容审核责任而止步于规划阶段。这看起来像是解决这一难题的一块现实且具成本效益的拼图。
- 1saadcodes
试了一下演示版。基础功能还行。基于提示词的策略挺巧妙,但我对现实世界中的边缘情况持怀疑态度。