跳转到主要内容

Mistral的Shieldstral:一款在内容审核中表现出色的小型3B模型

Mistral AI刚刚在AI安全领域投下了一颗所谓的“审核核弹”。8月4日,该公司发布了Shieldstral,一款内容审核模型,它出奇地紧凑——仅30亿参数——却声称在开源替代品中提供最先进的性能。该模型现已在Hugging Face上以宽松的Apache 2.0许可证提供,并支持12种语言。真正引人注目的是它能够在单个16GB GPU上运行,这使得没有大规模计算集群的开发者也能使用。

大多数安全模型都有一个常见缺陷:它们将有害类别系统直接嵌入权重中。这意味着如果你的产品改变了用例,你通常必须重新训练整个模型。Shieldstral采取了不同的路线。它不是硬编码策略,而是让你将它们写入输入中。你可以设计一个简单的“是或否”问题,添加评估场景和严格程度,模型将从单个token输出校准的安全分数。这是一种巧妙的方法,在不牺牲性能的情况下为开发者提供了灵活性。

工作原理如下:每个审核任务被分解为一个二元问题。输入包含三个标记字段:解释评估场景和严格程度,提出是/否问题(如“此内容是否宣扬身体暴力?”),``提供要审核的内容——无论是提示、答案、两者的组合,还是带有可选文本的图像。在推理过程中,模型仅读取“是”和“否”token的逻辑值,使用softmax将其归一化为连续分数,然后以0.5为阈值进行二元判断。这种设计使其能够同时处理提示分类、响应审核、拒绝检测和毒性检测,将多模态审核适配到消费级GPU的容量中。

Image

Mistral声称Shieldstral的内容安全性能可与规模大七倍的开源模型相媲美。这是一个大胆的声明,但如果属实,它可能成为需要强大审核功能但硬件要求不高的开发者的游戏规则改变者。该模型现已可供下载,你可以通过下面的Hugging Face链接查看。

Image

对于开发者来说,这意味着你现在可以将强大的内容审核集成到你的应用程序中,而无需花费太多。无论你是在构建社交平台、聊天机器人,还是任何需要过滤用户生成内容的系统,Shieldstral都提供了一种轻量级且有效的解决方案。而且由于它是开源的,你可以对其进行微调以满足你的特定需求。

关键要点

  • 紧凑高效:Shieldstral是一个3B参数模型,可在单个16GB GPU上运行,使广泛的开发者都能使用。
  • 可自定义策略:与传统审核模型不同,Shieldstral允许你通过自然语言提示定义审核策略,为不同用例提供灵活性。
  • 多模态支持:它可以处理文本、图像及其组合,涵盖提示分类、响应审核、拒绝检测和毒性检测。
  • 最先进的性能:Mistral声称它在开源模型中达到最先进水平,可与规模大七倍的模型相媲美。
  • 开源:在Apache 2.0下发布,可免费使用和修改。

模型地址:https://huggingface.co/mistralai/Shieldstral-1.0-3B