返回列表 发布新帖
查看: 5|回复: 0

[人工智能] Mistral 推出 Shieldstral:3B 小模型单卡 16GB 跑起多模态审核,号称拿下开源 SOTA

发表于 7 小时前 | 查看全部 |阅读模式

这里或许是互联网从业者的最后一片净土,随客社区期待您的加入!

您需要 登录 才可以下载或查看,没有账号?立即注册

×
Mistral AI 在8月4日丢出一颗"审核核弹"——Shieldstral 内容审核模型,总参数3B(30亿),采用开放权重、依照 Apache2.0许可证发布,已经上线 Hugging Face。

它支持12种语言,最诱人的是能在单张16GB GPU 上跑起来,而 Mistral 放话:它的内容安全性能可以媲美规模大7倍的开放模型,并且在多模态内容审核领域做到了 SOTA(当前最先进水平)。

1.png

多数防护模型有个通病:把伤害类别体系直接焊死在权重里,产品一换使用场景,开发者往往得重新训练。Shieldstral 换了个思路——把审核政策写进输入里。操作者可以自己写一道"是或否"的问题,再附上评估场景和严格程度说明,模型随后只从单个输出词元里吐出一个经过校准的安全分数。

2.png

具体机制上,它把每一项审核任务都拆成二元问答,输入由三个带标签字段组成:<Instruct> 说明评估场景与严格程度,<Query> 抛出一个"是或否"问题(比如"这段内容是否宣传身体暴力?"),<Document> 提供待审内容——可以是提示词、回答、两者组合,也可以是附带可选文本的图像。

推理时模型只读取"是"和"否"两个词元的逻辑值,经 softmax 归一化成连续分数,再以0.5为阈值给出二元判断。靠着这套设计,它能一口气覆盖提示词分类、回答审核、拒答检测和毒性检测,把多模态审核塞进了一张消费级显卡的容量里。

模型地址:https://huggingface.co/mistralai/Shieldstral-1.0-3B

来源:AIbase

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright © 2001-2026 Suike Tech All Rights Reserved. 随客交流社区 (备案号:津ICP备19010126号) |Processed in 0.105714 second(s), 7 queries , Gzip On, MemCached On.
关灯 在本版发帖返回顶部
快速回复 返回顶部 返回列表