Shieldstral
Mistral AI开源的3B多模态内容安全分类模型,审核策略可用自然语言实时定义
标签:AI多模态大模型AI审核 Mistral AI Shieldstral 内容安全 多模态模型 开源模型大模型API全网最稳定的官方企业级渠道Shieldstral官网
Shieldstral 是 Mistral AI 开源的多模态内容安全分类模型,参数规模 3B,基于 Ministral-3B 微调而来。它跟传统审核模型最大的不同在于:不再把内容安全当成一个固定类别的分类题,而是改成”是/否”的二元问答。你用自然语言描述一条审核规则,模型当场就能按这条规则判断,不用重新训练。
这套做法让审核策略从模型权重里”解耦”出来,变成可随时改写的配置。官方给出的成绩是文本安全基准平均 F1 84.9%、多模态安全 F1 83.8%,两项都是同级 SOTA,而运行只要一张 16GB 显存的 GPU,支持 12 种语言。

主要功能
- 策略自适应审核:把安全政策写成自然语言问题丢给模型,不同业务线各用各的尺度,实时生效。
- 多模态统一检测:纯文本、图片、图文混排都走同一个接口,不用分别接三套模型。
- 细粒度违规识别:从粗粒度的”违规/不违规”一直细到 73 个叶子类别,颗粒度按需取用。
- 可校准的安全评分:输出的是 0 到 1 的连续分数而非硬标签,默认 0.5 为界,阈值自己定。
- 轻量部署:3B 参数单卡 16GB 显存跑得动,中小团队也能私有化。
技术上,Shieldstral 把审核转成对 “yes” / “no” 两个词元的 logits 预测,softmax 归一化后得到连续分数。输入采用三段式结构:<Instruct> 说明场景与严格程度,<Query> 放具体的是非问题,<Document> 装待审内容。训练用了 5410 万样本(4520 万开源文本、440 万合成对比文本、450 万多模态),靠”同内容不同提问”的对比配对来逼模型分清相近类别,最后用 LoRA 微调加 SLERP 球面插值合并两个互补检查点。
如何使用Shieldstral
- 准备环境:一张 16GB 以上显存的 NVIDIA 显卡,装好推理框架,从 HuggingFace 拉模型权重。
- 定义审核策略:在
<Instruct>里写清楚业务场景、领域背景和松紧程度。 - 编写安全查询:
<Query>写成一句是非问句,比如”这段内容是否宣扬身体暴力”。 - 提交待审内容:文本、图片或图文组合放进
<Document>。 - 读取判定结果:拿到归一化分数后,按自己业务的容忍度设阈值即可。
使用场景
- 社交平台风控:图文帖子实时过审,不同社区可以套不同的合规口径。
- AI 对话安全:既拦用户提示词里的越狱攻击,也查模型输出有没有有害或偏见内容。
- 广告素材合规:投放前自动扫一遍图文素材,避免跨平台踩线。
- 在线教育内容过滤:筛掉课程资料和互动区里的不当信息。
- 企业文档审计:内部共享的多语言文件做敏感信息与违规内容检测。
产品价格与版本
Shieldstral 完全开源,采用 Apache 2.0 协议,权重和推理代码都能免费下载、商用。当前发布的是 Shieldstral-1.0-3B,可在 HuggingFace 直接获取。相较同类的 OmniGuard(7B、偏商业授权、固定分类体系),Shieldstral 用不到一半的参数拿到更高的多模态 F1(83.8% 对 77.6%),部署门槛也低得多——真实成本主要是那张 16GB 显卡。
常见问题解答
- Shieldstral 和普通的内容审核模型差别在哪?
- 普通审核模型的类别体系是固化在权重里的,加一个新违规类型就得重新训练。Shieldstral 把策略外置成自然语言问句,改规则等于改一行 prompt。
- 3B 的小模型,效果够用吗?
- 官方基准里它的文本 F1 84.9%、多模态 F1 83.8%,都达到了同级 SOTA,多模态一项还超过了 7B 的 OmniGuard。对多数内容风控场景是够的,极端边缘案例仍建议配人工复审。
- 可以商用吗?中文支持怎么样?
- Apache 2.0 协议允许商用。模型支持 12 种语言,中文在内,但具体到垂直领域的黑话识别,建议先用自己的样本跑一轮评测再上线。
官网网址
项目官网:https://mistral.ai/news/shieldstral/
HuggingFace 模型库:https://huggingface.co/mistralai/Shieldstral-1.0-3B
arXiv 技术论文:https://arxiv.org/pdf/2607.25857
OpenI AI时代点评
内容安全这块长期存在一个尴尬:模型训得越准,越是被锁死在训练时定下的那套类别里。业务方今天想加一条”禁止诱导未成年人充值”,技术侧就得走一轮标注调。Shieldstral 把这层耦合拆开了,策略变成运行时可改的文本,这对运营节奏快的平台来说价值不小。
3B 的体量也让它有了实际落地的可能——不是所有团队都愿意为审核模型常驻一台 8 卡机器。当然,二元问答的形式意味着每条规则要单独跑一次推理,规则多了吞吐会成为新瓶颈,这是选型时要先算清楚的账。如果你正在搭 AI 应用的安全护栏,也可以顺带看看 纳米Work 这类 Agent 平台在工作流里怎么串接审核环节。
数据评估
本站OpenI提供的Shieldstral都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由OpenI实际控制,在2026年 8月 6日 上午10:46收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,OpenI不承担任何责任。

