2026年8月,Mistral AI发布了Shieldstral,一款仅30亿参数(3B)的多模态AI安全审核模型。它能同时审核文本、图片及图文内容,表现媲美甚至超越大参数模型(如文本审核HarmBench得分高达99.4%)。
传统审核模型依赖固定的“违规标签”,规则一变就得重新训练。Shieldstral颠覆了这一刻板模式,将审核变为简单的“Yes/No”判断题。只需输入“自然语言规则+待审内容”,模型即可判断是否违规。企业能随时用大白话灵活调整审核标准,免去了重新训练的烦恼。
为防止模型“走捷径”死记硬背,团队采用了对比式训练:面对同一内容,问“是否非法拘禁”答Yes,问“是否身体伤害”则答No。配合440万条合成数据,模型真正学会了精准理解细粒度规则。
针对违规图片稀缺的痛点,团队设计了2000多种提问方式(含反向提问),并结合大量安全图片构建了450万条多模态数据,让模型练就识图的“火眼金睛”。
总之,Shieldstral用“小身板”扛起了大重任,以轻量灵活的设计大幅降低了AI安全审核的部署与运维成本,展现了小参数模型在垂直领域的巨大潜力。
原文链接
本文链接:https://kx.umi6.com/article/37495.html
转载请注明文章出处
相关推荐
换一换
别听模型厂商的,“提示”不是功能,是bug
2025-08-10 10:44:56
什么是真正好用的推理模型?阶跃Step 3:开源的,多模态的,低成本的,国产芯片适配的
2025-07-28 10:09:36
消息称小鹏机器人新成立“智能拟态部”,主攻机器人多模态
2025-07-25 17:29:22
国产新一代大模型MiniMax 3上半年发布:多模态、全球顶级性能
2026-03-03 22:38:04
微软开源多模态 AI Agent“Magma”:购物时可自动下单,还能推测视频人物行为
2025-02-26 10:28:10
文生视频模型为何迟迟没有“aha moment”?
2025-04-14 15:40:26
多模态和Agent成为大厂AI的新赛点
2025-04-30 20:07:29
DeepSeek识图模式是个新模型?!一手实测在此(没错我被灰度到了)
2026-04-30 15:28:30
GPT-5泄露!首次统一GPT和o系列,实测demo抢先曝光,下周发布?
2025-08-01 08:52:52
Agent、多模态、应用、算力一天看尽,峰会亮点在此|5.20日,来现场一起AI
2026-05-17 17:46:55
月之暗面推出Kimi K2.5模型,全面升级多模态能力
2026-01-27 14:20:13
美团发布并开源 LongCat-Flash-Omni 模型:支持实时音视频交互,达到 SOTA 水平
2025-11-03 11:17:00
是个公司都在用AI Agent,但大家真的用明白了吗| MEET2026圆桌论坛
2025-12-17 13:42:24
744 文章
966828 浏览
24小时热文
更多
-
2026-08-17 17:23:00 -
2026-08-17 17:21:24 -
2026-08-17 17:19:48