标题:清华南洋理工联合发布首个音频大模型可信度评估基准
首个专为音频大语言模型(ALLMs)设计的多维度可信度评估基准AudioTrust发布。由南洋理工和清华大学领衔的研究团队指出,现有评估框架多聚焦文本模态或覆盖安全维度有限,未充分考虑音频模态特性。
AudioTrust创新性提出六大核心维度(公平性、幻觉、安全性、隐私、鲁棒性和身份验证),并深入探究音频模态独特安全问题。该基准及评估平台现已全面开放。
AudioTrust采用两阶段架构:第一阶段支持数据加载与高效推理,第二阶段实现自动化多维度评估。六大核心维度包括Fairness、Hallucination、Safety、Privacy、Robustness、Authentication,每个维度均涵盖多场景与特征分类。
实验结果显示,主流模型在公平性上存在系统性偏差,幻觉问题多源于信号处理错误,安全性方面开源模型易受攻击,隐私保护表现不一,鲁棒性依赖音频扰动类型,身份验证中闭源模型更具优势。
AudioTrust通过构建4,420+条真实场景数据集,设计9项音频特定指标,揭示开源与闭源ALLMs在高风险任务中的信任边界与脆弱点,为后续研究奠定基础。
论文与代码已公开:论文链接[https://arxiv.org/pdf/2505.16211],代码链接[https://github.com/JusperLee/AudioTrust],数据集链接[https://huggingface.co/datasets/JusperLee/AudioTrust]。
原文链接
本文链接:https://kx.umi6.com/article/19636.html
转载请注明文章出处
相关推荐
换一换
4步出声,单卡0.24秒!Noiz AI联合港科大清华,开源音频生成大模型
2026-06-15 15:56:09
企业微信内测AI智能助理大圆:一句话写周报、处理99+消息
2026-07-27 15:15:38
Ilya获黄仁勋50亿美元押注:“是时候Scaling了”
2026-07-28 14:01:38
美国宣称拟对中国AI企业开展调查并实施制裁!商务部回应
2026-07-27 19:24:59
硅谷的AI加速精英 开始真正担心他们造出了天网
2026-07-29 18:03:41
AMD用AI优化AI!ROCm.ai发布 本地能跑3000亿参数模型
2026-07-24 10:31:58
WAIC看了一圈,这家公司的机器人在认真打工
2026-07-24 13:40:36
AI Agent要自己刷卡了 但AI 支付宝比想象中更难做 为什么?
2026-07-24 00:15:46
老黄「开源协议」就剩一家没签,是谁啊好难猜啊
2026-07-27 16:17:15
萝卜快跑抢跑无人车右舵:香港率先全无人,伦敦直面Waymo
2026-07-29 14:51:44
天立启鸣发布教育AGI白皮书:从答题响应到心智仿真,破解教育“不可能三角”
2026-07-24 23:04:32
苦寻生母几十万未果 男子绝望中随手求助AI:奇迹真出现了!
2026-07-29 01:27:28
扎克伯格发声:美国不应封禁中国AI 应该向内找自身问题
2026-07-30 08:28:54
806 文章
862039 浏览
24小时热文
更多
-
2026-07-30 17:49:00 -
2026-07-30 16:47:24 -
2026-07-30 16:45:42