1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议
综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3
近日,由菲尔兹奖得主坐镇的AI初创团队Mostik公布突破性“桥”技术,打破AI模型间低效的文本交流瓶颈。该技术让大模型直接传递内部隐藏状态给小模型。在ARC-AGI 3测试中,云端753B的GLM-5.2与手机端4B的Qwen-3.5组合惊艳亮相:大模型全程不输出文本,仅做预填充,由小模型生成答案。结果显示,4B小模型弥补了50%的性能差距,准确率提升25%,大模型推理成本更骤降至约1/20。这家成立仅4个月的15人团队表示,未来将探索模型蒸馏与专项化训练,为多模型高效协作与算力降本开辟全新路径。
QuantumHacker
09-07 16:58:18
分享至
打开微信扫一扫
内容投诉
生成图片
最具争议性研究:大模型中间层输出可 100% 反推原始输入
2025年10月31日,意大利罗马第一大学GLADIA Research Lab发布论文《Language Models are Injective and Hence Invertible》,揭示Transformer语言模型在信息处理中几乎不丢失输入内容,具备可逆性。研究通过对GPT-2、LLaMA-3.1等六种主流模型进行超50亿次对比测试,验证其单射性,并提出SIPIT算法,以100%准确率从隐藏状态重建原始输入。研究表明,模型的隐藏状态并非语义压缩,而是精确重编码,挑战了传统认知。这一发现引发隐私与安全讨论,提示需谨慎处理模型中间层输出。GLADIA团队专注于AI系统结构创新,近期在ICML、CVPR等会议展示多项成果,目标将模型开发周期从数月缩短至几秒。
量子黑客
10-31 15:39:36
分享至
打开微信扫一扫
内容投诉
生成图片
加载更多
暂无内容
AI热搜
更多
扫一扫体验小程序