GPT-6 Astra的发布让“循环Transformer”技术爆火。其核心是让同一组网络层反复运行,不增加参数规模而加深计算。但学界发现该模型易陷入“计算冗余”:首轮计算后,后续轮次增量极小,沦为“陪跑”。
针对此痛点,阿里团队早有布局,连发两篇顶会论文破局: 一是获ICLR 2026接收的MeSH。研究发现后续循环“摸鱼”源于计算无分化与信息过载。MeSH引入动态“记忆柜”和读写路由器,让每轮循环动态调配信息、明确分工。实验显示,减少约33%参数后,模型准确率反而提升。
二是获EMNLP 2026接收的SpiralFormer。它打破每轮处理完整序列的定式,让模型以“从粗到细”的尺度观察数据:初期压缩序列看全局,后期还原抠细节。这有效降低了计算量并提升了成绩。
简言之,MeSH解决循环间“拿什么算”的信息分工,SpiralFormer解决“以多大粒度算”的尺度分工。两项研究直击架构卡点,让“用更少参数撑起更强模型”成为可能,为循环Transformer成为下一代大模型路线夯实了基础。
原文链接
本文链接:https://kx.umi6.com/article/37754.html
转载请注明文章出处
相关推荐
换一换
Mythos架构被22岁小伙“逆推”开源了!MoE和注意力借鉴DeepSeek
2026-04-20 16:12:29
马斯克收购Mesh,打通卫星光通信「关键一步」
2026-07-02 18:12:52
ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律
2026-09-04 17:29:23
把AI塞满Windows!微软高管终于反思了
2026-09-02 10:28:48
字节跳动将获得296亿美元贷款:完成将成今年亚洲规模第二大
2026-09-03 16:29:04
男子听AI抄近道下山被困深山 事后AI说“哈哈”
2026-08-31 18:54:24
陈大年复出,入局大模型
2026-09-03 18:32:42
DeepSeek Harness 的插件体验短板:安全权限未生效,好插件用户找不到
2026-09-01 16:51:10
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线
2026-09-02 11:24:33
我们用 Qwen 3.8-Max 做了一个 AI 大模型宇宙:效果竟然胜过 GPT5.6?
2026-09-01 16:57:36
还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍
2026-09-02 15:35:06
赛博朋克修车!网友用笔记本跑大模型查故障:不如200元买OBD
2026-09-02 19:47:51
新版GPT Image 2.5已经能伪造GPT-6发布会了
2026-09-04 07:02:39
700 文章
865657 浏览
24小时热文
更多
-
2026-09-05 23:32:44 -
2026-09-05 23:31:11 -
2026-09-05 15:16:02