机器人迈向复杂真实环境时,现有的视觉-语言-动作模型(VLA)面临动作生成“黑盒化”的痛点,难以应对环境杂乱、步骤繁琐和空间定位不准等挑战。为此,复旦大学联合上海交大、港大等机构提出GuidedVLA(已被RSS 2026接收),让机器人的行动更有依据。
GuidedVLA的核心是在动作生成中引入显式引导,将其拆分为三个专属“注意力头”: 1. 目标头(Object Head):精准锁定目标物体,抵抗背景干扰; 2. 技能头(Skill Head):识别任务当前阶段,防止步骤错乱或跳步; 3. 深度头(Depth Head):引入3D深度特征,提升距离、角度等空间几何准确度。
技术上,它采用残差适配设计,可“即插即用”于现有VLA而不破坏原模型能力,并配备自动标注流水线以大幅降低人工成本。
实验显示,GuidedVLA在仿真基准及真实双臂机器人(如家庭分拣、实验室操作)任务中,成功率均获显著提升。其最大价值在于实现了“可解释性落地”:模型是否看准目标、认清阶段、估对空间均可被量化观察,且与成功率直接挂钩。这不仅提升了机器人性能,更为排查故障和模型迭代提供了清晰抓手,推动具身智能真正走向复杂现实场景。
原文链接
本文链接:https://kx.umi6.com/article/36441.html
转载请注明文章出处
相关推荐
换一换
00后清华博士生创业“神经接口”:把人类肌肉反应炼成Token
2026-08-22 22:24:37
π0引用的中国团队,又出手了:世界仿真器新作发布
2026-08-18 18:54:34
一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠
2026-09-03 11:17:59
人形机器人开始打国球了!两台机器人完整打完11分制比赛
2026-08-17 18:11:44
全球首次!机器人迎战网球运动员,极限救球,摔倒光速弹起
2026-08-23 18:05:06
我在WAIC 2026看见的十大趋势
2026-07-22 12:56:36
当机器人大脑飞上天!替人奔赴危险作业现场,对话硅羽科技
2026-08-22 17:13:59
对话郎咸朋:具身也会有“蔚小理”,靠融资实现不了物理AGI
2026-08-10 15:46:24
被高估的视触觉:容易复制的生意,有多大投资价值?
2026-08-28 14:07:42
自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning
2026-09-01 13:36:24
具身智能数据需求暴涨千倍,这家“数据炼油厂”刚拿到近亿元融资
2026-07-23 12:55:21
DeepSeek豪掷1.4亿护航宇树IPO,杭州绝代双骄战略合体
2026-08-07 09:09:17
宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底
2026-08-26 14:25:47
820 文章
988678 浏览
24小时热文
更多
-
2026-09-06 21:14:00 -
2026-09-06 20:12:34 -
2026-09-06 20:10:47