机器人迈向复杂真实环境时,现有的视觉-语言-动作模型(VLA)面临动作生成“黑盒化”的痛点,难以应对环境杂乱、步骤繁琐和空间定位不准等挑战。为此,复旦大学联合上海交大、港大等机构提出GuidedVLA(已被RSS 2026接收),让机器人的行动更有依据。
GuidedVLA的核心是在动作生成中引入显式引导,将其拆分为三个专属“注意力头”: 1. 目标头(Object Head):精准锁定目标物体,抵抗背景干扰; 2. 技能头(Skill Head):识别任务当前阶段,防止步骤错乱或跳步; 3. 深度头(Depth Head):引入3D深度特征,提升距离、角度等空间几何准确度。
技术上,它采用残差适配设计,可“即插即用”于现有VLA而不破坏原模型能力,并配备自动标注流水线以大幅降低人工成本。
实验显示,GuidedVLA在仿真基准及真实双臂机器人(如家庭分拣、实验室操作)任务中,成功率均获显著提升。其最大价值在于实现了“可解释性落地”:模型是否看准目标、认清阶段、估对空间均可被量化观察,且与成功率直接挂钩。这不仅提升了机器人性能,更为排查故障和模型迭代提供了清晰抓手,推动具身智能真正走向复杂现实场景。
原文链接
本文链接:https://kx.umi6.com/article/36441.html
转载请注明文章出处
相关推荐
换一换
星海图创始人高继扬:具身智能三层技术路线,没有捷径可走
2026-06-17 19:52:45
WAIC看了一圈,这家公司的机器人在认真打工
2026-07-18 21:42:08
正行创新完成近亿美元天使轮融资,正大集团、华勤技术等多家上市企业联合加持
2026-06-23 22:56:48
Zero-Shot提升31%!原力灵机DM0.5登场,15万小时数据喂出
2026-07-09 22:20:33
1.5B开源通用VLA模型,冲进具身智能第一梯队
2026-07-20 13:14:39
橡木果发布“本能驱动”技术路线,开辟自下而上具身智能新范式
2026-06-03 12:17:26
7月14日悉尼RSS’26,线下Social Mixer晚宴报名中!
2026-07-02 12:56:43
超越π0,中国团队用1B参数模型登顶具身智能榜单
2026-07-23 14:49:03
从看懂世界到做对动作,卧安机器人OneModel 1.7用一条「隐式通路」打通了具身智能的关键断层
2026-06-03 20:34:55
顺丰邮政仓库干活的机器人,顺手拿了个具身高考第一
2026-05-21 13:40:26
全球首个:隐空间世界模型,打通长时序双向物理因果链了!
2026-06-29 22:52:00
一个GPT Plus会员的钱,够机器人跑一个月世界模型了
2026-06-04 13:05:17
一个模型控制手脚腰身!机器人终于学会全身协同干精细活了
2026-06-16 22:05:20
803 文章
845181 浏览
24小时热文
更多
-
2026-07-24 00:15:46 -
2026-07-24 00:14:08 -
2026-07-24 00:12:30