1
免责声明:Al优秘圈所有资讯仅代表作者个人观点,不构成任何投资理财建议。请确保访问网址为(kx.umi6.com) 投诉及建议

标题:具身智能如何重塑计算机视觉?| CVPR 2026

正文:
当机器从识别图像走向介入现实,视觉研究的边界也被重新划定。在CVPR 2026会场,满屏的机械臂抓取、足式机器人导航和物理模拟让人恍惚是否误入了机器人顶会ICRA或IROS。具身智能(Embodied AI)已不再是视觉领域的“边缘分支”,而是以主舞台的姿态成为视觉顶会的核心叙事之一。

这种变化并非偶然,而是机器人学习演进的结果。Ted Xiao将机器人学习分为三大时代:存在性证明时代、基础模型时代和Scaling时代。早期,机器人研究聚焦于“能否动起来”;基础模型时代让机器人学会理解指令与场景;而到了Scaling时代,问题变为“能否在开放世界中规模化学习与行动”。这一阶段,机器人对视觉的需求从“看见物体”升级为“理解世界并转化为行动”。

过去,计算机视觉的任务是从图像中提取语义、理解事件或还原三维结构。如今,具身智能要求视觉系统不仅看懂世界,还要支持智能体进入并改变世界,并通过行动反馈校正理解。这标志着“范式夺权”的本质:重新定义领域的问题入口、评价标准和技术路线。

传统视觉问“这是什么?”“它在哪里?”;具身智能则问“我能对它做什么?”物体不仅是类别标签,更是可抓取、可推动的实体;空间不仅是几何结构,而是可导航、可交互的任务场。评价标准也从“输出是否正确”转向“行动是否有效”。

方法路线随之重写。VLA模型将语言目标与视觉状态转化为动作序列;世界模型预测动作后果;3D空间智能从几何恢复转向空间决策。产业需求也发生变化,机器人要求视觉结果直接进入行动链条,错误成本显著提高。

2017年,李飞飞在IROS上象征着机器人学界对视觉智能的拥抱;如今,具身智能反过来迫使计算机视觉重新定义自身。没有视觉,机器人无法理解开放世界;但没有行动,视觉智能只能停留在描述层面。“看见是感知,理解是表征,行动才是对理解的最终检验。”

具身智能并未取代计算机视觉,而是夺取了其范式解释权,重新定义了视觉智能必须面对的世界。

原文链接
本文链接:https://kx.umi6.com/article/35735.html
转载请注明文章出处
分享至
打开微信扫一扫
内容投诉
生成图片
相关推荐
换一换
橡木果发布“本能驱动”技术路线,开辟自下而上具身智能新范式
2026-06-03 12:17:26
行业首个具身原生世界动作模型来了!蚂蚁灵波发布LingBot-VA 2.0
2026-07-10 11:46:41
CVPR 2026现场直击:CV与机器人的物理结界被彻底打破
2026-06-05 19:24:24
有余凯不投的地平线离职创业员工吗?
2026-06-07 21:50:41
征程赶超|WAIC 2026世界模型激辩:答案不在VLA或世界模型,而在?
2026-07-06 10:22:27
一只机器狗,把英伟达的算力王座拱翻了
2026-05-18 00:02:19
首日10w+!跨维智能赋能合作伙伴,商业服务小站“五一”多城齐开
2026-05-06 13:16:22
60000小时炼出新开源VLA!20多种机器人都能用
2026-07-08 12:08:37
看了20万小时「人类干活实录」,机器人悟了
2026-07-19 17:24:02
全球首个!银河通用新框架仅需人类视频即可部署,特斯拉蚌埠住了
2026-07-16 19:56:17
云从科技入股广东省具身智能训练场
2026-04-28 12:14:50
Zero-Shot提升31%!原力灵机DM0.5登场,15万小时数据喂出
2026-07-09 22:20:33
RLinf v0.3来了!从模型生态到真机部署五大能力跃升,无问芯穹与清华大学联合打造
2026-07-16 17:52:14
24小时热文
更多
扫一扫体验小程序