近日,星尘智能发布在线强化学习框架SmoothRL,旨在解决大模型异步推理下机器人在线学习的“对错账”难题。由于真实机器人无法暂停等待模型推理,导致模型生成的动作序列与实际执行的动作存在偏差。SmoothRL创新性地将动作序列划分为已提交、执行和丢弃三个区域,仅对真正执行的动作进行强化学习。在星尘S1机器人的真机测试中,该框架在高动态投掷、给笔戴帽和快递开箱任务中成效显著,投掷成功率从39%飙升至94%,动作也更平滑。SmoothRL有效修正了预训练模型在真实物理世界中的执行偏差,进一步推动了具身智能的规模化部署。
原文链接
本文链接:https://kx.umi6.com/article/37743.html
转载请注明文章出处
相关推荐
换一换
AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o
2025-10-24 12:36:00
谷歌AI硬气一回:Gemini 3.8仅用15%价格接近Opus5 斩获8项编程第一
2026-09-03 00:58:51
ScienceDiscovery实现树搜索驱动RSI,加速科学发现,小时级写出通用积分器,低成本找出物理科学规律
2026-09-04 17:29:23
去年归国的徐梦迪,成了清华姚班班主任
2026-08-29 21:22:18
Claude Code 额度回落:Agent 正在制造新的「祖传代码屎山」?
2026-08-28 16:25:02
巨简单,更懂家!海信JUOS正式发布:行业首个家庭智能伴侣级AIOS
2026-09-02 10:24:20
具身大脑进了真实世界,难题才刚刚开始
2026-09-04 13:17:29
范式与华为达成重磅算力战略合作,成为首批拥抱国产最高端算力底座的AI企业
2026-08-31 16:46:45
我国首个相关国标今起实施!整治AI客服已读乱回 转人工终于不难了
2026-09-01 01:08:21
我们用 Qwen 3.8-Max 做了一个 AI 大模型宇宙:效果竟然胜过 GPT5.6?
2026-09-01 16:57:36
SkyProduction天工工作台:从剧本到成片,一套工作台把精品短剧创作真正跑起来
2026-09-02 17:38:53
神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光
2026-09-03 10:17:05
磁带没死还活得好好的!AI催生160EB出货量:2026Q1同比暴增57%
2026-09-03 15:28:35
766 文章
938054 浏览
24小时热文
更多
-
2026-09-04 18:34:16 -
2026-09-04 18:32:46 -
2026-09-04 17:33:09