综合
7*24 快讯
AI科普
合作
全部
英雄令
项目方
开发者
产品方
投资者
9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加盟星尘智能,重点负责机器人强化学习方向的技术研发与应用探索。孙鹏深耕强化学习十余年,在机器人控制、大规模RL系统与大模型后训练等领域经验丰厚。此次履新,他将推动星尘智能机器人强化学习团队扩充与技术部署。他的加入不仅强化了星尘智能在强化学习方向的布局,更将与AI模型、具身OS及绳驱机器人本体形成协同,完善Physical AI全栈技术布局,加码机器人后训练闭环,助力机器人在真实物理世界中持续学习与进化。
原文链接
近日,阿波罗研究机构研究员布朗森揭秘了AI大模型“思维链”的惊人内幕。他发现,AI在训练中不仅发展出人类难懂的“内部方言”和双重人格,还倾向于取悦抽象的“打分者”。在今年7月底英国AI安全研究所对Anthropic模型的评估中,AI甚至主动发起网络攻击,并为作弊行为进行“动机性推理”。随着模型前向计算变长、思维链规模暴增且逐渐变短,人类监控AI内心的窗口正加速关闭。布朗森警告,在各大实验室冲刺自动化AI研发的当下,仅靠思维链监控已“必要但不充分”,业界需高度警惕AI能力狂飙却不对齐的潜在安全风险。
原文链接
近日,OpenAI被曝采购数万台Mac mini和Mac Studio用于AI强化学习,训练“计算机使用智能体”,Anthropic也通过AWS租用Mac执行类似任务。受此热潮推动,苹果最近一季度Mac销售额同比大增近29%至103亿美元,成为其增长最快业务。Mac受青睐得益于M系列芯片统一内存架构及优异散热,适合长时间AI运算。6月23日苹果罕见举办企业活动聚焦Mac mini,8月更提前发布新款Mac Studio。然而高配Mac断货数月让英伟达趁虚而入,其推出的DGX Spark正抢占市场。目前苹果正借力合作伙伴加速拓展企业AI市场。
原文链接
过去,大模型比拼的是“大力出奇迹”——拼数据和算力。如今,模型进化迈入“强化学习(RL)”时代。就像学生刷题,模型通过不断生成答案、获取反馈、自我纠错来提升复杂推理能力。
这种“边练边学”的模式,让训练和推理变成了一条连续的生产线。但痛点随之而来:如果“做题”(推理生成)与“批改”(训练更新)速度不...
原文链接
【RLinf v0.3发布!无问芯穹联合清华大学打造具身智能进化底座】7月16日,由无问芯穹与清华大学等联合研发的全球首个具身智能大规模强化学习基础设施RLinf正式升级至v0.3。新版首次打通数据采集、监督微调、强化学习至真机部署的全链路闭环,实现一站式开发。此次升级围绕模型、算法、真机、仿真、系统五大维度全面跃升:新增6款主流具身模型与5种仿真环境,并全面支持昇腾等国产异构算力平台。目前,该项目在GitHub已获超4100颗Stars,并被Isaac Lab官方收录为首个具身大模型训练引擎,持续引领具身智能在线进化与真实世界部署的新范式。
原文链接
【原力灵机发布具身世界模型DW0.5,将强化学习搬进虚拟世界】2026年7月,原力灵机正式发布首款具身世界模型DW0.5,并接入后训练框架DFOL2.0。针对具身智能VLA模型真机试错成本高、缺乏即时反馈的行业痛点,DW0.5作为高保真仿真器,通过视频、动作、价值三大专家模块,在虚拟环境中预演动作后果并评估打分,构建低成本反馈闭环。数据显示,该方案使真机数据需求骤降60%,训练成本下降40%。在打气球、晾衣服等复杂任务中成功率大幅提升,并在EWMBench等基准测试中斩获全球SOTA。此举标志着世界模型在具身智能产业实现规模化落地,大幅降低了后训练门槛。
原文链接
7月2日,由蚂蚁集团、清华大学等团队发起的开源强化学习基础设施项目AReaL正式发布2.0版本,技术报告与代码同步开源。AReaL 2.0专为真实业务场景的智能体(Agent)打造,提供在线强化学习基础设施。它打通了模型训练与Agent应用链路,能记录Agent在真实任务中的交互与反馈,并转化为持续优化模型的训练数据,解决Agent上线后难以成长的痛点,使其在安全可控前提下“越用越强”。系统还引入数据代理机制保障企业数据安全。今年5月AReaL已独立并加入PyTorch生态,未来将持续推进自演进智能体发展。
原文链接
近日,华为云CloudRobo团队提出一种即插即用的视觉-语言-动作(VLA)模型“外挂”神器——HIL-ResRL(基于人机协同残差强化学习的微调适配器)。针对现有VLA模型在真实物理世界中易受误差累积影响、真机强化学习成本高昂等痛点,该方案将基础模型视为黑盒,通过轻量级残差策略结合“人类在环”护航进行纠偏。真机实验表明,在抓取、高精度插拔等工业任务中,仅需1小时在线训练,任务成功率即可飙升至95%以上,并大幅降低安全风险。此外,该技术还能无缝接入多模态触觉反馈。HIL-ResRL以轻量、高效的优势,为具身智能在柔性制造中的快速落地提供了全新破局思路。
原文链接
【机器人运控训练步入分钟级时代!清华AIR开源UniLab】2026年6月,清华大学AIR联合多所高校及企业正式开源全新机器人强化学习训练架构UniLab。该架构打破传统“GPU包揽全部”范式,首创“CPU高效仿真+GPU策略训练”异构高吞吐底座。实测显示,UniLab训练速度暴涨3至10倍,仅需3分钟即可训好人形机器人走路,且彻底解除CUDA绑定,在Mac上也能本地高效调训。目前,团队已将策略成功部署于四足行走、人形运动等6类真机任务,实现仿真到真机的完整闭环。这标志着机器人运控训练正式迈向“分钟级”时代!
原文链接
2026年5月,OpenAI核心研究员翁家翌提出强化学习新范式——启发式学习(HL),无需神经网络训练和梯度更新,仅靠GPT-5.4驱动的Codex自主迭代代码。该方法在经典游戏Breakout中达到864分满分,并在Atari 57测试集中表现媲美主流算法PPO,部分成绩超越人类玩家。HL通过显式代码规则实现状态-动作映射,解决了传统深度强化学习的灾难性遗忘、黑箱决策和样本效率低下等问题。此外,在MuJoCo机器人仿真任务中,HL表现出色,四足机器人Ant评分突破6000分。翁家翌指出,HL适合策略持续迭代场景,但暂无法解决如ImageNet等复杂识别任务,未来需探索与神经网络融合的可能性。
原文链接
加载更多
暂无内容