慧思开物技能库重磅更新啦!作为全球首个一脑多能、一脑多机通用具身智能平台,自发布以来,持续夯实具身大小脑技术壁垒,自 2024 年底发布行业首个跨本体标准化大规模具身数据集以来,慧思开物每隔一定周期都会不断自我突破,点亮具身智能进化技能树,这次更新的Robo-ValueRL是行业领先的毫米级 VLA 强化学习方案,有望将具身智能带入精细化长时序落地应用的时代。
01/ 行业痛点:机器人还在“被动学习,好坏全吸收”?
当前具身智能赛道,正面临核心落地瓶颈——
多数模型只能依靠人工轨迹被动模仿,缺乏对动作优劣和数据质量的有效判别能力。面对混杂劣质数据盲目学习,不仅训练效率低、算力资源浪费严重,还普遍存在在线迭代中的灾难性遗忘问题,陷入「学新忘旧、越练越弱」的恶性循环。
更扎心的是:行业内机器人大多局限于大件搬运、粗粒度放置等低精度场景,看似落地广泛,却始终无法适配半导体、精密装配等高价值精细化工业场景。
缺乏数据质量评估、在线纠错和持续进化能力,是制约具身智能高端产业化落地的关键痛点。
02/ 官宣!Robo-ValueRL 正式开源
7月9日,北京人形机器人创新中心 × 中国人民大学高瓴人工智能学院联合研发成果正式官宣!
双方深度产学研攻坚,重磅发布并开源 Robo-ValueRL ——行业领先的 VLA-RL 技术框架,打破传统 VLA 模型"无判别、低精度、难迭代"的行业桎梏。
我们创新性地引入价值估计器,让模型训练不再盲目吸收全部数据,而是能够从混合质量数据中识别更有价值的经验,进一步解锁具身智能高精度工业任务边界,实现技术与落地场景的双重突破!
01/核心突破:引入价值评估能力,告别 AI 盲目训练
传统具身 VLA 模型最大的技术短板,是缺乏统一的动作质量评估体系。
人工遥操作采集的轨迹质量参差不齐,往往同时包含:优质动作、犹豫动作、纠偏动作、失败动作、无效操作。若模型无法区分这些片段的价值,只能全盘接收、混同训练——数据量持续增加,但模型精度、稳定性提升有限,能力上限被低质量数据持续干扰。
Robo-ValueRL 的解法:创新性地引入基于历史观测的价值估计机制,作为框架的核心模块,指导离线数据筛选、动作质量分层和在线数据选择。借助历史信息,价值估计器能够缓解:视觉遮挡、单帧观测歧义重复任务状态等真实场景问题,进一步提升机器人在复杂工况中的数据评估能力。
一句话总结:Robo-ValueRL 可对轨迹数据进行质量判定,筛选高价值样本,降低低质量干扰数据对策略训练的影响,从源头提升作业精度与稳定性。
02/技术迭代:缓解灾难性遗忘,持续拓宽高精度能力边界
真机部署迭代的「进化悖论」,是行业长期面临的难题:传统模型在线交互微调时,会全局更新网络权重,可能覆盖前期习得的精密操作技能,出现严重的灾难性遗忘,导致模型难以实现稳定迭代升级。
Robo-ValueRL 的方案:采用冻结预训练主干 + 残差门控网络增量微调架构,探索一条更稳定的具身 AI 在线进化路径。模型在保留预训练阶段核心能力的基础上,仅通过:
1)真实环境交互;2)高质量样本筛选;3)轻量化精准微调。
针对具体失败模式学习动作修正策略,从而有效缓解在线更新对原有能力的破坏,实现"学新尽量不丢旧、越练越稳",持续拓宽能力边界!
03/核心技术拆解:全链路离线转在线强化学习体系
区别于传统单一的离线模仿学习、简易在线 RL 方案,Robo-ValueRL 框架是一套完整、可靠、适配工业真机落地的离线预训练 + 在线自适应微调全链路 VLA 强化学习系统。
1、基于历史信息的可靠价值估计机制
传统价值函数模型极易受画面遮挡、场景重复纹理、视觉歧义干扰,导致任务进展判断失真、训练信号不稳定。我们创新性设计基于历史信息的价值估计器,依托过往历史观测信息研判任务进度,有效规避单帧画面误判问题。
该机制具备对任务进展和动作质量的双重感知能力: a、任务平稳推进时 → 价值曲线整体上升 b、动作失误、任务偏差刚出现时 → 价值估计捕捉下降信号,辅助定位错误节点为后续数据筛选和策略优化提供可靠依据。
2、优劣动作分层筛选,让策略重点学习高价值轨迹
框架将动作质量判定纳入策略训练核心条件,改变"全盘照搬数据"的低效训练模式。
Robo-ValueRL 利用独立价值估计器对离线和在线轨迹进行质量评估,将动作质量信号作为策略训练条件,引导策略更加关注能够推动任务完成的高价值行为。
实验验证:普通行为克隆(BC)会随混合质量数据增加出现性能饱和,而 Robo-ValueRL 价值引导方案具备更强的规模化学习能力,数据利用率与模型上限优于传统算法。
3、人在回路高效数据获取,轻量化在线自适应迭代
针对真机在线训练成本高、数据低效的痛点,方案搭载人在回路数据采集机制,高效获取真实工况下的在线交互数据。
同时采用主干冻结 + 轻量残差适配器微调架构,保留预训练模型通用能力,仅针对性学习动作细化、误差修正策略,有效缓解在线强化学习中的灾难性遗忘问题。
依托该架构,模型可在持续在线交互中稳步迭代,越练越稳、越练越强,实现更稳定的长期自主进化!
04/落地验证:极速迭代跃迁,硬核数据印证高精度实力
依托全套 Robo-ValueRL 技术体系,我们在两大核心工业场景完成天工真机全流程迭代验证:
场景一:毫米级芯片精密插装
· 初始基础成功率:46% · 在线交互迭代后:86% ⬆️
场景二:长时序积木拆解
· 基础成功率:60% · 迭代后成功率:84% ⬆️
横向对比 Dagger 等主流算法,Robo-ValueRL 在芯片、积木双任务中均取得更优表现,显著缓解传统算法精度不足、迭代不稳定的短板。
效率对比:人类遥操作完成单次芯片插入通常需要 2-3 次尝试,而搭载 Robo-ValueRL 的机器人可一次完成毫米级精密插入,作业效率达到人类操作员的 1.5 倍!
Robo-ValueRL 展示出较强的自主纠错与环境自适应能力:抓取失败、插入偏差 、目标托盘位移、积木掉落异常、操作策略失效。
各类复杂突发工况,均能通过在线交互和价值引导数据选择持续修正策略,在训练分布之外的复杂真实场景中保持稳定作业能力。
从 46% 到 86%、从 60% 到 84%,不是简单的数据涨幅,而是人形机器人从「被动模仿」到「价值引导学习」的重要转变。
05/全栈开源:论文、代码、数据、模型同步开放 为推动高精度机器人强化学习的可复现研究与产业落地,Robo-ValueRL 本次采用全栈开源方式发布,覆盖:
| 开源内容 | 说明 |
技术论文 | 系统阐述方法设计、模型架构、训练目标与真实机器人实验结果 |
完整代码 | 覆盖历史条件价值估计器、价值引导策略训练、在线数据筛选与轻量残差适配模块 |
真实数据 | 毫米级芯片精密插装与长时序积木拆解等任务轨迹 |
预训练模型 | 预训练模型与关键模块权重,便于复现实验结果并开展二次开发 |
实验配置 | 任务说明和复现实用文档,降低真实机器人强化学习系统的使用门槛 |
区别于仅开放演示视频或部分结果的发布方式,Robo-ValueRL 旨在开放一套可检查、可复现、可扩展的 VLA 离线到在线强化学习技术栈。
我们希望通过完整开源,让研究社区能够系统分析价值估计在机器人学习中的作用,也让产业研发团队能够基于真实数据和模型工具,进一步探索高精度机器人操作在半导体精密装配、3C 制造和柔性工业作业中的应用潜力。
03/技术价值与产业展望
Robo-ValueRL VLA-RL 技术框架的正式开源,补齐了具身智能领域「无数据判别、高精度难落地、在线迭代不稳定」三大核心短板。
依托价值估计器的数据质量评估能力,框架能够更充分挖掘工业机器人数据价值,降低无效训练损耗;搭配防遗忘增量微调架构,让机器人在真实环境中持续迭代优化,不断拓宽精密作业高精度任务边界,形成可落地、可迭代、可复现的工业级具身智能方案。
未来,北京人形将持续迭代慧思开物平台的大小脑模型能力,持续开放 Token 商用服务、扩大产业生态合作,以国家级创新平台力量推动我国通用具身智能底层技术自主可控、合规高质量发展,抢占全球通用人形机器人底层智能赛道话语权。
未来,北京人形机器人创新中心将持续深化产学研协同创新,依托本次技术突破,持续打磨高精度、高泛化、可进化的具身智能核心算法,加速推进高端人形机器人国产化、产业化落地,为智能制造产业升级注入全新动能!
以价值评估识别高质量经验,以离线到在线强化学习突破高精度任务上限。Robo-ValueRL,正在为具身智能高端产业化落地提供新的技术路径。
京公网安备11011202100775号