实时财经资讯 专业数据分析
ebc集团FINANCE & BUSINESS NEWS
首页 > 正文

上海交通大学与百度百舸合作突破机器人自主学习技术

2026年07月10日 18:33 来源:ebc集团 阅读 4
摘要:上海交通大学与百度百舸以及地瓜机器人共同发布了名为dVLA-RL的新技术,实现了机器人自主学习和进化的关键技术突破。

上海交通大学与百度百舸合作突破机器人自主学习技术

近日,上海交通大学携手百度百舸以及地瓜机器人(D-Robotics)共同发布了一项名为dVLA-RL的机器人技术新成果。该成果成功实现了经典PPO算法与离散扩散Vision-Language-Action(dVLA)的强化学习训练路径的整合,赋予了离散扩散VLA持续强化学习的能力,为机器人建立了一套从预训练、监督微调(SFT)到强化学习(RL)的完整技术路径,推动机器人技术向自主学习和进化的方向发展。这项技术研究完全在百度的百舸AI计算平台上进行,依托该平台,百度百舸团队对RLInf进行了AI基础设施工程的优化,显著提高了强化学习效率、资源利用率和模型的收敛效果,为dVLA-RL提供了坚实、高效的训练支持。

在Vision-Language-Action(VLA)模型的领域,它已经成为具身智能的关键技术路线之一。VLA模型通过结合视觉、语言和机器人动作,能够完成复杂的操作任务,如抓取、搬运和装配,并在制造业、物流和服务业等领域拓展应用。目前大多数机器人Foundation Model主要依赖监督微调(SFT)来学习人类的示范数据,虽然能够快速掌握基本技能,但在面对开放环境和复杂任务时,单一的模仿学习容易导致能力局限。强化学习(RL)能够通过自主交互、持续试错和奖励反馈来不断优化策略,被广泛看作是机器人Foundation Model持续演进的重要途径。

然而,离散扩散VLA由于其多轮去噪生成动作的特点,使得传统的PPO算法难以直接适配其完整的生成过程,导致强化学习训练路径的缺失,这成为了限制该技术路线发展的主要障碍。为了解决这一挑战,研究团队提出了dVLA-RL强化学习训练框架,将去噪过程视作连续的决策轨迹,重新定义了PPO的优化目标,首次使得经典强化学习算法能够直接应用于离散扩散VLA,建立了完整的强化学习训练体系。此外,团队还提出了Hybrid Denoising Steps动态去噪策略,根据不同任务的复杂度动态调整去噪步数,既保证了模型性能,又兼顾了推理效率。

实验结果表明,dVLA-RL在多个机器人基准测试中取得了显著的提升。例如,在LIBERO Benchmark(BHE)中,模型的平均任务成功率达到了99.7%;在RoboTwin 2.0基准测试中,模型成功率从监督微调阶段的61.4%提升至92.0%,提升了30.6个百分点。同时,Hybrid Denoising Steps策略将平均推理时延从728.92毫秒降低至387.24毫秒,强化学习训练耗时从845.95秒缩短至607.89秒,实现了模型性能与运行效率的双重提升。

百度百舸AI计算平台为机器人Foundation Model的强化学习提供了包括训练框架、算力调度和AI基础设施优化在内的全方位能力。随着机器人Foundation Model的强化学习阶段的加速,高质量的AI基础设施成为支撑模型持续迭代和产业落地的重要基础。借助不断升级的AI基础设施能力,百度百舸致力于提供大模型、智能体及机器人Foundation Model的更稳定、高效的训练支持。

此次dVLA-RL的发布不仅首次打通了离散扩散VLA的强化学习路径,而且进一步完善了机器人Foundation Model从预训练、监督微调到强化学习的完整技术路径,为机器人的持续自主进化奠定了基础。展望未来,随着强化学习、大模型与具身智能的持续融合,机器人将进一步从“学会执行任务”走向“持续自主学习”,加速智能制造、物流、服务机器人等场景的规模化应用。百度智能云将继续与科研机构和产业伙伴合作,利用百舸AI计算平台和AI基础设施能力,推动机器人Foundation Model的技术革新,加速具身智能产业的发展。

dVLA-RL 机器人自主学习 强化学习 百度百舸 机器人Foundation Model
免责声明:本文内容仅供参考,不构成任何投资建议。投资者据此操作,风险自担。
ebc集团

ebc集团总部位于英国伦敦,是由拥有逾三十年行业经验的国际金融精英团队领航的跨国金融企业。我们在东京、新加坡、香港等多地设有分支机构,EBC外汇平台为您提供全球领先的在线外汇与差价合约交易服务,以稳健的官方风范赢得全球赞誉。

本站内容仅供参考,不构成投资建议

© ebc集团 All Rights Reserved