关闭广告

清华大学团队NeurIPS 2025文章分析 RL 与 SFT 泛化性差异

机器之心Pro809人阅读



在具身智能领域,视觉 - 语言 - 动作(VLA)大模型正展现出巨大潜力,但仍面临一个关键挑战:当前主流的有监督微调(SFT)训练方式,往往让模型在遇到新环境或任务时容易出错,难以真正做到类人般的泛化。但在大语言模型(LLM/VLM)领域,强化学习(RL)已被证明能显著提升模型的泛化能力。RL 究竟能为 VLA 带来哪些独特的泛化优势?与 SFT 相比,它们的优劣势分别体现在哪里?

来自清华大学的研究团队在 NeurIPS 2025 发表文章,首次系统性地揭示了强化学习(RL)在提升 VLA 泛化能力上的独特优势,并带来了一套全面的评测基准和高效训练方法。通讯作者是清华大学教授汪玉和博士后于超。


上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

联合国安理会通过决议,将对海地制裁延期一年

界面新闻 浏览 1466

美军:不会容忍伊朗在军演中的“不安全行为”

新华社 浏览 600

帕多瓦诺:斯帕莱蒂已成功调整球队,下一步需缩小积分差距

懂球帝 浏览 654

美股下一场风暴,会是美债掀起的吗?本周至关重要

华尔街见闻官方 浏览 71084

曾以105.6万成交的"凶宅"再次上架 26.6万元起拍

封面新闻 浏览 667

5万美元筛选「超级婴儿」, 智商提升15点?马斯克被曝是客户!

新智元 浏览 743

U23国足要夺冠?成功避开死亡半区!或一路杀入决赛+硬撼日本

念洲 浏览 644

最高法明确:醉驾启用辅助驾驶仍需担刑责

网易汽车 浏览 536

中方出面调停柬泰冲突 王毅表态

环球网资讯 浏览 625

特斯拉 FSD V14 Lite 将上线,老车主率先体验

三言科技 浏览 500

美国德州仪器与优必选达成战略合作

IT之家 浏览 654

欧豪骨子里的江湖气与角色浑然天成

呱田里的猹 浏览 737

470场,格列兹曼追平科利亚尔并列马竞队史出场榜第5名

懂球帝 浏览 640

女鞋巨头,集体“脱鞋”谋变

斑马消费 浏览 1111

B81 2.0共创版亮相 北京越野开启共创模式新实践

网易汽车 浏览 674

美国务卿称以军暂停加沙攻势被当场“打脸”

环球网资讯 浏览 776

男子救人后发现场视频遭被救女子举报"侵权" 网友吵翻

新民晚报 浏览 747

买手机前必看!安兔兔1月性能排行更新:第一名甩开垫底近40万分

快科技 浏览 607

中国拿出比稀土更致命的王牌美国"破防" 万斯:要冷静

时时有聊 浏览 716

杭州一公园白鹤"大战"无人机 现场市民看得心惊肉跳

都市快报橙柿互动 浏览 651

四部门重拳出击 严控新车以二手车名义出口

北京商报 浏览 7897
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4