关闭广告

香港科大:用"随机策略"训练AI数学推理,效果竟然超越复杂算法

科技行者530人阅读


这项由香港科技大学潘凌教授团队联合快手科技、StepFun等机构共同完成的研究,发表于2025年9月29日的arXiv预印本平台(论文编号:arXiv:2509.24981v1)。研究团队提出了一种名为ROVER的全新AI训练方法,颠覆了人们对机器学习复杂性的认知。有兴趣深入了解技术细节的读者可以通过论文编号在arXiv平台查询完整论文。

当我们谈论训练AI解决数学问题时,大多数人可能会想象这需要极其复杂的算法和精密的计算。然而,香港科技大学的研究团队却发现了一个令人意外的现象:有时候,最简单的方法反而能产生最好的效果。这就像在烹饪界,有些大厨经过多年探索后发现,最朴素的食材搭配往往能烹制出最美味的佳肴一样。

目前,训练AI进行数学推理主要依赖一种叫做"强化学习"的技术。这种方法就像训练一个学生做数学题:先让学生尝试解题,如果答对了就给奖励,答错了就给惩罚,然后不断调整学生的解题策略。在AI领域,这种方法被称为PPO(Proximal Policy Optimization)或GRPO(Group-Relative Policy Optimization)等算法。

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

到了秋天才知道,年纪大的女人要告别“小脚裤”,这样穿显瘦

静儿时尚达人 浏览 468

"30年老公厕"被改成咖啡店后又遭封 当地城管部门回应

封面新闻 浏览 462

安东尼奥3年2次突破!成05国奥主帅热门,媒体人:结果大于过程

奥拜尔 浏览 388

连续两场地区联赛弃赛后,葡老牌球队博阿维斯塔面临解散风险

懂球帝 浏览 484

男导演曝丑闻 蒋欣的含金量还在上升

刘森森 浏览 469

鲁比奥称美伊协议措辞磋商或“还需几天时间”

界面新闻 浏览 165

打破垄断,利润狂飙200%,机器人独角兽,一骑绝尘!

飞鲸投研 浏览 4308

内娱声明还有可信度吗?

韩小娱 浏览 558

ESPN:由于接受了手术,菲利普斯预计要到冬窗才能离开曼城

懂球帝 浏览 587

户外消费掀新潮,运动产业迎来“功能+时尚”双升级格局

中国商报 浏览 1085

特朗普称已考虑接替穆杰塔巴的人选 外交部表态

潇湘晨报 浏览 262

女友BELLA+封面 | BossNoeul:爱的回声

伊周潮流 浏览 601

塞纳河“上岸”不易:20年合约、赔350万成为失信人、抑郁症也要赔钱…小偶像们那些年打过的官司

仙女事件簿 浏览 428

阿莫林:利马已经接近参加合练;踢三中卫对马奎尔有好处

懂球帝 浏览 489

宏碁正式推出Swift 16 AI旗舰轻薄本,至高酷睿Ultra X9 388H

IT之家 浏览 383

爱奇艺2025年Q2财报:收入66.3亿 运营利润5870万

网易科技报道 浏览 551

上市24小时订单破21856台!50万的档次仅售15万多

隔壁说车老王 浏览 616

安东尼奥:我是“变色龙”式的教练,根据实际情况有不同打法

懂球帝 浏览 411

网易严选宠物全球创新研发中心启用,与SGS战略合作升级

观察者网 浏览 231

专家:清除加沙地表未爆弹药或需20多年

北青网-北京青年报 浏览 451

勇士124-106鹈鹕 球员评价:穆迪满分,5人良好,3人低迷

篮球资讯达人 浏览 440
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4