关闭广告

香港科大:用"随机策略"训练AI数学推理,效果竟然超越复杂算法

科技行者786人阅读


这项由香港科技大学潘凌教授团队联合快手科技、StepFun等机构共同完成的研究,发表于2025年9月29日的arXiv预印本平台(论文编号:arXiv:2509.24981v1)。研究团队提出了一种名为ROVER的全新AI训练方法,颠覆了人们对机器学习复杂性的认知。有兴趣深入了解技术细节的读者可以通过论文编号在arXiv平台查询完整论文。

当我们谈论训练AI解决数学问题时,大多数人可能会想象这需要极其复杂的算法和精密的计算。然而,香港科技大学的研究团队却发现了一个令人意外的现象:有时候,最简单的方法反而能产生最好的效果。这就像在烹饪界,有些大厨经过多年探索后发现,最朴素的食材搭配往往能烹制出最美味的佳肴一样。

目前,训练AI进行数学推理主要依赖一种叫做"强化学习"的技术。这种方法就像训练一个学生做数学题:先让学生尝试解题,如果答对了就给奖励,答错了就给惩罚,然后不断调整学生的解题策略。在AI领域,这种方法被称为PPO(Proximal Policy Optimization)或GRPO(Group-Relative Policy Optimization)等算法。

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

国电高科新专利可提高卫星设备的工作可靠性

财闻 浏览 542

baby近照脸好僵!被质疑打针了没恢复,37岁了又拍网红照太心酸

萌神木木 浏览 441

珍珠专场|| 无论18岁还是80岁,总是会为它再一次心动

黎贝卡的异想世界 浏览 651

阿尔托贝利:希望劳塔罗能保持健康,他有机会破梅阿查的纪录

懂球帝 浏览 653

微软35岁印度软件工程师凌晨被发现死在硅谷园区 家属:经常深夜加班

红星新闻 浏览 877

首拍飙至数千万元的“京东第一车”,最低4.54万元就能买到?

都市快报橙柿互动 浏览 796

特朗普称哈马斯将全面解除武装

政知新媒体 浏览 254

泽连斯基:若不能及时获得资金 将大幅削减无人机生产

每日经济新闻 浏览 634

牛弹琴:高市早苗有点悬了 女首相之路出现重大波折

现代快报 浏览 810

A股“924行情”一周年,跑赢同期市场涨幅为何特别难?

郭施亮 浏览 2326

满油满电能跑一个月!何小鹏-20℃冬测:小鹏G7超级增程续航1108.3公里

快科技 浏览 610

德甲欧战,还是只能靠拜仁、多特撑着

体坛周报 浏览 686

美军新锐舰队为应对中国大举集结 集结地却远在夏威夷

枢密院十号 浏览 749

邓亚萍祝贺朱雨玲夺冠:姜还是老的辣,得分手段非常明确

直播吧 浏览 1000

英伟达怒花350亿,把英特尔打回了40年前。

差评XPIN 浏览 2418

央行印钞为什么不是救世良方?

虎嗅APP 浏览 2230

有钱都买不了!布加迪订单已经排至2029年!

郑谊 浏览 879

伊姐周日热推:电视剧《狙击蝴蝶》;电视剧《天书黎明》......

伊周潮流 浏览 677

秦力洪:蔚来穿越了风暴周期,三季度将迎转折,但远没有到开香槟的时候

红星资本局 浏览 1188

媒体:泽连斯基妥协 刚冻结俄资产的欧洲"惊觉一场空"

上观新闻 浏览 609

胡夏明明能保送,非要参与五公,披哥5怪贴心的

翰林涛涛 浏览 738
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4