关闭广告

OpenAI前总监最新观点:强化学习在AI领域很强,但不是终极答案

爆角追踪728人阅读

Karpathy 认为强化学习(RL)在 AI 领域目前很火,而且确实能带来显著的性能提升。RL 的核心逻辑是:通过奖励信号(比如“这次做得好”或“这次很差”),调整模型未来行为的概率。


这种方法比传统的监督微调(SFT)更高效,因为它通过“试错”能挖掘出更优的策略,而不需要人工事无巨细地标注数据。

这就是所谓的“verifier functions”(验证函数)带来的杠杆效应——你只需要告诉模型结果好坏,它自己就能摸索出更好的路径。但 Karpathy 也提出了两个关键的担忧,说明 RL 可能不是 AI 智能进化的全部答案:

1. 长任务的局限性(渐进问题):

当任务变得很长(比如需要几分钟甚至几小时的交互),RL 的机制看起来有点低效。你花了大量时间完成一个复杂任

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

45岁超模吉赛尔·邦辰带娃遛弯被拍

包饺子ai剪辑 浏览 643

燃烧等离子体国际科学计划项目启动及研究计划发布

中安在线 浏览 435

AI“一路狂飙”,南京如何用产业攻坚书写答案?

现代快报 浏览 523

冲刺第一股,中国最大独立模型厂商的成色、能力与野心

晚点LatePost 浏览 368

6.4万的特斯拉FSD将成为历史!

新车评网 浏览 367

杭州,居然是一个巨大的真人寻宝游戏!

时尚COSMO 浏览 577

特朗普谈筹备"泽普会":就像让"油醋融合"一样困难

环球网资讯 浏览 654

深圳自动驾驶安全实验室揭牌成立,将重点攻坚十大方向

南方都市报 浏览 374

Intel大小核根本停不下来!甚至要做“统一核心”

快科技 浏览 317

智能早报丨黄仁勋造访台积电3nm产线索取产能;万华化学突破机器人“仿生皮肤”材料

观察者网 浏览 446

2026款上汽大众朗逸正式上市 售价12.09万起

车质网 浏览 360

白宫:美俄元首将以一对一形式在安克雷奇举行会晤

上观新闻 浏览 625

ESPN:加拉塔萨雷对京多安感兴趣,球员想去土超感受一下

懂球帝 浏览 588

穿重山、进窄门 杉杉股份能众志成城?

铑财 浏览 3820

东体:海港通过体系改造,激发莱昂纳多寻找射门空间的特点

直播吧 浏览 575

软银清仓英伟达,孙正义套现415亿

YOUNG财经 浏览 5464

工行市值逼近3万亿,五年内A股会诞生万亿美元市值的公司吗?

郭施亮 浏览 11093

中方出面调停柬泰冲突 王毅表态

环球网资讯 浏览 389

谢娜发文为双胞胎女儿庆生,张杰转发

韩小娱 浏览 365

售13.98万起 吉利新能源皮卡四驱山地版/高寒版同步上市

网易汽车 浏览 400

特朗普和泽连斯基会晤后 32个北约成员国防长仓促开会

澎湃新闻 浏览 696
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4