关闭广告

OpenAI前总监最新观点:强化学习在AI领域很强,但不是终极答案

爆角追踪921人阅读

Karpathy 认为强化学习(RL)在 AI 领域目前很火,而且确实能带来显著的性能提升。RL 的核心逻辑是:通过奖励信号(比如“这次做得好”或“这次很差”),调整模型未来行为的概率。


这种方法比传统的监督微调(SFT)更高效,因为它通过“试错”能挖掘出更优的策略,而不需要人工事无巨细地标注数据。

这就是所谓的“verifier functions”(验证函数)带来的杠杆效应——你只需要告诉模型结果好坏,它自己就能摸索出更好的路径。但 Karpathy 也提出了两个关键的担忧,说明 RL 可能不是 AI 智能进化的全部答案:

1. 长任务的局限性(渐进问题):

当任务变得很长(比如需要几分钟甚至几小时的交互),RL 的机制看起来有点低效。你花了大量时间完成一个复杂任

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

美俄4个半小时会谈,普京这一次赢麻了

浏览 1012

XREAL启用上海浦东全球总部,明年推出首款Android XR系统AR眼镜

IT之家 浏览 704

夏天别总穿T恤,这些粉色裙子也不妨试一试,温柔高级又舒适

静儿时尚达人 浏览 383

香港理工大学团队开发全方位数据科学助手测评系统

科技行者 浏览 603

学校食堂有食物黄曲霉毒素超标11倍 学生:食堂有"毒"

每日经济新闻 浏览 577

黄仁勋这波杀疯了 NVIDIA RTX Spark首测跑分:碾压苹果M5 54%!

快科技 浏览 390

太敢说了!那英直播锐评冉莹颖

看晓天下事 浏览 202

小马智行开通广州自动驾驶示范运营专线

环球网资讯 浏览 1044

孙菲菲感谢霍思燕为其打抱不平,感叹男人过于精明,没女人有担当

扒虾侃娱 浏览 864

媒体:高市早苗当选首相 对华采取挑衅措施的可能提升

界面新闻 浏览 681

苹果彻查iPhone 17 Pro褪色:问题机型已被回收

快科技 浏览 723

俄导弹深夜斩首,乌军封锁现场,英美法沉默

浏览 1032

薛鹤翔:马士基开舱偏低,打乱旺季预期节奏

首席经济学家论坛 浏览 5926

17岁男生提供电话卡给网诈团伙被判8个月 称获利997元

红星新闻 浏览 674

支付宝发布提示:阿宝邀请码无需付费购买

环球网资讯 浏览 304

诺贝尔文学奖得主迷恋中国 要求全家改用筷子吃饭

中国新闻周刊 浏览 726

电动豪华的再进化 新款奔驰EQS新车图解

车质网 浏览 382

媒体:中方反制不当域外管辖 欧盟商会又紧张起来了

澎湃新闻 浏览 428

戴伟浚:我肯定憋着一股劲,要在深圳新鹏城证明自己

懂球帝 浏览 539

美防长来了 核潜艇议题搅动韩国

环球网资讯 浏览 674

千问宣布投30亿元“发红包”,大厂竞逐春节档,腾讯元宝App一度崩溃

红星资本局 浏览 1414
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4