关闭广告

谁是AI之王?聊聊备受争议的AI评测与崛起的LMArena

硅谷101703人阅读

撰稿 |张珺玥

编辑 |陈茜

在大模型激战的当下,究竟谁更强?是OpenAI的GPT,还是Anthropic的Claude?是谷歌的Gemini,还是中国的DeepSeek?

当AI模型排行榜开始被各种刷分作弊之后,谁家大模型最牛这个问题就变得非常主观,直到一家线上排行榜诞生,它叫:LMArena。

在文字、视觉、搜索、文生图、文生视频等不同的AI大模型细分领域,LMArena上每天都有上千场的实时对战,由普通用户来匿名投票选出哪一方的回答更好。最近以来,很多AI研究者都纷纷发声,认为大模型竞赛的下半场,最重要的事情之一就是重新思考模型评估。

因为当技术创新趋于饱和,真正拉开差距的,可能将不再是谁的参数更多、推理更快,而是谁能更准确地衡量、理解模型的智能边界。

在大模型评测上,传统的Benchmark(基准测试)究竟存在什么问题,是已经过时了吗?LMArena的竞技场模式为什么会被视为一种新的标准?它的技术机制、公平性和商业化隐藏着怎样的挑战?而下一代的大模型评测,又可能会走向哪里?

(本文为视频改写,欢迎大家收看以下视频)

01

题库泄露、数据污染传统Be

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

"最快女护士"辞职后首战重马获国内第四 本人回应

封面新闻 浏览 612

主打运动与智能 零跑Lafa5内饰首发亮相

网易汽车 浏览 780

直言“薪资不及预期”!上任仅3个月,上市公司财务负责人“闪辞”

红星资本局 浏览 8560

苏州大学突破:新型注意力机制赋能AI语境适应性对话

科技行者 浏览 624

与抖音退货服务“分手”,1300亿王卫有何打算?

雷达财经 浏览 674

世界排名升至第2!莫雷加德创生涯新高,力压林诗栋雨果张本智和

乒谈 浏览 585

媒体:被美国逼着“朝中国开枪” 韩国玩得起吗

澎湃新闻 浏览 746

智能座舱也能“深度思考”?荣威M7 DMH做到了

IT之家 浏览 750

委内瑞拉空军基地遭美袭击后 导弹碎片四散

极目新闻 浏览 600

拉加德暗示欧央行不急行动:政策处于有利位置,未预设利率路径,任何选项都应考虑

华尔街见闻官方 浏览 2318

哈啰“豪赌”Robotaxi,联手阿里和宁德能否比萝卜快跑“跑更快”?

汽扯扒谈 浏览 770

VOGUE大合照太势利:影后只能站角落?

娱乐圈笔娱君 浏览 714

有没有发现,女骑手越来越多了?

智谷趋势 浏览 12845

黎以停火协议生效一年 以军称打死370余名武装人员

国际在线 浏览 668

张雪峰多平台账号被封28天后解禁 直播时多次感谢网友

极目新闻 浏览 698

金银"大跳水" 深圳水贝有档口单日卖出200万元金条

红星新闻 浏览 593

测Manus 1.5:丝滑,超预期,Manus独特上下文工程的一次关键展示

硅星人 浏览 753

北京自闭症男童苍山走失身亡 父亲1周7天扎在单位加班

红星新闻 浏览 664

智己LS9上市32.28万起 两个Ultra都是高配

网易汽车 浏览 679

专家:中美俄将坐一张谈判桌谈俄乌问题 中国应更主动

澎湃新闻 浏览 991

快看!!这个女演员近日暴瘦!!哦,知道了……

时尚COSMO 浏览 435
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4