关闭广告

高效训练新标杆!华人开源原生VLM-NEO,以少数据追平顶级模型

DeepTech深科技503人阅读

当下主流的视觉语言模型(Vision-Language Models, VLM),通常都采用这样一种设计思路:将预训练的视觉编码器与大语言模型通过投影层拼接起来。这种模块化架构成就了当前 VLM 的辉煌,但也带来了一系列新的问题——多阶段训练复杂、组件间语义对齐成本高,不同模块的扩展规律难以协调。

由南洋理工大学 S-Lab 助理教授刘子纬领导的联合团队最近提出了 NEO,试图用另一种思路解决这些问题。这项工作试图回答一个根本性问题:如果不依赖预训练的视觉编码器,能否构建出与顶级模块化 VLM 相媲美的原生统一架构?


图丨相关论文(来源:arXiv)

在传统方法中,视觉编码器通常基于 CLIP 或 SigLIP 等预训练模型,这些编码器虽然在视觉理解上表现出色,但其固有的语义偏置会限制模型在特定任务上的灵活性。

更重要的是,视觉编码器和语言模型之间存在天然的“代沟”——前者采用双向注意力机制来捕捉图像中的全局关系,后者则使用因果注意力进行文本的自回归生成。这种架构上的不匹配使得多阶段训练不仅复杂,还需要大量的对齐数据来弥合两个模态之间的鸿沟。

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

泰伦-卢回忆科比往事:他曾说 没有我2001年就没有总冠军

仰卧撑FTUer 浏览 599

逍遥大结局:看到最后,这个曾经最可恨的妖,却是全剧喜剧人之首

肆季娱乐 浏览 333

2026春夏一定要拥有的6只包,好看又百搭

LinkFashion 浏览 298

腾势D9将迎来第30万辆交付

大象新闻 浏览 395

双后场助76人客场掀翻凯尔特人 三分投不准时绿军该咋办?

仰卧撑FTUer 浏览 234

春天第一条裙子,这么穿!

黎贝卡的异想世界 浏览 312

2万罗马仕充电宝14万根充电线拍卖流拍,二拍起拍价164万

三言科技 浏览 4346

Here we go!罗马诺:曼城中场菲利普斯租借加盟谢菲尔德联

懂球帝 浏览 367

邓超父子与姚明看球赛,三人坐一起如同WiFi信号

可乐谈情感 浏览 670

日本派大学生+以小打大仍5-0叙利亚 黄健翔惊叹 :夺世界杯非玩笑

我爱英超 浏览 416

下周,A股还能不能修复?分析来了

每经牛眼 浏览 1260

马斯克摊上事了,旗下公司被多国调查封禁

21世纪经济报道 浏览 384

新国标电动车被指不能带小孩、超速会断电 官方回应

新京报 浏览 482

孙兴慜:我加盟美职联,是为了让它变得更具影响力

懂球帝 浏览 604

薛鹤翔:马士基开舱偏低,打乱旺季预期节奏

首席经济学家论坛 浏览 5710

“天后前夫”欠债10年后,爆了4颗雷,离了2次婚

大猫财经Pro 浏览 1342

后排配娱乐屏/还有拖挂资质 理想i6将于9月26日上市

网易汽车 浏览 518

大师赛赵心童5-3领先赛点,决胜局选择逆转

百态中的情感起伏 浏览 387

特朗普宣布延长停火 伊朗表态

界面新闻 浏览 231

违规拍摄涉密文件多人被处分 国安机关最新提示

新京报 浏览 444

万宁突然关闭内地线上线下全部门店,连锁巨头这是怎么了?

江瀚视野 浏览 1727
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4