关闭广告

高效训练新标杆!华人开源原生VLM-NEO,以少数据追平顶级模型

DeepTech深科技758人阅读

当下主流的视觉语言模型(Vision-Language Models, VLM),通常都采用这样一种设计思路:将预训练的视觉编码器与大语言模型通过投影层拼接起来。这种模块化架构成就了当前 VLM 的辉煌,但也带来了一系列新的问题——多阶段训练复杂、组件间语义对齐成本高,不同模块的扩展规律难以协调。

由南洋理工大学 S-Lab 助理教授刘子纬领导的联合团队最近提出了 NEO,试图用另一种思路解决这些问题。这项工作试图回答一个根本性问题:如果不依赖预训练的视觉编码器,能否构建出与顶级模块化 VLM 相媲美的原生统一架构?


图丨相关论文(来源:arXiv)

在传统方法中,视觉编码器通常基于 CLIP 或 SigLIP 等预训练模型,这些编码器虽然在视觉理解上表现出色,但其固有的语义偏置会限制模型在特定任务上的灵活性。

更重要的是,视觉编码器和语言模型之间存在天然的“代沟”——前者采用双向注意力机制来捕捉图像中的全局关系,后者则使用因果注意力进行文本的自回归生成。这种架构上的不匹配使得多阶段训练不仅复杂,还需要大量的对齐数据来弥合两个模态之间的鸿沟。

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

攻克世界难题!中国自主研发冲锋衣无氟面料,价格仅国际同类1/3

文汇报 浏览 815

嘉定企业携新品亮相集成电路设计业展览会

上观新闻 浏览 699

游客称山东日照海边堆积大量浒苔 当地:每天都在打捞

大风新闻 浏览 1009

聚焦先进疗法 2025张江药谷国际创新大会启幕

看看新闻Knews 浏览 831

男子如厕突发不适后去世 从倒地到失去意识仅1分钟

上观新闻 浏览 589

牛弹琴:"三支箭"正射向以色列 以色列的大麻烦来了

现代快报 浏览 397

斯卢茨基:最后时刻丢球难以接受,争冠主动权已不在我们手中

懂球帝 浏览 771

外媒称"中国已重启进口澳大利亚油菜籽" 加拿大慌了

环球网资讯 浏览 935

内需复苏叠加“反内卷” 聚焦两大方向投资机遇

证券时报 浏览 5972

中俄海军第5次海上联合巡航圆满结束

新华网 浏览 825

终于!Windows 11迎来蓝牙音频共享功能:可惜还是有限制

快科技 浏览 725

50+妈妈冬季穿搭范本:“短羽绒服+阔腿裤”,保暖时髦不费力

静儿时尚达人 浏览 605

皇马TV显示,贝林厄姆将在国家德比中担任首发右边锋

懂球帝 浏览 714

亚历山大20分,火箭末节哑火!雷霆111-91大胜20分迎5连胜

全景体育V 浏览 631

齐溪王传君带娃游乐场玩耍,王传君父爱满满,陪女儿玩到满头大汗

扒虾侃娱 浏览 816

男子醉驾撞死女教师获刑两年半 事发地附近有两所学校

扬子晚报 浏览 603

预计北京车展首发亮相 吉利银河战舰开启全球征名

网易汽车 浏览 570

股价“闪崩”、市值蒸发500亿,寒武纪怎么了?

征探财经 浏览 16265

32岁章泽天,开播客节目采访刘嘉玲

娱乐圈笔娱君 浏览 626

全新外观、新增大电池版本,新款比亚迪海狮05DM申报

IT之家 浏览 639

AI大战打到太空!前脚H100入轨,TPU后脚上天,中国玩家笑而不语

量子位 浏览 729
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4