“羊驼“入侵CV,美团&浙大沈春华团队将LLaMA向CV扩展,构建全新底子模子VisionLLaMA

[复制链接]
发表于 2026-4-24 08:57:01 | 显示全部楼层 |阅读模式
本文首发:AIWalker
  

   https://arxiv.org/abs/2403.00522
https://github.com/Meituan-AutoML/VisionLLaMA
  本文概述

大型语言模子构建在基于Transformer的架构之上来处理处罚文本输入, LLaMA 系列模子在浩繁开源实现中脱颖而出。类似LLaMa的Transformer可以用来处理处罚2D图像吗?在本文中,我们通过提出一种类似 LLaMA 的质朴和金字塔情势的Transformer往返复这个题目,称为 VisionLLaMA。 VisionLLaMA 是一个同一的通用建模框架,用于办理大多数视觉使命。
我们采取经典的预训练框架在图像感知(尤其是图像天生)使命上对齐有效性举行了充实评估。在大多数情况下,VisionLLaMA表现出了比已有SOTA ViT方案更优的性能。我们信赖 VisionLLaMA 可以作为视觉天生和明白的强盛新基线模子。

本文贡献


      
  • 提出一种类似于LLaMA的视觉转换器架构VisionLLaMA,以淘汰语言和视觉之间的架构差异。  
  • 我们研究了两个版式的视觉架构方案(质朴和金字塔),并评估它们在监视和自监视学习场景下的性能。别的,我们还引入了 AS2DRoPE(即主动缩放 2D RoPE),它将旋转位置编码从 1D 扩展到 2D,并利用插值缩放来顺应恣意分辨率。  
  • 在没有花里胡哨的情况下,VisionLLaMA 在图像天生、分类、语义分割和对象检测等很多代表性使掷中显着优于广泛利用且颠末细致微调的视觉转换器。大量实验表明,VisionLLaMA 比现有视觉转换用具有更快的收敛速率和更好的性能。
本文方案


质朴版VisionLLaMA连续了ViT的处理处罚流程,焦点在于VisionLLaMA模块,见上图。VisionLLaMA与ViT差异之处在于:位置编码自留意力RoPE和SwiGLU激活函数。别的,它仍然利用ViT的LayerNorm,而非RMSNorm。必要留意的是,由于1DRoPE不能很好的扩展到其他分辨率,故作者将其扩展为2维情势,形貌如下:
  z i j l = M H S A ( A S 2 D R o P E ( L a y e r N o r m ( z i j l − 1 ) ) ) + z i j l − 1 z_{ij}^{l} = MHSA(AS2DRoPE(LayerNorm(z_{ij}^{l-1}))) + z_{ij}^{l-1} zijl​=MHSA(AS2

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

登录后关闭弹窗

登录参与点评抽奖  加入IT实名职场社区
去登录
快速回复 返回顶部 返回列表