质朴版VisionLLaMA连续了ViT的处理处罚流程,焦点在于VisionLLaMA模块,见上图。VisionLLaMA与ViT差异之处在于:位置编码自留意力RoPE和SwiGLU激活函数。别的,它仍然利用ViT的LayerNorm,而非RMSNorm。必要留意的是,由于1DRoPE不能很好的扩展到其他分辨率,故作者将其扩展为2维情势,形貌如下:
z i j l = M H S A ( A S 2 D R o P E ( L a y e r N o r m ( z i j l − 1 ) ) ) + z i j l − 1 z_{ij}^{l} = MHSA(AS2DRoPE(LayerNorm(z_{ij}^{l-1}))) + z_{ij}^{l-1} zijl=MHSA(AS2