[논문 리뷰] Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
메타정보
| 항목 | 내용 |
|---|---|
| 저자 | Siyuan Huang, Xiaoye Qu†, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong Liu, Wei-Long Zheng, Yu Cheng† (Shanghai AI Lab · SJTU · CUHK 외) |
| 학회 | arXiv preprint · 2026-05-01 |
| arXiv | 2605.00814 |
| Code | huaixuheqing/PVM |
| 리뷰 일자 | 2026-05-06 |
TL;DR
- 무엇을 — 자기회귀 LVLM이 긴 응답을 생성할수록 시각 토큰에 할당되는 attention mass가 $\mathcal{O}(t^{-1})$로 구조적으로 붕괴한다는 Visual Signal Dilution 현상을 이론·경험적으로 규명하고, 이를 정면 돌파하는 Persistent Visual Memory (PVM) 모듈을 제안한다.
- 어떻게 — Transformer 블록의 FFN과 평행하게 작동하는 경량 bottleneck adapter를 만들어, hidden state를 query로 원본 visual embedding을 cross-attention으로 retrieval한다. 핵심은 partition function이 시각 집합 $\mathcal{V}$에만 한정되는 독립 정규화 — 텍스트 history 길이 $t$와 무관해서 dilution을 우회한다. Visual Silencing Mask로 텍스트 토큰에서만 활성화되고, 게이트 $\lambda$ (0으로 초기화) 로 잔차 주입.
- 결과 — Qwen3-VL-8B에 PVM을 붙이면 8개 멀티모달 벤치마크 평균 +4.8점 (66.7 → 71.5), 4B에서도 +4.4점 (64.0 → 68.4). 추가 파라미터는 27.92M (8B 모델의 ~0.32%), TPOT는 24.28 ms → 25.46 ms (+1.18 ms, throughput -4.6%). 출력 길이가 길어질수록 효과가 단조 증가 (Very Short +6.1% → Long +27.3%) — 이론적 예측이 그대로 실험에 나타난다.
소개 (Introduction)
Large Vision-Language Models (LVLMs)의 진화 속도가 빠르다. Qwen3-VL, InternVL3.5, GLM-4.1V-Thinking 같은 최신 모델은 단순 image captioning을 넘어 다단계 시각 추론, 긴 문서 OCR, multi-image dialogue까지 다루도록 능력을 확장하고 있다. 이 흐름의 한 가운데에는 한 가지 단순한 가정이 있다 — 시각 토큰이 prefix에 한 번 들어가면 그걸로 충분하다는 것. 이미지 인코더가 만든 visual embedding을 시퀀스 앞쪽에 붙여 두면 자기회귀 디코더가 알아서 필요할 때 attention으로 참조한다는 그림이다.
문제는 응답 길이가 길어질 때 발생한다. 수학 문제에서 chain-of-thought (CoT) 단계가 깊어지거나, 문서 분석에서 여러 문단을 거쳐 결론을 내야 할 때, 모델이 점점 시각 정보를 잊는다. 본 논문은 이 현상을 단순한 학습 부산물이 아니라 자기회귀 attention 메커니즘에 내재된 구조적 한계로 격상시킨다 — 시각 토큰의 수 $M$은 고정인데 텍스트 history 길이 $t$는 단조 증가하므로, softmax normalization이 시각 mass를 $\mathcal{O}(t^{-1})$ 속도로 깎아 내린다.
이 논문이 지금 읽을 가치가 있는 이유는 두 가지다. 첫째, dilution 현상에 대한 수학적 lower-bound proof를 제공한다 — 단순한 경험적 관찰이 아니라 partition function 분해를 통해 attention mass의 점근 거동을 정리로 못 박는다. 둘째, 해법인 PVM은 백본을 건드리지 않는 ~0.32% 파라미터 추가만으로 Qwen3-VL 4B/8B에서 일관된 +4.4~4.8점 개선을 만든다. 동일 파라미터 수의 MLP control과 비교해도 +2.5점 우위 — 단순 capacity boost가 아니라 retrieval 메커니즘 자체의 효과임이 입증된다.
핵심 기여 (Key Contributions)
- Visual Signal Dilution의 수학적 정식화 (Theorem 3.1). 자기회귀 LVLM의 visual attention mass $\Omega_{\mathcal{V}}(t)$가 partition function $Z_{\mathcal{V}} + Z_{\mathcal{T}}$의 분해를 통해 $\mathcal{O}(t^{-1})$로 점근 감쇠함을 증명. 추가로 saturation phase에서는 $Z_{\mathcal{T}}^{\text{sat}}$의 plateau에 의해 mass가 $\beta / Z_{\mathcal{T}}^{\text{sat}} \ll 1$로 고정되는 Low-Attention Equilibrium을 정량화한다.
- Parallel retrieval architecture로서의 PVM. Transformer FFN과 평행한 bottleneck branch (Projection → Cross-Attn → FFN → Restoration)로, visual silencing mask와 학습 가능한 게이트 $\lambda$를 통해 잔차로 주입. partition function이 visual set $\mathcal{V}$에만 한정되어 시간 $t$로부터 구조적으로 분리된다는 local invariance property (Theorem 4.1) 를 보장.
- 8개 벤치마크에서 robust하고 scalable한 개선. Qwen3-VL 4B/8B 양쪽에서 +4.4 / +4.8 average accuracy. 출력 길이 그룹별 분석에서 Very Short +6.1% → Long +27.3%로 단조 증가하는 robustness gain — dilution 이론의 직접적 검증.
- Mechanistic analysis로 prediction convergence 가속 입증. LogitLens KL divergence가 PVM 적용 시 layer 8 직후부터 가파르게 떨어져 베이스라인 대비 명확한 improvement gap을 보인다 — 단순 정확도 향상이 아니라 내부 prediction이 “더 빨리 결정된다”는 정성적 변화.
관련 연구 / 배경 지식
LVLM의 시각 신호 유지 문제
GPT-4, LLaMA, Qwen 같은 LLM 위에 vision encoder (CLIP, SigLIP2, EVA)를 결합하는 패러다임은 LLaVA 시리즈 이후 주류가 됐다. 단순한 linear projection (LLaVA), Q-Former (BLIP-2, InstructBLIP), 그리고 최근에는 DeepStack 같은 multi-layer fusion 방식까지 다양하게 발전했지만, 공통점은 visual token이 시퀀스 앞쪽 prefix로 한 번만 들어간다는 것이다.
이 setup의 약점은 generation length가 길어질 때 드러난다. Hallucination 서베이들은 일관되게 “응답이 길어질수록 시각 콘텐츠와 출력의 정합성이 무너진다”고 보고한다. 이전 연구들은 주로 alignment data 부족 또는 RLHF 신호 약화로 해석했지만, 본 논문은 그것이 학습 단계에서 해결될 수 있는 데이터 문제가 아니라 attention 메커니즘 자체의 구조적 결함임을 보인다.
Visual Injection 계열의 한계
이 한계를 풀기 위한 직접적 시도는 visual re-injection이다. MemVR (Zou et al., 2024)은 모델이 uncertainty를 보일 때 raw visual token을 FFN의 key-value memory에 다시 끼워 넣고, ICoT (Gao et al., CVPR 2025)는 attention map 기반 selection으로 입력 이미지의 일부 region을 reasoning chain에 interleave한다. CoMemo (Liu et al., ICML 2025)는 dual-path로 context image와 image memory를 분리한다.
이들은 효과가 있긴 하지만 본 논문이 지적하는 serial interference를 일으킨다 — 직렬 자기회귀 흐름에 시각 토큰을 다시 끼워 넣으면 reasoning chain의 logical state가 교란되고, 이미 형성된 deduction이 깨진다. Disrupted CoT 가 그것이다. 결국 retention과 reasoning 사이에 trade-off가 생긴다.
FFN as Key-Value Memory
PVM의 design 모티브 중 하나는 Geva et al. (EMNLP 2021)의 Transformer Feed-Forward Layers Are Key-Value Memories 결과다. FFN 서브레이어가 학습 패턴 (key) → vocabulary distribution (value)의 lookup table 역할을 한다는 해석. 본 논문은 이 시각을 한 단계 더 밀어 — FFN의 parallel branch에 visual embedding을 key-value로 둔 별도 retrieval module을 추가하면, 백본 weights 자체에 저장된 정적 지식과 입력 이미지의 동적 시각 증거를 깨끗하게 분리할 수 있다고 본다.
방법 / 아키텍처 상세
Visual Signal Dilution: 이론적 분석
현재 query vector $\mathbf{q}_t$에 대해, $k$번째 컨텍스트 토큰의 unnormalized attention score는 $s_k(\mathbf{q}_t) = (\mathbf{q}_t^{\top} \mathbf{k}_k) / \sqrt{d}$. 컨텍스트는 visual set $\mathcal{V}$ ($|\mathcal{V}| = M$, 고정) 와 textual history $\mathcal{T}_t$ ($|\mathcal{T}_t| = t$, 단조 증가) 로 나뉜다. Softmax denominator를 두 부분의 aggregate unnormalized mass로 분해하면:
\[Z_{\mathcal{V}}(\mathbf{q}_t) = \sum_{k \in \mathcal{V}} \exp(s_k(\mathbf{q}_t)), \quad Z_{\mathcal{T}}(\mathbf{q}_t, t) = \sum_{k \in \mathcal{T}_t} \exp(s_k(\mathbf{q}_t)).\]Visual Attention Mass는 시각 집합에 할당된 총 확률 무게:
\[\Omega_{\mathcal{V}}(t) := \sum_{k \in \mathcal{V}} \alpha_{t, k} = \frac{Z_{\mathcal{V}}(\mathbf{q}_t)}{Z_{\mathcal{V}}(\mathbf{q}_t) + Z_{\mathcal{T}}(\mathbf{q}_t, t)}.\]핵심은 두 항의 비대칭이다. $Z_{\mathcal{V}}$는 $M$개의 항으로 한정되어 입력 정규화에 의해 $\beta = M \cdot \exp(s_{\max})$로 상한이 고정된다. 반면 $Z_{\mathcal{T}}$는 historical text의 통계적 유의성 가정 하에 ($t^{-1} Z_{\mathcal{T}}(\mathbf{q}_t, t) \ge \mu > 0$) 선형 누적한다.
Theorem 3.1 (Visual Signal Dilution)
고정 visual context size $M$과 textual attention lower bound $\mu$가 주어지면:
\[\Omega_{\mathcal{V}}(t) \le \frac{\beta}{\beta + \mu \cdot t} = \mathcal{O}(t^{-1}). \tag{2}\]증명은 짧다. $Z_{\mathcal{V}} \le \beta$, $Z_{\mathcal{T}} \ge \mu t$를 정의식에 대입하면 governing inequality가 나오고, $t$가 커지면 분모의 $\mu t$ 항이 상수 $\beta$를 압도해 결과는 $\mathcal{O}(t^{-1})$.
Phase II: High-Magnitude Saturation Trap
실제 attention은 effective window 길이 $W_{\text{eff}}$로 제한되므로 $Z_{\mathcal{T}}$가 무한정 자라지는 않고 결국 $Z_{\mathcal{T}}^{\text{sat}}$ plateau로 안착한다. 그러나 saturation이 dilution을 구조하지 못한다 — 시각 mass는 다음 limit으로 고정된다:
\[\lim_{t \to \infty} \Omega_{\mathcal{V}}(t) \approx \frac{\mathbb{E}[Z_{\mathcal{V}}]}{Z_{\mathcal{T}}^{\text{sat}}} \ll 1.\]즉 dilution이 멈춰도 시각 신호는 이미 textual prior에 압도된 상태로 남는 Low-Attention Equilibrium에 갇힌다. 이게 모델이 긴 reasoning에서 시각 grounding을 잃는 mechanistic explanation이다.
경험적 검증
저자들은 Qwen3-VL-8B-Instruct에 COCO 2017 일부와 Blind Painter stress test (이미지를 brushstroke 단위까지 텍스트로 묘사하라는 prompt)를 던져 attention dynamics를 측정했다. Blind Painter는 매 generation step마다 active visual retrieval을 강제하므로 dilution을 isolating 하는 데 적합하다.
Layer-wise 분석을 추가해 보면 attention 감쇠가 균일하지 않다 — Layer 8-27의 intermediate zone에서 가장 가파르게 붕괴한다. 이 영역이 multimodal reasoning의 primary locus이므로, retrieval 모듈을 끼워 넣을 자연스러운 위치다.
이로부터 두 가지 design insight가 도출된다.
Insight 1. 자기회귀 흐름은 시각 신호를 dilute하므로, 메인 reasoning backbone과 구조적으로 격리된 평행 메모리 경로가 필요하다.
Insight 2. Textual dominance를 막으려면 retrieval 메커니즘이 visual domain에 닫힌 독립 attention normalization을 가져야 한다.
PVM 아키텍처
이 두 insight를 그대로 구현한 결과가 PVM이다.
정보 흐름의 평행 분기
Multi-Head Self-Attention (MHSA) 출력 hidden state $\mathbf{x} \in \mathbb{R}^d$가 두 갈래로 나뉜다:
- Reasoning Path (Original): $\mathbf{h}_{\text{ffn}} = \text{FFN}(\mathbf{x})$ — 사전학습된 정적 지식과 logical pattern을 그대로 사용 (FFN은 frozen).
- Looking Path (PVM): 동일한 $\mathbf{x}$가 PVM 모듈의 Query로 작동해 시각 디테일을 능동적으로 retrieval.
PVM 모듈의 3-stage 계산
파라미터 효율을 위해 PVM은 projected latent space $d’ < d$에서 동작한다. 입력 visual feature는 $\mathbf{V}_{\text{img}} \in \mathbb{R}^{M \times d}$.
-
Projection. 두 개의 독립 reducer $\mathbf{W}_{\text{down}}^{\text{txt}}, \mathbf{W}_{\text{down}}^{\text{vis}} \in \mathbb{R}^{d \times d’}$를 통해 hidden state와 visual feature를 latent space로:
\[\mathbf{x}_{\text{lat}} = \mathbf{x} \mathbf{W}_{\text{down}}^{\text{txt}}, \quad \mathbf{V}_{\text{lat}} = \mathbf{V}_{\text{img}} \mathbf{W}_{\text{down}}^{\text{vis}}.\] -
Latent Retrieval. Cross-attention의 query가 $\mathbf{x}_{\text{lat}}$, key·value 모두 $\mathbf{V}_{\text{lat}}$ — 이게 핵심이다. attention domain이 순수하게 visual set $\mathcal{V}$에만 한정되어 independent attention normalization이 실현된다. 이후 lightweight FFN으로 정제:
\[\mathbf{h}_{\text{attn}} = \text{CrossAttn}(Q = \mathbf{x}_{\text{lat}}, K = \mathbf{V}_{\text{lat}}, V = \mathbf{V}_{\text{lat}}), \quad \mathbf{h}_{\text{lat}} = \mathbf{h}_{\text{attn}} + \text{FFN}_{\text{lat}}(\text{RMSNorm}(\mathbf{h}_{\text{attn}})).\] -
Restoration. Up-projection으로 원래 차원 복원: $\mathbf{h}_{\text{pvm}} = \mathbf{h}_{\text{lat}} \mathbf{W}_{\text{up}}$, $\mathbf{W}_{\text{up}} \in \mathbb{R}^{d’ \times d}$.
Gated Fusion + Selective Activation
PVM 출력은 잔차로 main stream에 주입된다. 두 가지 안전장치:
- Visual Silencing Mask $\mathcal{M}_{\text{txt}} \in {0, 1}^L$: 1이 텍스트 토큰, 0이 이미지 토큰. 시각 토큰 자신을 다시 retrieval하는 self-reflexive loop를 차단한다.
- Learnable scalar gate $\lambda$: 0으로 초기화되어 학습 초기에는 PVM이 forward pass에 영향을 주지 않으므로 사전학습된 capability를 보존한다.
최종 결합:
\[\mathbf{y} = \mathbf{x} + \mathbf{h}_{\text{ffn}} + \underbrace{(\lambda \cdot \mathbf{h}_{\text{pvm}}) \cdot \mathcal{M}_{\text{txt}}}_{\text{Active Visual Injection}}. \tag{3}\]전체 forward pass의 의사코드는 다음과 같다.
Theorem 4.1: 구조적 dilution 완화
PVM 분기에서 $k$번째 visual 토큰에 할당된 unnormalized attention score를 $\psi_k = \frac{1}{\sqrt{d’}} \mathbf{x} \mathbf{W}_Q (\mathbf{v}_k \mathbf{W}_K)^{\top}$, $k$번째 토큰에 할당된 확률 mass를 $\beta_k(\mathbf{x}) = \exp(\psi_k) / Z_{\text{pvm}}(\mathbf{x})$라 하자. 핵심 주장은:
\[Z_{\text{pvm}}(\mathbf{x}) = \sum_{j \in \mathcal{V}} \exp(\psi_j)\]가 오직 고정된 visual set $\mathcal{V}$에만 의존한다는 것 — 시퀀스 길이 $t$가 정의식 어디에도 등장하지 않는다.
Theorem 4.1 (Structural Mitigation of Visual Dilution). 고정 local hidden state $\mathbf{x}$ 조건 하에서 PVM 출력 $\mathbf{h}_{\text{pvm}}$은 textual history 길이 $t$로부터 partition function 차원에서 분리되어 다음 local invariance property를 만족한다:
\[\frac{\partial \|\mathbf{h}_{\text{pvm}}\|}{\partial t} = 0.\]이는 표준 backbone과 정면 대비된다 — 후자는 Theorem 3.1에 따라 $\Omega_{\mathcal{V}}(t) \in \mathcal{O}(t^{-1})$로 점근 감쇠한다. PVM은 이 dependency를 algebraic level에서 끊어낸다.
다만 저자들은 Appendix B에서 솔직하게 인정한다 — 현실 자기회귀에서는 hidden state $\mathbf{x}_t$ 자체가 컨텍스트에 의존하므로 fixed local query assumption이 정확히 성립하지는 않는다. 그럼에도 partition function의 구조적 격리가 보장되므로 textual mass 누적에 의한 직접적 dilution은 막힌다.
학습 목표 / 손실 함수
PVM은 두 단계로 학습된다.
Stage I: Visual Memory Alignment (SFT)
LLM backbone과 vision encoder, projector는 모두 frozen. 학습되는 것은 PVM 모듈과 게이팅 scalar $\lambda$뿐. 이 단계의 목적은 textual query와 visual key 사이의 semantic mapping을 형성하는 것 — autoregressive cross-entropy를 그대로 사용한다.
- 학습 데이터: $\mathcal{D}_{\text{sft}}$, 526k 샘플, OpenMMReasoner-SFT-874K (Zhang et al., 2025) 에서 visual-centric하고 답변이 명확한 부분집합으로 필터링.
- Hyperparameters: AdamW, LR 1e-4 cosine, warmup 0.1, global batch 64, gradient accumulation 8.
Stage II: Policy Refinement (GRPO)
LLM backbone과 PVM 모듈을 unfreeze하고 (vision encoder는 여전히 frozen), Group Relative Policy Optimization (GRPO; Shao et al., 2024) 으로 강화학습. CoT 길이가 긴 복잡한 reasoning에서 active visual retrieval을 강화하는 게 목표.
- 학습 데이터: $\mathcal{D}_{\text{rl}}$, 3.6k 복잡 reasoning query, MMK12 / ThinkLite-VL-hard / ViRL39K / We-Math2.0-Pro 합성. 8개 rollout per query 중 학습 신호가 가장 강한 샘플만 retain.
- Hyperparameters: AdamW, LR 1e-6 constant, group size $G$=8, max completion length 16384, KL coefficient 0.0.
GRPO 자체의 surrogate objective는 다음과 같다:
\[\mathcal{L}_{\text{GRPO}}(\theta) = \mathbb{E}_{q, \{o_i\}_{i=1}^G} \left[ \frac{1}{G} \sum_{i=1}^{G} \min\left( \frac{\pi_\theta(o_i \mid q)}{\pi_{\theta_{\text{old}}}(o_i \mid q)} A_i, \, \text{clip}\left(\frac{\pi_\theta(o_i \mid q)}{\pi_{\theta_{\text{old}}}(o_i \mid q)}, 1-\epsilon, 1+\epsilon\right) A_i \right) \right]\]여기서 $A_i = (r_i - \text{mean}(\mathbf{r})) / \text{std}(\mathbf{r})$는 group-relative advantage. PPO처럼 별도의 critic 모델을 두지 않고 그룹 내 reward 통계로 baseline을 추정하므로 메모리 효율이 좋다.
학습 데이터와 파이프라인
| 단계 | 데이터셋 | 크기 | 학습 모듈 | 목적 |
|---|---|---|---|---|
| Stage I (SFT) | OpenMMReasoner-SFT subset $\mathcal{D}_{\text{sft}}$ | 526k | PVM + gate $\lambda$ (LLM·vision encoder·projector frozen) | Visual memory alignment |
| Stage II (GRPO) | MMK12 + ThinkLite-VL-hard + ViRL39K + We-Math2.0-Pro $\mathcal{D}_{\text{rl}}$ | 3.6k complex reasoning | LLM + PVM unfrozen, vision encoder frozen | Policy refinement for deep reasoning |
| 항목 | 값 |
|---|---|
| Backbone | Qwen3-VL-Instruct (4B / 8B) |
| Injection layers | 8B: ${8, 16, 24}$ — 4B: ${5, 11, 17}$ |
| Latent dim $d’$ | 512 |
| 추가 파라미터 | 27.92M (8B 모델의 ~0.32%) |
| GPUs | 8× NVIDIA H200 (141 GB VRAM each) |
| Optimization | DeepSpeed ZeRO-2 (SFT) / ZeRO-3 (GRPO), FlashAttention-2, gradient checkpointing |
| Precision | bfloat16 |
실험 결과
메인 벤치마크
평가는 8개 멀티모달 벤치마크 — General & Comprehensive 그룹 (MMMU-dev, MMBench-CN-lite, MMBench-EN-lite, MMStar, MMT-emo) 과 Math & Science 그룹 (MathVerse-V, MathVision-mini, AI2D-lite). 4-run 평균, inference temperature 0.7, lmms-eval 프레임워크.
8B 결과 정리:
Qwen3-VL-8B-Instruct 66.7 → SFT 67.4 → LoRA-SFT 67.5 → PVM-8B (SFT) 70.6 → SFT+GRPO 68.3 → LoRA-SFT+GRPO 68.4 → PVM-8B (SFT+GRPO) 71.5
PVM-SFT만으로도 vanilla SFT 대비 +3.2점, LoRA-SFT 대비 +3.1점. GRPO를 추가하면 71.5점에 도달해 RL-tuned 경쟁자 Euclid-8B (69.5), PEARL-8B (69.3), OneThinker-8B (68.0)을 모두 앞선다. 4B에서도 64.0 → 68.4로 동일 폭의 개선 — 단일 모델 사이즈에 fitting된 것이 아니라 scalable한 architectural benefit이다.
Visual Injection 베이스라인 (MemVR 66.5, ICoT 68.3, CoMemo 68.4) 대비도 PVM이 명확히 우위 — 8B 백본을 동일하게 두고 재구현했으므로 +3~5점 차이는 architectural choice 자체에서 온다.
길이 강건성: Robustness to Extended Generation
Theorem 3.1의 직접적 검증이다. MathVerse-V 샘플을 출력 길이 (Very Short / Short / Medium / Long) 4개 그룹으로 나눠 PVM-8B (SFT+GRPO)와 베이스라인을 비교.
상대 개선폭 (Relative Gain): Very Short +6.1% → Short +7.3% → Medium +17.0% → Long +27.3%. 길이가 길수록 PVM의 효과가 단조 증가한다 — Theorem 3.1이 dilution을 sequence length의 함수로 예측하는 게 그대로 실험에 나타난 모습이다. Long group에서 베이스라인 정확도는 39.1점에 불과한데 PVM은 49.8점까지 끌어올린다.
Mechanistic Analysis: Prediction Convergence
Cheng et al. (2026)을 따라 LogitLens 기법으로 모델의 internal prediction dynamics를 probe한다. 각 intermediate layer의 hidden state $\mathbf{h}_\ell$을 unembedding matrix $\mathbf{E}$로 vocabulary space에 투영해 layer-wise 분포 $P_\ell = \text{softmax}(\mathbf{E} \mathbf{h}_\ell)$를 얻고, 최종 분포 $P_{\text{final}}$과의 KL divergence를 측정.
\[D_{\text{KL}}(P_{\text{final}} \| P_\ell) = \sum_{v=1}^{V} P_{\text{final}}(v) \log \frac{P_{\text{final}}(v)}{P_\ell(v)}.\]KL이 작을수록 그 layer가 이미 final answer에 가까운 결정을 내렸다는 뜻이다. Figure 6의 결과를 보면 — baseline, Euclid-8B, CoMemo 모두 gradual decline을 보이지만, PVM은 layer 8 직후부터 distinctly lower trajectory를 그리며 deeper layer로 갈수록 Improvement Gap (회색 영역) 이 벌어진다.
해석은 깔끔하다. PVM이 visual retrieval을 평행 분기로 오프로드하므로, backbone은 perception에서 reasoning으로의 transition을 더 빨리 마칠 수 있다 — 즉 모델이 단순히 더 정확한 게 아니라 더 빨리 결정한다. 단순 capacity boost와는 질적으로 다른 변화다.
결과 분석 / Ablation
Ablation 1: Retrieval Source — raw visual vs processed hidden states
PVM의 핵심 설계 결정 중 하나는 cross-attention의 K, V로 원본 visual embedding을 사용한다는 것이다. 이걸 processed hidden state로 바꾸면 어떻게 될까? 동일한 two-stage 파이프라인으로 재학습한 결과가 Table 2.
| Retrieval Source $(K, V)$ | MathVerse | MathVision | AI2D | Avg. |
|---|---|---|---|---|
| Baseline | 52.9 | 45.4 | 79.8 | 59.4 |
| Processed Hidden States | 27.9 | 14.1 | 58.2 | 33.4 |
| Visual Embeddings (Ours) | 57.5 | 50.7 | 80.8 | 63.0 |
Processed hidden state를 retrieve 하면 catastrophic collapse가 일어난다 — 베이스라인보다도 25점 이상 낮다. 이미 textual prior로 오염된 hidden state를 재주입하면 destructive self-reflexive loop가 형성된다는 해석이다. PVM의 gain이 단순 capacity가 아니라 retrieval design 자체에서 온다는 강력한 증거.
Ablation 2: Injection Layer Selection
8B 모델에서 PVM을 어느 layer에 끼울지 비교. 세 가지 전략:
- Peak Attention (13, 17, 18): 시각 attention mass가 가장 높은 layer를 강화.
- Max Decay (14, 19, 22): attention mass가 가장 가파르게 떨어지는 layer를 보상.
- Strided (8, 16, 24): visual processing이 active해지는 layer 8부터 균일 stride.
| 전략 | Layers | Gen. | Reas. | Avg. |
|---|---|---|---|---|
| Peak Attention | 13, 17, 18 | 72.9 | 60.9 | 68.4 |
| Max Decay | 14, 19, 22 | 74.2 | 61.2 | 69.3 |
| Strided (Ours) | 8, 16, 24 | 75.2 | 63.0 | 70.6 |
Strided가 가장 우수하다 (avg 기준 +1.3점 over Max Decay, +2.2점 over Peak Attention; 저자들은 reasoning subset에서의 +1.8점 우위를 강조한다). 가장 강한 layer만 reinforce하는 Peak 전략이 의외로 가장 약한데, 저자들은 diminishing returns 때문이라 해석한다 — 이미 시각 정보를 잘 보는 layer는 추가 retrieval로 얻을 게 적고, 오히려 전체 깊이를 cover하는 글로벌 분포가 중요하다는 결론.
Ablation 3: Latent Dimension Size
Latent bottleneck $d’$의 sensitivity 검증.
| $d’$ | General | Reasoning | Avg. |
|---|---|---|---|
| 512 (Ours) | 75.2 | 63.0 | 70.6 |
| 1024 | 73.8 | 61.4 | 69.2 |
| 2048 | 74.7 | 61.6 | 69.8 |
$d’$를 키워도 성능이 오히려 떨어진다. 저자들은 데이터-capacity mismatch로 해석한다 — 더 큰 파라미터 공간을 saturating할 supervision signal이 부족해 optimization difficulty 또는 noise overfitting이 생긴다. $d’ = 512$가 sufficient capacity와 robust trainability의 sweet spot.
Ablation 4: Iso-Parameter Control
PVM의 이득이 단순 파라미터 추가 때문은 아닌가? 동일 파라미터 수의 parallel MLP 베이스라인 (visual cross-attention 없이, processed hidden state만 사용) 을 동일 SFT+GRPO 파이프라인으로 학습.
| 모델 | MMMU | MMB-CN | MMB-EN | MMStar | MMT | MathVerse | MathVision | AI2D | Avg. |
|---|---|---|---|---|---|---|---|---|---|
| SFT + GRPO | 60.7 | 88.8 | 87.9 | 68.6 | 54.2 | 58.5 | 48.0 | 79.6 | 68.3 |
| MLP (SFT+GRPO) | 63.3 | 88.8 | 88.7 | 70.0 | 55.0 | 58.0 | 48.7 | 79.4 | 69.0 |
| PVM-8B (SFT+GRPO) | 67.3 | 91.2 | 89.4 | 71.6 | 58.3 | 59.8 | 51.3 | 82.8 | 71.5 |
같은 파라미터 수를 유지하면서도 PVM이 MLP control 대비 +2.5점 우위 — 즉 추가된 파라미터가 단순한 regularizer / capacity booster로 작동하는 게 아니라, visual retrieval mechanism 자체가 이득을 만든다는 깔끔한 control study.
추론 비용
| Metric | Qwen3-VL-8B Baseline | PVM-Enhanced | Delta |
|---|---|---|---|
| Decoding Throughput | 41.18 tokens/s | 39.28 tokens/s | -4.61% |
| Time Per Output Token (TPOT) | 24.28 ms | 25.46 ms | +1.18 ms |
H200 1장, bfloat16, FlashAttention-2 환경. TPOT 증가 1.18 ms는 미미해 real-time inference에 거의 영향이 없다 — PVM이 갖는 +4.8점의 정확도 향상에 비해 매우 favorable한 trade-off.
한계와 비판적 평가
저자들이 직접 인정한 한계:
- Backbone 일반성. 실험은 Qwen3-VL 4B/8B만 다룬다. PVM의 parallel design은 이론적으로 backbone-agnostic이지만 다른 LVLM (InternVL, GLM-4.1V, Pixtral, Llama-3.2-Vision 등) 으로의 generalization은 후속 연구로 남는다.
- Fixed local query assumption. Theorem 4.1의 invariance property는 local hidden state $\mathbf{x}$를 고정한다는 가정에 기댄다. 실제 자기회귀 generation에서는 $\mathbf{x}_t$ 자체가 컨텍스트로부터 evolving하므로 exact global invariance는 보장되지 않는다. 저자들도 Appendix B에서 솔직하게 인정한다.
- Static visual context. 단일 정적 이미지에 대한 dilution mitigation에 집중한다. Streaming video나 dynamic multi-image setup에서는 visual set $\mathcal{V}$ 자체가 시간에 따라 변하므로 추가 design이 필요.
리뷰어 입장에서 추가로 짚을 만한 점:
- 하이퍼파라미터 robustness. Strided ${8, 16, 24}$ 전략이 Qwen3-VL 8B의 36-layer 구조에 fitting된 결정인 게 분명하다. 더 깊거나 얕은 backbone에서 동일한 stride가 작동하는지 검증이 부족하다 — Layer-wise visual attention distribution이 backbone마다 다르면 strategy도 재조정해야 할 가능성이 있다.
- Vision encoder freeze의 영향. 두 stage 모두 vision encoder는 frozen이다. PVM이 visual embedding을 raw 하게 retrieve 하는 게 핵심 design이라 합리적이지만, 시각 표현 자체가 약한 도메인 (의료 영상, 위성 사진 등) 에서는 encoder unfreeze가 더 큰 이득을 줄 수 있다.
- GRPO group size = 8의 비용. Stage II는 query당 8개 rollout을 만들고 가장 강한 학습 신호만 retain한다. 3.6k query × 8 rollout = 28.8k generation이 필요한데, max completion length 16384임을 감안하면 GRPO 단계의 compute가 SFT보다 훨씬 비싸다. 이 비용 대비 GRPO의 marginal gain (8B에서 70.6 → 71.5, +0.9점) 이 정당화되는지는 deployment context에 달려 있다.
- Long-output 강건성의 메커니즘. Figure 5의 단조 증가는 인상적이지만, MathVerse-V 한 벤치마크에서만 검증됐다. 다른 long-form 시나리오 (긴 문서 요약, multi-image dialogue, video QA) 로 generalize하는지는 추가 실험이 필요.
시사점 / Takeaways
- Hallucination ≠ alignment 부족. 본 논문이 보여준 것은 LVLM의 long-output hallucination이 학습 데이터나 RLHF로 풀 수 있는 문제가 아니라 attention mechanism 자체의 구조적 결함이라는 점이다. Partition function 분해를 보여주는 Theorem 3.1은 이 문제를 architecture level에서 다뤄야 한다는 강한 메시지를 준다.
- Parallel branch 패러다임. Reasoning과 perception을 같은 채널에 섞지 말고 두 개의 평행 경로로 분리하는 것이 핵심 design choice다. FFN이 정적 지식 lookup을 담당하고, PVM이 동적 visual retrieval을 담당한다 — 이 분업이 dilution과 serial interference를 동시에 푼다.
- Independent attention normalization의 가치. Partition function이 visual set에만 한정된다는 단순한 사실이 이론적 invariance와 실험적 robustness를 동시에 만든다. 향후 multimodal architecture를 설계할 때 attention normalization scope 자체가 design knob이라는 점이 명확해진다.
- Length-stratified evaluation의 중요성. 평균 점수만 보면 +4.8점이지만, length stratification으로 보면 Long group에서 +27.3%로 효과가 압도적이다. LVLM 평가에서 응답 길이별 강건성 분석이 표준이 되어야 한다는 함의.
- Iso-parameter control이 강력한 검증 도구. 동일 파라미터 수의 MLP baseline 대비 +2.5점 우위는 architectural innovation을 정당화하는 가장 깨끗한 증거다. 새 모듈을 제안할 때 iso-parameter control을 기본값으로 삼는 게 좋겠다.
설치 및 사용법
저자들은 GitHub repo huaixuheqing/PVM에 코드를 공개한다고 abstract에 명시했다. 본 리뷰 작성 시점 (2026-05-06) 에는 모델 카드와 학습 스크립트의 정확한 사용법을 파악하기 위해 repo를 직접 확인할 것을 권장한다. 일반적인 흐름은 다음과 비슷할 것이다:
# 가상 코드 — 실제 API는 repo 확인 필요
from pvm import PVMConfig, PVMModel
cfg = PVMConfig(
backbone="Qwen3-VL-8B-Instruct",
injection_layers=[8, 16, 24],
latent_dim=512,
)
model = PVMModel.from_pretrained("huaixuheqing/PVM-8B-SFT-GRPO", config=cfg)
inputs = processor(text=prompt, images=[image], return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=2048, temperature=0.7)
참고 자료
- 논문: arXiv:2605.00814
- 코드: GitHub: huaixuheqing/PVM
- Backbone: Qwen3-VL Technical Report (arXiv:2511.21631)
- SFT 데이터: OpenMMReasoner (arXiv:2511.16334)
더 읽어보기
- Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language Models (Zou et al., 2024) — uncertainty-driven visual retracing으로 raw visual token을 FFN에 재주입. PVM이 베이스라인 (MemVR) 으로 비교한 visual injection 계열의 대표.
- Interleaved-Modal Chain-of-Thought (Gao et al., CVPR 2025) — attention-driven selection으로 입력 이미지 region을 reasoning chain에 interleave. ICoT 역시 PVM의 baseline.
- CoMemo: LVLMs Need Image Context with Image Memory (Liu et al., ICML 2025) — context image와 image memory를 분리한 dual-path 아키텍처와 RoPE-DHR. PVM의 또 다른 baseline.
- DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs (Meng et al., NeurIPS 2024) — 시각 토큰을 multi-layer로 stack 하는 단순한 architecture. PVM은 Qwen3-VL이 이미 채택한 DeepStack 스타일 위에 retrieval 분기를 추가한다.
- Transformer Feed-Forward Layers Are Key-Value Memories (Geva et al., EMNLP 2021) — FFN이 key-value memory처럼 작동한다는 해석. PVM이 FFN과 평행한 parallel memory branch를 두는 design 모티브.
- Qwen3-VL Technical Report (Bai et al., 2025) — 본 논문의 backbone (4B/8B 변형 포함). 256K 토큰 native long context와 DeepStack 통합이 핵심.
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models (Shao et al., 2024) — Stage II에서 사용한 GRPO 알고리즘의 출처. Critic 없이 group-relative baseline으로 PPO 메모리 비용을 줄인다.
- OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe (Zhang et al., 2025) — PVM의 SFT 단계가 사용한 874K 멀티모달 reasoning 데이터셋. Two-stage SFT + RL recipe.
Enjoy Reading This Article?
Here are some more articles you might like to read next: