Summary
Research Question
This paper investigates whether accuracy is a sufficient metric for evaluating KV cache compression methods in large reasoning models (LRMs), questioning the assumption that final-answer accuracy alone validates compression quality.
Key Findings
The authors identify an "answer-evidence gap": compressed models can maintain high accuracy while losing the reasoning evidence that justifies their answers. The paper reveals that accuracy is an asymmetric diagnostic—while accuracy collapse is informative, preserved accuracy can conceal evidential degradation.
Experimental Setup
- Models: Qwen3-8B (primary), plus DeepSeek-R1-Distill-Llama-8B
- Tasks: AIME26 (math reasoning), GPQA (question answering), MedCalc (medical calculations), RULER (retrieval)
- Methods tested: 10 KV compression methods including SnapKV, HeadKV, AdaKV, PyramidKV, StreamingLLM, and quantization baseline (KIVI-2bit)
- Budget: 256-token cache compression
Key Metrics
- Accuracy (Acc.): Final answer correctness
- Reasoning Correctness (RWAC/crct.): Whether the reasoning chain supports the answer
- Fidelity (Fid.): Robustness to injected misleading evidence
Key Findings
1. The Answer-Evidence Gap
- Compression preserves answer accuracy but degrades reasoning quality and robustness
- AIME baseline: Full-KV achieves 56.7% accuracy with 11.8% RWAC; compressed methods (AdaKV, HeadKV, SnapKV) show 23-27% accuracy with dramatically reduced Fidelity (30-35% vs 91.1% full-KV)
2. Accuracy is Asymmetric (Question 1)
- Accuracy collapse reveals compression damage, but preserved accuracy can hide invalid reasoning
- Failure modes are compression-method-specific:
- SnapKV: mostly fails on chain inconsistencies
- StreamingLLM: fails through low fidelity and poor accuracy simultaneously
- MedCalc: formula-triggering info survives, but verification anchors don't
3. Rank Correlation Failure (Question 2)
- Accuracy rankings correlate poorly with reasoning-quality rankings
- Example on GPQA: LagKV achieves even better accuracy than full-KV but performs catastrophically on reasoning consistency (RWAC/crct ≈ 55% vs 10. propagation)
- At 256-token budget, ranking by accuracy versus chain consistency reverses the top performers
4. Robustness to Perturbations
- Fixed-trace perturbation testing shows compression affects resistance to misleading information
- Different methods fail at different perturbation positions:
- StreamingLLM over-retains early tokens (high vulnerable to early intervention)
- SnapKV ignores late content, making it vulnerable to end perturbations
- Attention-based methods bias toward conclusion-like patterns, sometimes hallucinating new "sinks" after perturbation
5. Task-Specific Divergence
- Retrieval-heavy tasks (RULER): accuracy collapse is visible → accuracy is informative
- Reasoning problems: partial evidence suffices for correct answers but not for verification or robustness → accuracy hides the gap
6. Key Insight for Compression Methods
Figure 3 shows that compression strategies differ dramatically in their retention patterns—neither recency-only (TOVA) nor attention-based (SnapKV) methods account for answer–evidence entanglement, leading to:
- Loss of proximal verification steps
- Distortion of reasoning chains
- Vulnerability to misleading perturbations
Main Recommendations
- Evaluation: Always pair accuracy with faithfulness metrics (RWAC/correct, fidelity)
- Design: Future compressors must preserve dependency structure and provenance, not just salient tokens
- No method currently achieves both high accuracy and high faithfulness simultaneously
Significance
This work challenges the adequacy of accuracy-only evaluation in KV compression research, highlighting that for reasoning tasks, evidence preservation is as important as answer accuracy.
Related papers
- Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench
PREDICATELONGBENCH shows frontier LLMs collapse on simple long-context retrieval tasks when predicate arity, quantifier complexity, or adversarial decoys increase, even with unchanged answers.
- ExpertPlex: A High-Goodput Disaggregated Serving System for MoE LLMs with Adaptive Persistent Kernels
ExpertPlex shares MoE expert weights across prefill and decode while disaggregating attention, achieving up to 5.65x goodput gains via tile-level preemptive GPU scheduling.
- The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation
Harness choice drives up to a 40x token cost difference per solved coding task while shifting pass rates by only 0-8 percentage points, making harness-model pairs the correct evaluation unit.