2nd/10_Wiki/Topics/AI_and_ML/KV Cache Compression.md

---
id: [[P-Reinforce|P-Reinforce]]-AUTO-KVCP-001
category: Unified
confidence_score: 1.00
tags: [auto-reinforced, kv-cache-compression, attention-optimization, thin-kv, eviction-policy]
last_reinforced: 2026-05-04
---

# [[KV Cache Compression|KV Cache Compression]]

## 📌 한 줄 통찰 (The Karpathy Summary)
> "기억의 다이어트: 모든 정보를 무작정 들고 있는 대신, 맥락에 덜 중요한 토큰을 선별적으로 삭제하거나 압축함으로써 한정된 VRAM 안에서 무한에 가까운 문맥을 수용하려는 고도의 최적화 전략."

## 📖 구조화된 지식 (Synthesized Content)
KV 캐시 압축(KV Cache Compression)은 메모리 사용량을 줄여 더 긴 시퀀스를 처리하거나 처리량을 높이기 위해, 중요도가 낮은 KV 데이터를 제거하거나 요약하는 기법입니다.

1.  **주요 전략**:
    *   **축출 (Eviction)**: 어텐션 점수가 낮거나 정보 가치가 적은 토큰의 K, V 값을 캐시에서 삭제합니다. (예: StreamingLLM, H2O)
    *   **병합 (Merging/Pooling)**: 유사한 의미를 가진 여러 토큰의 KV 값을 하나로 합쳐서 저장합니다.
    *   **동적 선택**: 추론 시 모델이 스스로 어떤 정보를 기억하고 어떤 정보를 잊을지 결정하게 합니다.
2.  **ThinKV (최신 사례)**:
    *   논리적 '생각(Thought)'의 중요도에 따라 덜 중요한 KV 캐시 토큰을 선제적으로 비우고, 별도의 압축 오버헤드 없이 메모리 슬롯을 제자리에서 재사용(In-place reuse)하는 하이브리드 압축 프레임워크입니다.
3.  **장점**:
    *   메모리 풋프린트를 50%~90% 이상 획기적으로 줄일 수 있습니다.
    *   하드웨어 증설 없이 소프트웨어만으로 더 긴 컨텍스트 윈도우를 확보합니다.

## ⚖️ Trade-offs & Caveats
*   **정확도 손실**: 중요한 토큰이 축출될 경우 모델의 추론 논리가 깨지거나 환각(Hallucination)이 발생할 수 있습니다.
*   **연산 오버헤드**: 어떤 토큰을 버릴지 계산하는 과정 자체가 추가적인 지연 시간(Latency)을 발생시킬 수 있습니다.

## 🔗 지식 연결 (Graph)
*   **상위 개념**: [[Key-Value (KV) Cache|Key-Value (KV) Cache]]
*   **연관 기술**: [[Sparse Attention|Sparse Attention]], [[KV Cache Quantization|KV Cache Quantization]], [[ThinKV|ThinKV]], [[StreamingLLM|StreamingLLM]]

---
*Last updated: 2026-05-04*