Files
2nd/10_Wiki/Topics/AI_and_ML/KV Cache Compression.md
T

2.4 KiB


id: P-Reinforce-AUTO-KVCP-001 category: Unified confidence_score: 1.00 tags: [auto-reinforced, kv-cache-compression, attention-optimization, thin-kv, eviction-policy] last_reinforced: 2026-05-04

KV Cache Compression

📌 한 줄 통찰 (The Karpathy Summary)

"기억의 다이어트: 모든 정보를 무작정 들고 있는 대신, 맥락에 덜 중요한 토큰을 선별적으로 삭제하거나 압축함으로써 한정된 VRAM 안에서 무한에 가까운 문맥을 수용하려는 고도의 최적화 전략."

📖 구조화된 지식 (Synthesized Content)

KV 캐시 압축(KV Cache Compression)은 메모리 사용량을 줄여 더 긴 시퀀스를 처리하거나 처리량을 높이기 위해, 중요도가 낮은 KV 데이터를 제거하거나 요약하는 기법입니다.

  1. 주요 전략:
    • 축출 (Eviction): 어텐션 점수가 낮거나 정보 가치가 적은 토큰의 K, V 값을 캐시에서 삭제합니다. (예: StreamingLLM, H2O)
    • 병합 (Merging/Pooling): 유사한 의미를 가진 여러 토큰의 KV 값을 하나로 합쳐서 저장합니다.
    • 동적 선택: 추론 시 모델이 스스로 어떤 정보를 기억하고 어떤 정보를 잊을지 결정하게 합니다.
  2. ThinKV (최신 사례):
    • 논리적 '생각(Thought)'의 중요도에 따라 덜 중요한 KV 캐시 토큰을 선제적으로 비우고, 별도의 압축 오버헤드 없이 메모리 슬롯을 제자리에서 재사용(In-place reuse)하는 하이브리드 압축 프레임워크입니다.
  3. 장점:
    • 메모리 풋프린트를 50%~90% 이상 획기적으로 줄일 수 있습니다.
    • 하드웨어 증설 없이 소프트웨어만으로 더 긴 컨텍스트 윈도우를 확보합니다.

⚖️ Trade-offs & Caveats

  • 정확도 손실: 중요한 토큰이 축출될 경우 모델의 추론 논리가 깨지거나 환각(Hallucination)이 발생할 수 있습니다.
  • 연산 오버헤드: 어떤 토큰을 버릴지 계산하는 과정 자체가 추가적인 지연 시간(Latency)을 발생시킬 수 있습니다.

🔗 지식 연결 (Graph)


Last updated: 2026-05-04