Organizer 정리 산출물(From_RawData) + 이사 체크리스트 + 인덱스 갱신
- Raw_Data 자동 정리 산출물이 각 도메인 From_RawData/ 로 편입, 00_INDEX 연결 갱신 - 컴퓨터_이사_체크리스트.md 추가 (두뇌-상대 경로 규약 v2.2.304 — 새 컴퓨터에서 바꿀 절대 경로는 localBrainPath 1개) - Astra 세션 산출물(에피소드 기억·기능 인벤토리) 갱신 Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,90 @@
|
||||
---
|
||||
id: pagedattention
|
||||
title: "PagedAttention"
|
||||
category: "AI_and_ML"
|
||||
status: "draft"
|
||||
verification_status: "conceptual"
|
||||
canonical_id: ""
|
||||
aliases:
|
||||
- "페이지드 어텐션"
|
||||
- "Paged Attention"
|
||||
- "메모리 관리 기법"
|
||||
duplicate_of: ""
|
||||
source_trust_level: "C"
|
||||
confidence_score: 0.85
|
||||
created_at: 2026-07-11
|
||||
updated_at: 2026-07-11
|
||||
review_reason: ""
|
||||
merge_history: []
|
||||
tags: ["research", "context 이해 규칙", "LLM", "KV Caching"]
|
||||
raw_sources:
|
||||
- "[AI/LLM] Transformer Attention 이해하기: Q, K, V의 역할과 동작 원리"
|
||||
applied_in: []
|
||||
github_commit: ""
|
||||
---
|
||||
|
||||
# [[PagedAttention]]
|
||||
|
||||
## 🎯 한 줄 통찰 (One-line insight)
|
||||
긴 시퀀스를 처리하는 대규모 언어 모델(LLM)에서 GPU VRAM의 KV 캐시 점유율 문제를 해결하기 위해 활용되는 메모리 관리 기법이다.
|
||||
|
||||
## 🧠 핵심 개념 (Core concepts)
|
||||
- **KV Caching 연계**: 디코더 모델이 토큰을 생성할 때 연산량을 줄이기 위해 이전 스텝의 K(Key), V(Value) 벡터를 저장하는 과정에서 파생되는 메모리 한계를 관리한다.
|
||||
- **GPU VRAM 관리**: 긴 시퀀스 입력 시 기하급수적으로 증가하는 GPU VRAM의 캐시 점유율을 효율적으로 통제하는 역할을 수행한다.
|
||||
|
||||
## 🧩 추출된 패턴 (Extracted patterns)
|
||||
소스에 관련 정보가 부족합니다.
|
||||
|
||||
## 📖 세부 내용 (Details)
|
||||
- 트랜스포머(Transformer) 기반의 자기회귀(Auto-regressive) 디코더 모델은 토큰을 생성할 때마다 전체 시퀀스의 Key와 Value를 재계산하지 않기 위해 메모리에 이를 저장해두는 **KV Caching** 기법을 사용한다 [S1].
|
||||
- KV Caching은 연산량(FLOPs)을 줄여 Time-to-First-Token(TTFT) 및 처리량(Throughput)을 개선하지만, 긴 시퀀스를 처리할수록 GPU VRAM의 캐시 점유율이 심각하게 높아지는 한계가 존재한다 [S1].
|
||||
- **PagedAttention**은 이러한 GPU VRAM의 한계를 극복하고 캐시 점유율을 제어하기 위해 KV Caching과 병행하여 도입되는 메모리 관리 기법이다 [S1].
|
||||
- (주의: PagedAttention의 구체적인 수학적 알고리즘이나 내부 구조적 특징에 대해서는 소스에 관련 정보가 부족합니다.)
|
||||
|
||||
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
|
||||
소스에서 확인되지 않음.
|
||||
|
||||
## 🛠️ 적용 사례 (Applied in summary)
|
||||
현재 발견된 실제 적용 사례가 없습니다.
|
||||
|
||||
## 💻 코드 패턴 (Code patterns)
|
||||
소스에 코드 예시 없음.
|
||||
|
||||
## ✅ 검증 상태 및 신뢰도
|
||||
- **상태:** draft
|
||||
- **검증 단계:** conceptual
|
||||
- **출처 신뢰도:** C
|
||||
- **신뢰 점수:** 0.85
|
||||
- **중복 검사 결과:** 신규 생성 (New discovery)
|
||||
|
||||
## 🔗 관련 문서 링크 (Related document links)
|
||||
|
||||
### 상위/유사 개념
|
||||
- [[KV Caching]] — PagedAttention이 도입되게 된 원인이자 연산 효율을 높이기 위한 선행 기술
|
||||
- [[Transformer]] — PagedAttention 기법이 적용되는 LLM의 근간이 되는 아키텍처
|
||||
|
||||
### 심층 후속 질문 (Deeper Research Questions)
|
||||
- PagedAttention은 운영체제의 가상 메모리 페이징(Paging) 기법과 구체적으로 어떤 구조적 유사성을 가지는가?
|
||||
- 긴 시퀀스를 처리할 때 PagedAttention을 적용했을 때와 적용하지 않았을 때의 VRAM 점유율 및 Throughput 차이는 어느 정도인가?
|
||||
- PagedAttention이 GPU 메모리 단편화(Fragmentation) 현상을 어떻게 해결하는가?
|
||||
|
||||
### 실무 적용 맥락 (Practical Application Contexts)
|
||||
- **Implementation:** 소스에서 확인되지 않음.
|
||||
- **System Design:** 긴 문맥(Long-context)을 다루는 LLM 서빙 및 추론 시스템 구축 시, 메모리 한계 극복을 위한 캐시 아키텍처 설계에 참조.
|
||||
- **Operation / Maintenance:** 소스에서 확인되지 않음.
|
||||
- **Learning Path:** 트랜스포머의 어텐션 메커니즘 $\rightarrow$ 디코더 모델의 병목 현상 이해 $\rightarrow$ KV Caching $\rightarrow$ PagedAttention 기반의 메모리 최적화 학습.
|
||||
|
||||
### 인접 주변 주제 (Adjacent Topics)
|
||||
- [[Attention Mechanism]] — 입력 데이터 내 정보들 간의 가중치와 연관성을 계산하는 딥러닝 핵심 원리
|
||||
- [[LLM Serving]] — 완성된 언어 모델을 사용자에게 효율적으로 배포하고 추론(Inference) 속도를 최적화하는 환경
|
||||
|
||||
## 🔗 지식 그래프 (Knowledge Graph)
|
||||
- **상위/루트:** [[context 이해 규칙]]
|
||||
- **관련 개념:** [[KV Caching]], [[Transformer]]
|
||||
- **참조 맥락:** LLM의 추론 최적화 과정에서 발생하는 메모리 병목 현상을 이해하고, 이를 극복하는 관리 시스템을 설계할 때 참조.
|
||||
|
||||
## 📚 출처 (Sources)
|
||||
- [S1] [AI/LLM] Transformer Attention 이해하기: Q, K, V의 역할과 동작 원리 (https://mvje.tistory.com/258)
|
||||
|
||||
## 📝 변경 이력 (Change history)
|
||||
- 2026-07-11: Initial draft generated via Datacollector_MAC P-Reinforce engine.
|
||||
Reference in New Issue
Block a user