Files
2nd/10_Wiki/Topics/AI_and_ML/Multinomial-Naive-Bayes.md
T

3.5 KiB

id, title, category, status, canonical_id, aliases, duplicate_of, source_trust_level, confidence_score, tags, raw_sources, last_reinforced, github_commit, inferred_by
id title category status canonical_id aliases duplicate_of source_trust_level confidence_score tags raw_sources last_reinforced github_commit inferred_by
wiki-2026-0508-multinomial-naive-bayes Multinomial Naive Bayes 10_Wiki/Topics needs_review self
ML-MNB-001
none A 1.0
machine-learning
nlp
naive-bayes
text-classification
Statistics
bayesian
2026-04-26 pending Claude Opus 4.7 (auto-normalize 2026-05-08)

Multinomial Naive Bayes (다항 나이브 베이즈)

📌 한 줄 통찰 (The Karpathy Summary)

"단어의 빈도 속에 숨겨진 확률의 힘을 믿고, 복잡한 문맥 대신 통계적 정직함으로 문서를 분류하라" — 각 특징(단어 빈도)이 다항 분포를 따른다고 가정하고, 베이즈 정리를 활용하여 문서의 카테고리를 예측하는 텍스트 마이닝의 고전적 베이스라인 알고리즘.

📖 구조화된 지식 (Synthesized Content)

  • 추출된 패턴: "Word Frequency Likelihood" — 문장을 단순히 단어의 뭉치(Bag-of-Words)로 보고, 특정 클래스에서 해당 단어들이 나타날 조건부 확률을 결합하여 가장 높은 사후 확률을 가진 클래스를 선택하는 패턴.
  • 주요 특징:
    • Efficiency: 연산량이 매우 적어 대규모 텍스트 데이터를 순식간에 처리 가능.
    • Robustness to Small Data: 데이터가 적을 때도 나이브 베이즈 특유의 '강한 가정' 덕분에 비교적 안정적인 성능 발휘.
    • Laplace Smoothing: 한 번도 나오지 않은 단어 때문에 확률이 0이 되는 현상을 방지하는 필수 기법 적용.
  • 의의: 딥러닝 시대 이전까지 스팸 필터링, 뉴스 분류 등 텍스트 처리의 표준이었으며, 현재도 복잡한 모델을 돌리기 전 성능의 기준점(Baseline)으로 널리 활용됨.

⚠️ 모순 및 업데이트 (Contradictions & Updates)

  • 과거 데이터와의 충돌: 단어 간의 독립성을 가정(Naive)하기 때문에 문맥이나 단어 순서를 무시한다는 치명적 단점이 있으나, 실제 텍스트 분류 환경에서는 이 단순함이 오히려 강력한 일반화 성능을 제공하는 '나이브 베이즈의 역설'이 종종 발생함.
  • 정책 변화: Antigravity 프로젝트는 수집된 원시 데이터(Raw Data)를 1차적으로 빠르게 카테고리화하거나, 키워드 기반의 의도 분류를 수행할 때 비용 대비 효율이 극대화된 다항 나이브 베이즈 모델을 활용함.

🔗 지식 연결 (Graph)

🤖 LLM 활용 힌트 (How to Use This Knowledge)

언제 이 지식을 쓰는가:

  • (TODO)

언제 쓰면 안 되는가:

  • (TODO)

🧪 검증 상태 (Validation)

  • 정보 상태: needs_review
  • 출처 신뢰도: A
  • 검토 이유: (P-Reinforce Phase 1 자동 정규화. 본문 검증 필요.)

🧬 중복 검사 (Duplicate Check)

  • 기존 유사 문서: (TODO: 인덱서 클러스터 리포트 참조)
  • 처리 방식: UPDATE (자동 정규화)
  • 처리 이유: Phase 1 정규화 — 옛 템플릿/누락 필드 보강.

🕓 변경 이력 (Changelog)

날짜 변경 내용 처리 방식 신뢰도
2026-05-08 P-Reinforce Phase 1 정규화 (frontmatter + 헤더 표준화) UPDATE A