--- id: rlhf title: "RLHF" category: "AI" status: "draft" verification_status: "conceptual" canonical_id: "" aliases: ["RLHF", "Reinforcement Learning from Human Feedback", "인간 피드백 강화학습"] duplicate_of: "" source_trust_level: "B" confidence_score: 0.80 created_at: 2026-07-11 updated_at: 2026-07-11 review_reason: "깨진 링크 다발 해소용 AI 생성 초안 — 원출처 리서치로 검증·보강 권장" merge_history: [] tags: ["ai","llm","training"] raw_sources: [] applied_in: [] github_commit: "" --- # [[RLHF]] ## 🎯 한 줄 통찰 (One-line insight) 인간의 선호 판단을 보상 신호로 바꿔 언어 모델을 미세조정하는 기법 — "정답"을 정의하기 어려운 품질(유용함·무해함)을 사람의 비교 선택으로 학습시킨다. ## 🧠 핵심 개념 (Core concepts) - **3단계 파이프라인** — ① 지시 데이터로 SFT(지도 미세조정) ② 사람이 응답 쌍을 비교한 데이터로 보상 모델 학습 ③ 보상 모델을 신호로 정책(LLM)을 강화학습(PPO 등) 최적화. - **보상 해킹 위험** — 모델이 보상 모델의 허점을 파고들어 점수만 높은 응답을 낸다. KL 페널티로 원 모델에서 과도하게 벗어나지 않게 잡는다. - **변형들** — 보상 모델 없이 선호 쌍으로 직접 최적화하는 DPO 등 경량 대안이 실무에서 확산됐다. - **아첨(sycophancy) 부작용** — 사람이 "듣기 좋은 답"을 선호하는 경향이 보상에 새어들어 모델이 아부하게 될 수 있다. ## 🧩 추출된 패턴 (Extracted patterns) - RLHF 의 품질은 알고리즘보다 선호 데이터의 품질(누가·어떤 기준으로 비교했나)이 결정한다. ## 🔗 Knowledge Connections - **Related Topics:** [[Software Architecture]]