Topic_Agent/Topic_Blog/Topics/Topics_Biz/Topics_Meeting/Topics_Rag의 마크다운 지식 문서를
Topic_General/Topic_Programming/Topic_Graphic/Topic_Business 4개 카테고리로 재분류.
- 중복 제거: frontmatter의 status:duplicate/merged + duplicate_of/redirect_to 필드로
자기 자신을 중복으로 선언한 리다이렉트 stub 1032개 제거, 완전 동일 내용 파일 472개 제거,
동일 파일명·다른 내용 충돌 시 더 큰(완전한) 버전만 유지(162개 제거) — 총 1639개 중복 제거.
- 분류: 폴더 단위로 명확한 항목(AI_and_ML/Coding/Architecture 등 → Programming,
Comfyui/Visual_Effects → Graphic, Topics_Biz/Topics_Meeting/사업 등 → Business,
Poetic_Blog_Writing/창의성/Game_Design 등 → General)은 폴더 우선순위로,
나머지 혼재 폴더(Topic_Agent/Topic_Blog/Topics 루트/Thinking & Reasoning/Other/UI_UX_Assets)는
title/tags 키워드 스코어링으로 파일 단위 분류(불명확한 경우 General로 폴백).
원본 폴더명은 "From_*" 서브폴더로 보존해 추적 가능성 유지.
- 최종 배치: Programming 2784 / General 1608 / Graphic 285 / Business 249 = 4926개 문서.
- 에이전트 운영 상태(.astra/.agent/.obsidian/sessions/memory/_company/docs/lessons/_shared/src)는
지식 콘텐츠가 아니므로 재분류 대상에서 제외하고 원위치 유지.
- Topics/Topic_email(상위 보호 폴더 Topic_email과 파일명 100% 중복) 삭제 — 보호 폴더 자체는 미변경.
- 완전히 비게 된 Topic_Agent/Topic_Blog/Topics_Biz/Topics_Rag 폴더 제거.
"매 dopamine = reward prediction error (RPE)". Schultz 1997 의 single-cell recording 의 매 TD-learning 의 brain analogue 를 confirm. 매 basal ganglia 의 actor-critic, 매 prefrontal cortex 의 model-based planning. 2026 현재 매 distributional RL (Dabney 2020) 의 dopamine population code 의 confirmation 과 매 deep RL ↔ neuroscience 의 active bridge.
매 핵심
매 핵심 발견
Dopamine = RPE (Schultz, Dayan, Montague 1997): VTA / SNc dopamine neuron 의 firing 의 (R + γV(s') − V(s)) 의 encoding.
importnumpyasnpdeftd_value(rewards,gamma=0.9,alpha=0.1):V=np.zeros_like(rewards,dtype=float)rpes=np.zeros_like(rewards,dtype=float)fortinrange(len(rewards)-1):rpe=rewards[t]+gamma*V[t+1]-V[t]# 매 dopamine signalV[t]+=alpha*rperpes[t]=rpereturnV,rpes# 매 Schultz 1997 의 cue-reward conditioningtrials=[]fortrialinrange(100):seq=np.zeros(10)seq[3]=1.0# CS at t=3seq[7]=1.0# reward at t=7V,rpes=td_value(seq)trials.append(rpes)# 매 early trials: phasic burst at reward (t=7)# 매 late trials: burst shifts to CS (t=3) — 매 prediction-error transfer
Distributional TD (Dabney 2020 신경)
# 매 each "DA neuron" 의 own quantile τᵢ ∈ (0,1) 와 asymmetric scalingdefquantile_td(returns,taus,lr=0.05):Q=np.zeros_like(taus)forrinreturns:fori,tauinenumerate(taus):delta=r-Q[i]# 매 asymmetric: positive RPE 의 tau-weighted, negative 의 (1-tau)Q[i]+=lr*(tauifdelta>0else(1-tau))*deltareturnQ# 매 distribution-encoding population
Successor representation
defsuccessor_repr(transitions,gamma=0.9):n=transitions.shape[0]M=np.zeros((n,n))fors,spintransitions:M[s]+=0.1*(np.eye(n)[s]+gamma*M[sp]-M[s])returnM# 매 hippocampal SR (Stachenfeld 2017)
Two-step task (Daw 2011 model-based vs model-free)
# 매 stage1: A → 0.7 → S2_left, 0.3 → S2_right# 매 stage2: reward varies# 매 model-free: stay if rewarded, regardless of transition# 매 model-based: stay if rewarded AND transition was commondeftwo_step_choice(prev_choice,prev_reward,prev_common,w_mb=0.5):# 매 w_mb 의 model-based weightmf_pref=1ifprev_rewardelse-1mb_pref=(1ifprev_rewardandprev_commonelse1ifnotprev_rewardandnotprev_commonelse-1)score=(1-w_mb)*mf_pref+w_mb*mb_prefreturnprev_choiceifscore>0else1-prev_choice
Volatility-weighted learning rate (Behrens 2007)
# 매 ACC 의 volatility 의 track, 매 high vol → high LRdefvolatility_lr(rpes,base_lr=0.05):vol=np.var(rpes[-10:])# rolling variancereturnbase_lr*(1+vol)
Q-learning addiction model (Redish 2004)
# 매 cocaine 의 RPE floor: drug RPE 의 cannot be predicted awaydefcocaine_td(rewards,drug_mask,gamma=0.9,alpha=0.1,drug_floor=1.0):V=np.zeros_like(rewards,dtype=float)fortinrange(len(rewards)-1):delta=rewards[t]+gamma*V[t+1]-V[t]ifdrug_mask[t]:delta=max(delta,drug_floor)# 매 always positive RPE → compulsionV[t]+=alpha*deltareturnV
매 결정 기준
상황
Approach
Modeling phasic DA
classic TD with γ ≈ 0.9
Modeling DA population variance
distributional TD with quantiles
Modeling habits vs goals
hybrid MF + MB with arbitrator
Modeling replay
SR + offline updates
Computational psychiatry
param fit per subject (hBayesDM, JAGS)
Drug / lesion effect
parameter perturbation (lower α, biased ε)
기본값: 매 single-RPE TD 의 starting model. 매 distributional TD 의 modern population-DA fit. 매 SR / MB-MF arbitrator 의 prefrontal-hippocampal richness 가 필요할 때.
언제: literature digest (Schultz, Dayan, Niv, Daw papers), TD / SR sim scaffolding, hypothesis generation for fitting tasks.
언제 X: empirical claims about specific brain areas — 매 verify with primary source. 매 LLM 의 mix model-based 와 model-free terminology occasionally.
❌ 안티패턴
DA = reward: 매 wrong — DA 의 RPE, 매 unpredicted reward 만 burst.
Single-RPE for all DA: 매 distributional 의 newer view.
Equate brain 의 deep RL: deep nets 의 inspired 가 X identical. 매 brain 의 sample-efficient, cortical, multi-system.
Ignore tonic DA: motivation / vigor 의 separate from phasic RPE.
Behaviorism only: ignore neural data — 매 brain → behavior 의 multi-level.