v2.2.311~312: 응답 지연 근본 개선(KV 캐시 분리·제2뇌 상주 캐시) + 보고 품질 수술

v2.2.311 — 응답 지연 (실측: 출력 22토큰에 94.7초, 원인은 매 턴 13k+ 토큰 전체 재프리필)
- KV 캐시 친화 프롬프트 분리(kvCachePromptSplit, 기본 ON): message[0]을 불변
  정적 본문으로 고정, 날짜/RAG/[CONTEXT]/동적 블록을 마지막 user 메시지 직전의
  internal system 메시지로 이동 — llama.cpp prompt cache 프리픽스 재사용으로
  턴당 재프리필을 "직전 교환 + 동적 컨텍스트"로 축소. truncation 도 tail 적용.
- 검색 토큰 예산 현실화(retrievalTokenBudget, 0=자동): 창의 25%(8k~80k) →
  12%(2.5k~6k 클램프).
- continuation 은 depth-0 memoryCtx 재사용: 라운드당 재검색 3~8초 제거 +
  빈 쿼리 재검색으로 청크가 갈리던 문제 제거 + 턴 내 프롬프트 안정화.
- 제2뇌 상주 캐시(신규 brainWatch.ts): 재귀 fs.watch 세대 카운터로 변경 없으면
  디렉터리 워크·파일별 statSync 전면 생략. 수정 직후 3초 창은 신뢰 제외(이벤트
  지연 레이스 가드), 워처 불가 시 종전 폴백, 활성화 시 백그라운드 워밍,
  유휴 해제 30분→2시간.

v2.2.312 — 보고 품질 (실사례: "## 4."부터 시작하는 7줄 일반론 보고서)
- 중간 라운드 본문 표시 버그 수정: 액션과 함께 작성된 섹션(1~3)이 화면에 한 번도
  안 나가고 최종 라운드만 표시되던 근본 원인 제거 — stripForDisplay.ts 로 액션
  태그만 걷어내고 라운드 순서대로 버블에 표시.
- '분석 보고' 업무 유형 신설(requirementGraph): 보고 개요(첫 줄 자기선언)·파일
  근거(주장마다 실제 읽은 파일 인용, 일반론 금지)·구조·발견·다음 단계 강제,
  유형 감지 시 "최대 3섹션" 규칙보다 필수 요소 커버 우선.
- 근거 없는 분석 감지: 파일을 읽고도 인용 2개 미만인 장문 분석에 "근거 인용
  없음" footer 경고 (헛조사 감지의 반대 방향).

검증: 전체 테스트 954건 통과(신규 28), tsc 무오류, vsix 패키징·설치 확인.

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
2026-07-20 13:21:41 +09:00
parent a31d273bfe
commit 7d6b8b509f
20 changed files with 834 additions and 38 deletions
+89
View File
@@ -56,3 +56,92 @@ describe('computeBudgetedRequest — real-window alignment', () => {
expect(run({ actualContextLength: NaN }).effectiveContextLength).toBe(32768);
});
});
// ────────────────────────────────────────────────────────────────────────────
// [v2.2.311] KV 캐시 분리 — dynamicContextTail 삽입 계약.
// message[0] 은 불변 정적 프롬프트로 남고, 동적 컨텍스트는 마지막 user 메시지
// 직전의 internal system 메시지로 들어가야 프롬프트 프리픽스 캐시가 산다.
// ────────────────────────────────────────────────────────────────────────────
describe('computeBudgetedRequest — dynamicContextTail (KV cache split)', () => {
const HEAD = 'STATIC HEAD PROMPT';
const TAIL = '[CURRENT DATE/TIME]\nToday: 2026-07-20\n\n[CONTEXT]\nRAG chunk A\n[/CONTEXT]';
// 주의: default parameter 는 명시적 undefined 에도 적용되므로 쓰지 않는다 —
// "tail 없음" 케이스를 정확히 표현하기 위해 항상 명시적으로 넘긴다.
function runSplit(reqMessages: ChatMessage[], tail: string | undefined) {
return computeBudgetedRequest({
fullSystemPrompt: HEAD,
dynamicContextTail: tail,
reqMessages,
actualModel: 'some-13b-model',
config: baseConfig,
imageCount: 0,
});
}
test('tail 은 마지막 user 메시지 직전에 internal system 으로 삽입된다', () => {
const msgs: ChatMessage[] = [
{ role: 'user', content: '첫 질문' },
{ role: 'assistant', content: '첫 답' },
{ role: 'user', content: '두번째 질문' },
];
const r = runSplit(msgs, TAIL);
expect(r.messagesForRequest[0]).toMatchObject({ role: 'system', content: HEAD });
const idx = r.messagesForRequest.findIndex((m) => m.content === TAIL);
expect(idx).toBeGreaterThan(0);
expect(r.messagesForRequest[idx].role).toBe('system');
expect(r.messagesForRequest[idx + 1]).toMatchObject({ role: 'user', content: '두번째 질문' });
});
test('continuation(마지막 user 뒤 액션 결과 system)이 있어도 tail 은 user 앞', () => {
const msgs: ChatMessage[] = [
{ role: 'user', content: '조사해줘' },
{ role: 'system', content: '[Result of read_file] ...', internal: true },
];
const r = runSplit(msgs, TAIL);
const tailIdx = r.messagesForRequest.findIndex((m) => m.content === TAIL);
const userIdx = r.messagesForRequest.findIndex((m) => m.role === 'user');
const actionIdx = r.messagesForRequest.findIndex((m) => String(m.content).startsWith('[Result of'));
expect(tailIdx).toBeLessThan(userIdx);
expect(actionIdx).toBeGreaterThan(userIdx);
});
test('user 메시지가 없으면 tail 을 히스토리 끝에 붙인다', () => {
const msgs: ChatMessage[] = [{ role: 'system', content: 'internal only', internal: true }];
const r = runSplit(msgs, TAIL);
const last = r.messagesForRequest[r.messagesForRequest.length - 1];
expect(last.content).toBe(TAIL);
});
test('tail 미지정이면 종전 단일-시스템 동작 그대로', () => {
const msgs: ChatMessage[] = [{ role: 'user', content: 'hello' }];
const r = runSplit(msgs, undefined);
expect(r.messagesForRequest).toHaveLength(2);
expect(r.messagesForRequest[0].content).toBe(HEAD);
});
test('예산 초과 시 [CONTEXT] truncation 은 tail 에 적용되고 head 는 보존', () => {
const hugeTail = `[CONTEXT]\n${'긴 배경 지식 청크. '.repeat(20000)}\n[/CONTEXT]`;
const msgs: ChatMessage[] = [{ role: 'user', content: 'hello' }];
const r = computeBudgetedRequest({
fullSystemPrompt: HEAD,
dynamicContextTail: hugeTail,
reqMessages: msgs,
actualModel: 'some-13b-model',
config: { ...baseConfig, contextLength: 8192 },
imageCount: 0,
});
expect(r.systemTruncated).toBe(true);
expect(r.messagesForRequest[0].content).toBe(HEAD);
const tailMsg = r.messagesForRequest.find((m) => String(m.content).includes('[CONTEXT]'));
expect(tailMsg).toBeDefined();
expect(String(tailMsg!.content).length).toBeLessThan(hugeTail.length);
});
test('systemTokens 는 head+tail 합산으로 보고된다', () => {
const msgs: ChatMessage[] = [{ role: 'user', content: 'hello' }];
const withTail = runSplit(msgs, TAIL);
const withoutTail = runSplit(msgs, undefined);
expect(withTail.systemTokens).toBeGreaterThan(withoutTail.systemTokens);
});
});