docs(10_Wiki): 위키 전체 재구성 — Topic_* 폴더를 4개 카테고리로 통합 + 대규모 중복 제거
Topic_Agent/Topic_Blog/Topics/Topics_Biz/Topics_Meeting/Topics_Rag의 마크다운 지식 문서를 Topic_General/Topic_Programming/Topic_Graphic/Topic_Business 4개 카테고리로 재분류. - 중복 제거: frontmatter의 status:duplicate/merged + duplicate_of/redirect_to 필드로 자기 자신을 중복으로 선언한 리다이렉트 stub 1032개 제거, 완전 동일 내용 파일 472개 제거, 동일 파일명·다른 내용 충돌 시 더 큰(완전한) 버전만 유지(162개 제거) — 총 1639개 중복 제거. - 분류: 폴더 단위로 명확한 항목(AI_and_ML/Coding/Architecture 등 → Programming, Comfyui/Visual_Effects → Graphic, Topics_Biz/Topics_Meeting/사업 등 → Business, Poetic_Blog_Writing/창의성/Game_Design 등 → General)은 폴더 우선순위로, 나머지 혼재 폴더(Topic_Agent/Topic_Blog/Topics 루트/Thinking & Reasoning/Other/UI_UX_Assets)는 title/tags 키워드 스코어링으로 파일 단위 분류(불명확한 경우 General로 폴백). 원본 폴더명은 "From_*" 서브폴더로 보존해 추적 가능성 유지. - 최종 배치: Programming 2784 / General 1608 / Graphic 285 / Business 249 = 4926개 문서. - 에이전트 운영 상태(.astra/.agent/.obsidian/sessions/memory/_company/docs/lessons/_shared/src)는 지식 콘텐츠가 아니므로 재분류 대상에서 제외하고 원위치 유지. - Topics/Topic_email(상위 보호 폴더 Topic_email과 파일명 100% 중복) 삭제 — 보호 폴더 자체는 미변경. - 완전히 비게 된 Topic_Agent/Topic_Blog/Topics_Biz/Topics_Rag 폴더 제거.
This commit is contained in:
@@ -0,0 +1,189 @@
|
||||
---
|
||||
id: db-full-text-search
|
||||
title: Full-text Search — Postgres / Elasticsearch / Meilisearch
|
||||
category: Coding
|
||||
status: draft
|
||||
source_trust_level: B
|
||||
verification_status: conceptual
|
||||
created_at: 2026-05-09
|
||||
updated_at: 2026-05-09
|
||||
tags: [database, search, postgres, elasticsearch, vibe-coding]
|
||||
tech_stack: { language: "SQL / TS", applicable_to: ["Backend"] }
|
||||
applied_in: []
|
||||
aliases: [full-text search, FTS, tsvector, GIN, Meilisearch, Typesense, OpenSearch]
|
||||
---
|
||||
|
||||
# Full-text Search
|
||||
|
||||
> "맥북" 검색 = "macbook" 도 매치. **언어별 stemming + ranking**. Postgres FTS = 가벼운 시작, Meilisearch/Typesense = 빠른 typo, Elasticsearch/OpenSearch = 큰 규모.
|
||||
|
||||
## 📖 핵심 개념
|
||||
- Tokenize: "맥북 m1" → ["맥북", "m1"].
|
||||
- Stemming: "running" → "run".
|
||||
- Ranking: BM25 / TF-IDF.
|
||||
- Faceting: 카테고리 / 가격대 필터 + 검색.
|
||||
|
||||
## 💻 코드 패턴
|
||||
|
||||
### Postgres FTS — 시작
|
||||
```sql
|
||||
ALTER TABLE products ADD COLUMN tsv tsvector
|
||||
GENERATED ALWAYS AS (
|
||||
setweight(to_tsvector('simple', coalesce(name, '')), 'A') ||
|
||||
setweight(to_tsvector('simple', coalesce(description, '')), 'B')
|
||||
) STORED;
|
||||
|
||||
CREATE INDEX products_tsv ON products USING GIN(tsv);
|
||||
```
|
||||
|
||||
```sql
|
||||
-- 검색
|
||||
SELECT id, name,
|
||||
ts_rank(tsv, query) AS rank
|
||||
FROM products, plainto_tsquery('simple', 'macbook m1') query
|
||||
WHERE tsv @@ query
|
||||
ORDER BY rank DESC
|
||||
LIMIT 20;
|
||||
```
|
||||
|
||||
### 한국어 (pg_search 확장 필요)
|
||||
```sql
|
||||
-- 또는 trigram (n-gram 비슷)
|
||||
CREATE EXTENSION pg_trgm;
|
||||
CREATE INDEX products_name_trgm ON products USING GIN (name gin_trgm_ops);
|
||||
|
||||
SELECT * FROM products WHERE name % '맥북' ORDER BY similarity(name, '맥북') DESC;
|
||||
```
|
||||
|
||||
### Meilisearch (typo + ranking 자동)
|
||||
```ts
|
||||
import { MeiliSearch } from 'meilisearch';
|
||||
|
||||
const ms = new MeiliSearch({ host: 'http://meilisearch:7700', apiKey: '...' });
|
||||
const idx = ms.index('products');
|
||||
|
||||
// 인덱싱
|
||||
await idx.addDocuments([{ id: '1', name: 'MacBook M1', price: 1000, category: 'laptop' }]);
|
||||
await idx.updateSettings({
|
||||
searchableAttributes: ['name', 'description'],
|
||||
filterableAttributes: ['category', 'price'],
|
||||
rankingRules: ['words', 'typo', 'proximity', 'attribute', 'sort', 'exactness'],
|
||||
});
|
||||
|
||||
// 검색
|
||||
const r = await idx.search('macboo', { // typo OK
|
||||
filter: 'category = "laptop" AND price < 2000',
|
||||
limit: 20,
|
||||
attributesToHighlight: ['name'],
|
||||
});
|
||||
```
|
||||
|
||||
### Elasticsearch
|
||||
```ts
|
||||
import { Client } from '@elastic/elasticsearch';
|
||||
|
||||
const es = new Client({ node: 'http://elasticsearch:9200' });
|
||||
|
||||
// 매핑
|
||||
await es.indices.create({
|
||||
index: 'products',
|
||||
body: {
|
||||
mappings: {
|
||||
properties: {
|
||||
name: { type: 'text', analyzer: 'standard' },
|
||||
description: { type: 'text' },
|
||||
price: { type: 'float' },
|
||||
category: { type: 'keyword' },
|
||||
},
|
||||
},
|
||||
},
|
||||
});
|
||||
|
||||
// 검색
|
||||
const r = await es.search({
|
||||
index: 'products',
|
||||
query: {
|
||||
bool: {
|
||||
must: [{ multi_match: { query: 'macbook', fields: ['name^3', 'description'] } }],
|
||||
filter: [{ term: { category: 'laptop' } }, { range: { price: { lt: 2000 } } }],
|
||||
},
|
||||
},
|
||||
highlight: { fields: { name: {} } },
|
||||
size: 20,
|
||||
});
|
||||
```
|
||||
|
||||
### Hybrid (vector + keyword)
|
||||
```sql
|
||||
-- pgvector + FTS 결합
|
||||
WITH v_hits AS (
|
||||
SELECT id, 1 - (embedding <=> $1::vector) AS v_score
|
||||
FROM products ORDER BY embedding <=> $1::vector LIMIT 100
|
||||
),
|
||||
t_hits AS (
|
||||
SELECT id, ts_rank(tsv, plainto_tsquery($2)) AS t_score
|
||||
FROM products WHERE tsv @@ plainto_tsquery($2) LIMIT 100
|
||||
)
|
||||
SELECT id, COALESCE(v_score, 0) * 0.6 + COALESCE(t_score, 0) * 0.4 AS score
|
||||
FROM v_hits FULL OUTER JOIN t_hits USING (id)
|
||||
ORDER BY score DESC LIMIT 20;
|
||||
```
|
||||
|
||||
### Faceting
|
||||
```ts
|
||||
// Meilisearch
|
||||
const r = await idx.search('macbook', {
|
||||
facets: ['category', 'price_range'],
|
||||
});
|
||||
// r.facetDistribution: { category: { laptop: 50, desktop: 5 } }
|
||||
```
|
||||
|
||||
### Suggest / autocomplete
|
||||
```ts
|
||||
// Meilisearch: prefix 자동
|
||||
await idx.search('mac', { limit: 5 });
|
||||
|
||||
// Elasticsearch: completion suggester 또는 edge ngram
|
||||
```
|
||||
|
||||
### Sync (DB → 검색 엔진)
|
||||
```ts
|
||||
// CDC 또는 outbox 로 변경 → 검색 인덱스 업데이트
|
||||
on('product.changed', async (p) => {
|
||||
await idx.addDocuments([p]); // upsert
|
||||
});
|
||||
on('product.deleted', async (id) => {
|
||||
await idx.deleteDocument(id);
|
||||
});
|
||||
```
|
||||
|
||||
## 🤔 의사결정 기준
|
||||
| 규모 | 추천 |
|
||||
|---|---|
|
||||
| <1M docs, simple | Postgres FTS |
|
||||
| Typo 강함 | Meilisearch / Typesense |
|
||||
| 대규모 + 분석 + 복잡 | Elasticsearch / OpenSearch |
|
||||
| Hybrid (semantic + keyword) | pgvector + FTS / Vespa |
|
||||
| Code search | Sourcegraph / Algolia |
|
||||
| 사용자별 권한 + 검색 | per-user filter |
|
||||
|
||||
## ❌ 안티패턴
|
||||
- **`LIKE '%query%'`**: 인덱스 안 탐. 느림.
|
||||
- **GIN 인덱스 없이 tsvector**: 같은 결과지만 느림.
|
||||
- **Regex 검색 prod**: pre-compute 가 답.
|
||||
- **모든 컬럼 인덱싱**: 인덱스 크기. searchable 필드 명시.
|
||||
- **Stemming 없는 영어**: "runs" 검색이 "running" 못 찾음.
|
||||
- **단순 prefix only**: typo 무시.
|
||||
- **App-level dedup**: 검색 엔진의 ranking 가 나음.
|
||||
- **Sync 비동기 lag 무시**: search 결과가 stale.
|
||||
|
||||
## 🤖 LLM 활용 힌트
|
||||
- 작은 = pg FTS / pg_trgm.
|
||||
- typo 강 = Meilisearch.
|
||||
- 큰 = Elasticsearch.
|
||||
- Hybrid = pgvector + FTS rerank.
|
||||
|
||||
## 🔗 관련 문서
|
||||
- [[AI_RAG_Pattern_Basics]]
|
||||
- [[DB_JSONB_Postgres_Patterns]]
|
||||
- [[DB_Change_Data_Capture]]
|
||||
Reference in New Issue
Block a user