Add Topic_Prompt wiki, 회의록 및 정렬 지식 문서

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-06-29 22:05:07 +09:00
parent 1ae89f84df
commit 985c1d96ad
18 changed files with 2493 additions and 0 deletions
@@ -0,0 +1,266 @@
---
id: boogu-image-프롬프트-예시집
title: "BOOGU-IMAGE 프롬프트 예시집"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["BOOGU-IMAGE Prompt Example", "조피디 이미지 프롬프트 예시", "JOPD LAB Image Prompt Gallery", "실전 이미지 프롬프트 템플릿", "분야별 AI 이미지 프롬프트 모음"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.9
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "BOOGU-IMAGE", "이미지 프롬프트 예시", "Prompt Engineering", "조피디 연구소", "JOPD LAB", "인포그래픽 프롬프트", "상업 비주얼", "ComfyUI"]
raw_sources: [
"BOOGU-IMAGE Prompt Example (조피디 연구소 / JOPD LAB) — D:/Boogu Image Prompt.pdf"
]
applied_in: ["Photography", "Infographic_Poster", "Magazine_Cover", "Product_Poster", "Social_Media_Mockup", "Pet_Commerce", "Fashion_Styling_Report"]
github_commit: ""
---
# [[BOOGU-IMAGE 프롬프트 예시집]]
## 🎯 한 줄 통찰 (One-line insight)
고품질 상업용 AI 이미지는 "예쁜 단어의 나열"이 아니라 **레이아웃·패널 그리드·라벨·다국어 텍스트·정확한 렌즈/조명 사양을 명시한 구조화된 묘사문**에서 나오며, BOOGU-IMAGE 예시집은 분야별로 즉시 복제·변형 가능한 **검증된 프롬프트 골격(Template Skeleton)**을 제공한다 [S1].
## 🧠 핵심 개념 (Core concepts)
- **분야별 프롬프트 골격 (Domain Skeleton):** 사진·인포그래픽·잡지표지·제품광고·SNS목업·쇼케이스 콜라주 등 결과물 유형마다 고정된 묘사 순서와 필수 요소가 다름 [S1].
- **레이아웃 우선 서술 (Layout-First Description):** 인포그래픽·포스터류는 피사체보다 **배경색 → 헤더 → 패널 위치(Top-left/Right/Bottom) → 그리드(2x3, 4x3)** 순으로 공간을 먼저 할당 [S1].
- **라벨·번호 강제 (Labeled & Numbered Cells):** `01`~`13` 같은 셀 번호와 `BEST MATCH`/`NOT RECOMMENDED` 같은 섹션 라벨을 명시해 AI가 표/그리드를 구조적으로 렌더링하게 유도 [S1].
- **다국어 텍스트 인레이 (In-image Multilingual Text):** 따옴표(`'...'`)로 정확한 출력 문자열을 지정하면 영어·한국어·중국어 텍스트를 이미지 내부에 새길 수 있음 (REACH 광고의 한/중 혼용) [S1].
- **사진학적 사양 토큰 (Photographic Spec Tokens):** `70mm lens`, `low-angle telephoto`, `high shutter speed`, `polaroid flash` 등 실제 촬영 메커니즘을 토큰화해 사실성 확보 [S1].
## 🧩 추출된 패턴 (Extracted patterns)
- **Polished-but-Realistic 앵커:** 패션/인물 사진은 끝에 `natural skin tones, polished but realistic`를 붙여 과도한 AI 광택을 억제하고 에디토리얼 질감을 유지 [S1].
- **True-Moment 동사 묘사:** 스포츠/액션은 `sweat and breath clearly visible`, `capturing the power and the true moment`처럼 **순간의 물리 현상을 동사로** 서술해 역동성 확보 [S1].
- **Section-Grid 분해법:** 분석형 인포그래픽은 `BEST MATCH(2x3) → GOOD OPTIONS(1x4) → NOT RECOMMENDED(1x3) → TIPS(checkmark)`처럼 **권장도 등급별 그리드**로 분해 [S1].
- **Panel-Number-Tag 삼중 구조:** 룩북/메이크업 패널은 각 칸마다 `번호(01) + 이름(PEACH GLOW) + 설명(Warm & radiant) + 태그(BRUNCH/PICNIC)`의 4요소를 일관 반복 [S1].
- **Before→After 변환 고정:** 패션 분석은 `Before(후드+청바지)``STYLE UPGRADE 화살표``AFTER(블레이저+슬랙스)` 구조에 **줌인 디테일 콜아웃(leader line)**을 결합 [S1].
- **Distressed-Texture 미학 스택:** 빈티지/그런지물은 `distressed paper`, `analog film grain`, `polaroid flash`, `spray-painted graffiti` 등 **질감 키워드를 누적**해 시대감 연출 [S1].
- **Commerce Two-Column:** 커머스 목업은 `LEFT(라이프스타일 착용샷) | RIGHT(흰 배경 제품 컷 + 가격 텍스트)` 2단 분할이 표준 [S1].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 결과물 유형 | 프롬프트 길이/복잡도 | 핵심 필수 요소 | 언제 선택 |
|---|---|---|---|
| **Photography (인물/스포츠)** | 짧음 (1~2문장) | 렌즈 사양 + 조명 + 배경 블러 + 사실성 앵커 | 광고/에디토리얼용 단일 고품질 컷 [S1] |
| **Infographic Analysis** | 매우 김 (문단 단위) | 배경색 + 패널 위치 + 그리드 + 셀 번호/라벨 | 헤어/메이크업/패션 분석형 카드뉴스 [S1] |
| **Magazine / Poster** | 김 | 시대 미학 + 위치별 텍스트(상/하/좌/우) + 질감 | SNS 후킹용 잡지표지·타이포 포스터 [S1] |
| **Product Poster** | 중간~김 | 컬러스킴 + 셀링포인트 아이콘 4~5개 + 브랜드명 | 제품 상세/광고 배너 [S1] |
| **Showcase Collage** | 김 | 중앙 컷아웃 + 폴라로이드 N장 + 손글씨 카피 | 인물 화보/룩북 콜라주 [S1] |
| **Pet / Commerce OOTD** | 중간 | 2단 분할 + 제품별 가격 텍스트 + 이모지 | 펫/패션 커머스 상품 소개 [S1] |
## 📖 세부 내용 (Details)
> **사용법:** 아래 영문 프롬프트를 그대로 복사해 Midjourney/DALL-E 3/FLUX/Nano Banana 등에 입력하고, **굵은 변수**(피사체·색상·문구·렌즈)만 교체해 변형한다. 분야별 골격은 유지할수록 결과 일관성이 높다 [S1].
### 1. Photography — 패션 (Fashion Editorial)
```text
Professional fashion photography of a model in a cream linen suit on a
sunlit rooftop, city skyline softly blurred behind, clean editorial styling,
70mm lens, natural skin tones, polished but realistic
```
- **골격:** `Professional fashion photography of [피사체+의상] on [장소], [배경 처리], [스타일], [렌즈], natural skin tones, polished but realistic` [S1].
### 2. Photography — 스포츠 (Sports Action)
```text
Professional sports photography: Marathon runners sprinting on city
streets at dawn, their sweat and breath clearly visible, the background
spectators slightly blurred, low-angle telephoto lens, high shutter speed,
capturing the power and the true moment.
```
- **골격:** 동작 동사 + 물리현상(`sweat and breath visible`) + `low-angle telephoto lens` + `high shutter speed` + 순간성 앵커 [S1].
### 3. Infographic — 헤어스타일 분석 (Hairstyle Analysis)
```text
An infographic poster titled 'HAIRSTYLE ANALYSIS / Find Your Best Look' on a
light beige background. Layout: Top-left features a large vertical photo of a
young Asian woman with a gentle smile wearing a light blue silk blouse. To its
right, four attributes with icons and text: 'FACE SHAPE' / 'Oval', 'HAIR TEXTURE' /
'Fine, slight wave', 'HAIR VOLUME' / 'Medium', and 'KEY POINT' / 'Frame cheekbones'.
Top-right is a 'BEST MATCH' section with a 2x3 grid of photos (labeled 01-06) showing
the same woman with different hairstyles. The middle row is a 'GOOD OPTIONS' section
with a 1x4 photo grid (labeled 07-10). The bottom-left is a 'NOT RECOMMENDED' section
with a 1x3 photo grid (labeled 11-13). Bottom-right contains a 'HAIR TIPS' block with
checkmarks and three specific tips. Clean UI design style.
```
- **골격:** 제목 → 배경색 → Top-left 인물 → 속성 4종(아이콘+텍스트) → 권장도별 그리드(BEST/GOOD/NOT) → TIPS [S1].
### 4. Infographic — 메이크업 룩북 (Makeup Looks)
```text
A highly structured, portrait-oriented infographic poster titled '12 MAKEUP LOOKS FOR
SPRING'. Background: crisp soft pastel pink. Top header: large number '12' + title
'MAKEUP LOOKS / FOR SPRING' in elegant serif, subtitle 'Discover Your Vibe', top-right
'FRESH • GLOWING • VIBRANT'. Main body: a 4x3 grid of portrait panels of the same young
woman. Each panel: number (01-12) top-left + semi-transparent bottom text box with look
name (bold) + short description + occasion tags. e.g. 01 'PEACH GLOW' ('Warm & radiant',
'BRUNCH / PICNIC'); 05 'SOFT GLAM' ('Polished & chic', 'WORK / MEETING'); 12 'GOLDEN HOUR'
('Shimmering & warm', 'GALA / RED CARPET').
```
- **골격(셀 4요소):** `번호 + 이름(bold) + 설명 + 태그`를 12칸 전부 일관 반복 → 카드뉴스 일관성 확보 [S1].
### 5. Magazine Cover — 90s 그런지 (Retro Grunge)
```text
90s grunge-style magazine poster with a muted yellow and teal distressed paper background.
Central subject: a Black teenage girl leaning against a chain-link fence holding a worn
skateboard, backward navy cap, oversized white tee reading 'SKATE OR DIE', denim vest,
baggy brown corduroy pants. Raw polaroid flash lighting, harsh shadows. Layout: Top-left
teal 'RIDE' over jagged black 'FREE'; Top-right sticker 'VOL 04' + red stamp '1994' + box
'NO FEAR... 90S RULES'; Middle-left masking-tape 'RADICAL', neon pink 'STREET LEGEND';
Middle-right 'OWN THE STREET / RAMP MODE' on graffiti; Bottom-right 'STREET KINGS' with
cracked skull icon. Retro grunge streetwear aesthetic.
```
- **골격:** 시대 미학 선언 → 중앙 인물(의상 디테일) → 조명 → **9분할 위치별 텍스트/스티커** 배치 [S1].
### 6. Text & Poster — SNS 프로필 목업 (Instagram Mockup)
```text
A screenshot of an Instagram profile page, portrait aspect ratio, clean minimalist white
background. Status bar shows time '11:27' and battery '87'. Username 'kaycee.inmotion'.
Profile: circular photo of a young woman, name 'Kaycee', stats '142 posts / 1,300 followers
/ 860 following', bio 'bay area girlie ☁️ marketing + creator stuff @stelle ... ✨' with
'@stelle' in blue. 'Edit profile' / 'Share profile' buttons. Five story highlights: work,
fits, bay, creators, life. Below: a 3x3 grid of curated lifestyle square photos (mirror
selfie, desk flat-lay with 'Q2 CAMPAIGN PLAN', Golden Gate portrait, cafe scene, white
roses, 'Create & Cultivate' badge, gratitude journal, cozy bed with 'Atomic Habits').
```
- **골격:** UI 요소를 위→아래 순서로 정확히 나열(상태바 → 프로필 → 통계 → bio → 하이라이트 → 그리드), 인앱 텍스트는 따옴표로 명시 [S1].
### 7. Product Poster — 가습기 (가로형 셀링포인트)
```text
A horizontal product advertisement for a humidifier. White / light wood / refreshing green
color scheme. Background: bright living room with blurred plants. A white cylindrical
humidifier emits fine white mist. Left title in large dark-green bold: 'Refreshing
Humidification' / 'Comfortable Every Day'; subtitle below a thin line. Four icon + selling
point sets: 'Large Capacity Water Refill', 'Quiet Operation / Low-Noise Design', 'Fine
Atomization / Even and Fine Mist', 'One-Button Operation'. Brand 'Gezier' on the body with
a vertical water-level window. Composition: text on left, product image on right. Clean,
transparent home-use feel.
```
- **골격:** 컬러스킴 → 배경 → 제품(미스트/디테일) → 좌측 타이틀+서브 → **아이콘+셀링포인트 4세트** → 브랜드명 → 좌우 분할 구도 [S1].
### 8. Product Poster — 치약 (감성 인물 광고, 다국어)
```text
An advertisement for REACH toothpaste, soft portrait bathed in cool green light from a glass
window. Large white serif headline 'REACH BEYOND ORDINARY' top-left, a line of Korean text
below; top-right 'REACH TOTAL CARE TOOTHPASTE'. A young woman leaning on a light table, damp
hair, face on her arm, looking at camera. Foreground: white tube reading 'REACH', 'TOTAL CARE
TOOTHPASTE', 'PARIS', 'MINT', '120g / 5.23 oz'. Left edge vertical text 'REACH, FOR THE
MOMENTS THAT MATTER.' Bottom large 'Define Your Moment', then Chinese '绝对你的每刻光彩',
'#EverydayConfidence', 'FROM PARIS'. Clean, tranquil, sophisticated, cool tone.
```
- **골격:** 감성 인물 광고 + **영/한/중 혼용 텍스트를 위치별로 지정**(헤드라인·세로 카피·하단 슬로건·해시태그) [S1].
### 9. Showcase — 인물 콜라주 (Vintage Collage)
```text
A vintage cinematic collage poster on a textured dark charcoal paper background. A large
central cutout photo surrounded by six smaller polaroid-style photos with rounded corners
and white borders. Central: a young East Asian woman with long dark wavy hair in a silky
beige slip dress, sitting by a calm lake at sunset, reflection in water, gentle expression.
The six polaroids show the same woman, same dress, in varied poses by the water (over-the-
shoulder, cross-legged on pier, head tilted to sunset, profile to sailboats, leaning on rail,
close-up). Top-right white cursive: 'You are the one light that makes every sunset beautiful.'
+ heart doodle. Bottom-left large cursive 'Bella' + 'Sunset breeze, soft memories, forever
you.' Romantic, nostalgic, cinematic, golden-hour palette, analog film grain.
```
- **골격:** 배경 질감 → 중앙 컷아웃 1 + 폴라로이드 N장(동일 인물·동일 의상·포즈 변주) → 손글씨 카피 + doodle → 무드/그레인 [S1].
### 10. Pet OOTD — 커머스 2단 (Two-Column Commerce)
```text
Two-column pet OOTD commerce layout. LEFT: outdoor lifestyle photo of a beagle on sunny
beach sand near waves, wearing a woven yellow straw hat (frayed edge), pink heart-shaped
sunglasses, pink tropical palm-leaf harness; bottom-left text '@BEACH Island Dog'. RIGHT:
plain white background, a vertical column of 3 product callouts, each an isolated product
image + text: '🍑 BEACH island resort style / hand-woven straw hat / $25', '🍑 PINK
sweetheart sunglasses / pink style / $15', '🍑 BEACH Island Resort Style / Tropical Floral
Beach Backless Jacket / $42'.
```
- **골격:** `LEFT 착용 라이프스타일 컷 | RIGHT 흰배경 제품 컷 N개 + (이모지)이름/스타일/가격` [S1].
### 11. Fashion Analysis — 스타일 업그레이드 리포트 (Before/After)
```text
A detailed style upgrade infographic poster on a light beige background. Header: 'Premium
Corporate Wear Report' in elegant serif. Left column panels: 01 'Style Direction' (Smart Chic),
02 'Key Upgrades' (5 clothing icons: tailoring/texture/drape/presence/practicality), 03 'Color
Palette' (6 swatches: navy, cream, light brown, charcoal, soft white, burgundy), 04 'Materials'
(5 fabric swatches). Center: two full-body photos of an East Asian woman — 'Before' (oversized
gray hoodie + baggy jeans) → arrow 'STYLE UPGRADE' → 'AFTER' (navy blazer, cream silk blouse,
charcoal trousers, pointed heels, leather tote), with 4 circular zoom-in callouts on collar
('silk gloss'), tote ('styled cowhide'), pants ('wide leg drape'), heels ('pointed extension').
Right column: 07 'Key PIECES' (isolated items), 08 'Detail Notes' (3 bullets), 09 'Summary'
(+ cursive 'Upgrade Complete'). Bottom: 05 'SILHOUETTE STRATEGY' (5 numbered points + silhouette
diagram), 06 'Recommended LOOK / OUTFIT IDEAS' (3 full-body looks). Clean minimal design, sharp
typography, professional lighting.
```
- **골격(가장 복잡):** 좌패널(방향/업그레이드/팔레트/소재) + 중앙 Before→After + 줌인 콜아웃 + 우패널(아이템/노트/요약) + 하단(실루엣/추천룩). 패널마다 번호 부여 [S1].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **길이의 역설:** 짧은 사진 프롬프트(예시 1·2)는 모델 자율성에 의존하지만, 인포그래픽·리포트(예시 3·11)는 **문단 단위의 과잉 명시가 오히려 정답**이다. 결과물 유형에 따라 정보 밀도 전략을 정반대로 적용해야 함 [S1].
- **모델 의존 텍스트 렌더링:** 다국어/긴 인앱 텍스트(예시 6·8)는 DALL-E 3·Nano Banana(Gemini)·FLUX 계열에서 안정적이나, 구형 Midjourney/SD에서는 깨질 수 있어 모델 선택이 결과를 좌우함 [[image Prompt 작성 방법]].
## 🛠️ 적용 사례 (Applied in summary)
- **카드뉴스/분석 콘텐츠:** 헤어·메이크업·패션 분석 인포그래픽(예시 3·4·11)을 SNS 카드뉴스로 즉시 활용 [S1].
- **상품 상세 페이지:** 가습기·치약·펫 커머스(예시 7·8·10) 골격으로 e-커머스 배너/상세컷 양산 [S1].
- **브랜드 후킹 비주얼:** 잡지표지·SNS 목업(예시 5·6)으로 바이럴 콘텐츠 제작 [S1].
## 💻 코드 패턴 (Code patterns)
### 인포그래픽 분석 포스터 범용 골격
```text
A [orientation] infographic poster titled '[TITLE]' on a [background color] background.
Header: [main heading] in [font style], subtitle '[subtitle]'.
Layout: Top-left [hero photo/subject]. To its right [N attributes: 'LABEL' / 'value'].
[SECTION A] with a [RxC] grid (labeled 01-0N). [SECTION B] grid (labeled ...).
[TIPS block with checkmarks]. Clean UI design style.
```
### 룩북 패널 셀 4요소 반복 골격
```text
A [RxC] grid of portrait panels of the same [subject].
Each panel: number ([01]) top-left + bottom text box with
look name (bold) + short description + occasion tags.
e.g. 01 '[NAME]' ('[desc]', '[TAG1 / TAG2]'); ...
```
### 다국어 인앱 텍스트 지정 골격
```text
Headline '[EN headline]' top-left; '[KR line]' below.
Bottom large '[EN slogan]', then '[中文 슬로건]', '#[hashtag]', '[FROM ...]'.
```
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (원본 PDF의 실증 예시 이미지·프롬프트 1:1 대응 기반)
- **출처 신뢰도:** A (조피디 연구소/JOPD LAB 큐레이션 예시집, 결과 이미지 동반 검증)
- **신뢰 점수:** 0.9
- **중복 검사 결과:** [[image Prompt 작성 방법]](이론)·[[이미지 prompt 생성 예시]](방법론)와 구분되는 **실전 분야별 템플릿 라이브러리**로 신규 생성
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[image Prompt 작성 방법]] — 모델별 프롬프트 문법과 구조 이론(이 예시집의 이론적 기초)
- [[이미지 prompt 생성 예시]] — 표준 프롬프트 수식과 도메인 최적화 방법론
- [[Prompt Engineering]] — 프롬프트 최적화 원론
- [[Stable Diffusion]] · [[Diffusion Models]] — 생성 모델 작동 원리
### 심층 후속 질문 (Deeper Research Questions)
- 인포그래픽 그리드(2x3, 4x3)의 셀 수가 늘어날 때 모델별 라벨 정합성 붕괴 임계점은 어디인가? [S1]
- 다국어 인앱 텍스트의 글자 정확도를 모델별로 정량 비교하면 어떤 차이가 있는가? [S1]
- Before→After 변환에서 동일 인물 일관성을 보장하는 ControlNet/IP-Adapter 조합은? [[image Prompt 작성 방법]]
### 실무 적용 맥락 (Practical Application Contexts)
- **Content Production:** SNS 카드뉴스/상세페이지 비주얼 양산 파이프라인 [S1].
- **Template Library:** 분야별 골격을 변수만 교체해 재사용하는 프롬프트 자산화 [S1].
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[BOOGU-IMAGE 프롬프트 예시집]]
- **관련 개념:** [[image Prompt 작성 방법]], [[이미지 prompt 생성 예시]], [[Negative Prompt]], [[CFG Scale]]
- **참조 맥락:** 상업용 비주얼 콘텐츠(인포그래픽·제품광고·SNS) 제작 시 즉시 복제·변형할 검증된 프롬프트 골격 참조.
## 📚 출처 (Sources)
- [S1] 조피디 연구소 (JOPD LAB), "BOOGU-IMAGE Prompt Example" (`D:/Boogu Image Prompt.pdf`, 전 12페이지 — 10개 분야 11개 예시 프롬프트 및 결과 이미지)
## 📝 변경 이력 (Change history)
- 2026-06-26: BOOGU-IMAGE 예시집 PDF를 Datacollect P-Reinforce 포맷으로 위키화. 분야별 골격(Skeleton) 11종 추출 및 복제 가능한 코드 패턴화 완료.
+108
View File
@@ -0,0 +1,108 @@
---
id: cfg-scale
title: "CFG Scale"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["Classifier-Free Guidance", "분류기 없는 가이던스", "지시문 준수 강도", "가이던스 스케일", "Guidance Scale", "CFG 스케일"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.95
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "image Prompt 작성 방법", "CFG Scale", "Stable Diffusion", "Flux", "Guidance"]
raw_sources: [
"AI 이미지 프롬프트 엔지니어링의 이론적 기초와 모델별 최적화 실무 방법론",
"Stable Diffusion Negative Prompt: Optimize Your AI Art - AI Photo Generator",
"How to Use Negative Prompts in Stable Diffusion (2025) - QWE AI Academy",
"Prompt Engineering for AI Image Generation Tips - KnowledgeHut",
"Midjourney vs Stable Diffusion vs Flux: Which Wins? (2025) - PXZ AI"
]
applied_in: ["Meteora_Web_Furniture_Automation_Workflow", "ComfyUI_Production_Pipelines"]
github_commit: ""
---
# [[CFG Scale]]
## 🎯 한 줄 통찰 (One-line insight)
CFG Scale은 모델이 사용자의 지시문(Prompt)을 얼마나 엄격하게 준수할지 결정하는 **수치적 가이던스 강도**이자, 이미지의 **창의적 변동성과 구조적 정밀도 사이의 장력을 조율**하는 핵심 매개변수이다 [S46, S1106, S1142].
## 🧠 핵심 개념 (Core concepts)
- **분류기 없는 가이던스 (Classifier-Free Guidance):** 조건부 노이즈 예측(프롬프트 반영)과 무조건적 노이즈 예측(프롬프트 미반영) 사이의 가중치를 계산하여 생성 방향을 결정하는 메커니즘 [S46, S646, S1142].
- **지시문 준수 강도 (Prompt Adherence):** 수치가 높을수록 텍스트 설명에 더 충실하게 결과물을 도출하며, 낮을수록 모델의 학습 데이터 기반 '창의적 해석' 비중이 높아짐 [S1016, S1081].
- **장력 균형 (Avoidance Mapping):** 긍정 프롬프트(목적지)와 부정 프롬프트(경계) 사이에서 샘플러가 취하는 수치적 평형 상태를 제어함 [S1107, S1143].
- **물리적 아티팩트 상관관계:** 특정 임계값(일반적으로 15 이상)을 넘어서면 색상이 과포화되거나 이미지 구조가 붕괴되는 '강제성 부작용'이 발생함 [S652, S670, S1142].
## 🧩 추출된 패턴 (Extracted patterns)
- **반비례 최적화 패턴:** 아키텍처가 고도화될수록(SD 1.5 → XL → 3.5) 요구되는 적정 CFG 수치는 점진적으로 낮아지는 경향을 보임 [S46].
- **컴파운딩 리지디티 (Compounding Rigidity):** 높은 CFG 스케일과 긴 네거티브 프롬프트가 결합될 경우, 모델이 수학적으로 과도하게 제약되어 디테일이 소실되고 이미지가 딱딱해지는(Stiff) 패턴 [S652, S670].
- **스윗 스팟 패턴 (Sweet Spot Pattern):** 모델의 창의성과 지시 이행력이 가장 조화로운 구간인 **7~12 범위**를 기본 생성 전략으로 채택함 [S1016, S1081].
- **가이던스 내재화 (Embedded Guidance):** Flux 모델과 같이 가이던스 메커니즘을 신경망 아키텍처에 미리 통합하여 CFG 수치를 1로 고정하는 진화 패턴 [S46].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 모델 아키텍처 (Architecture) | 적정 CFG 범위 | 제어 원리 및 특성 | 선택 기준 |
|---|---|---|---|
| **Stable Diffusion 1.5** | 7 ~ 9 (실사 5-8) | 해부학적 데이터 한계로 높은 가이던스 필요 [S46, S647] | 구형 체크포인트 및 LoRA 사용 시 |
| **Stable Diffusion XL** | 5 ~ 8 | 듀얼 텍스트 인코더로 낮은 수치에서도 높은 이행력 [S46, S647] | 고해상도 및 고품질 범용 생성 시 |
| **Stable Diffusion 3 / 3.5** | 4 ~ 7 | MMDiT 구조로 텍스트 결합 성능이 우수해 낮은 수치 권장 [S46] | 복잡한 문장형 프롬프트 이행 시 |
| **Flux (Dev/Schnell)** | 1 (또는 우회 3-4) | 가이던스가 신경망에 통합 연산됨 [S46, S50] | 초실사 및 정확한 텍스트 구현 시 |
| **SD Turbo / LCM** | 1 ~ 2 | 고속 샘플링을 위해 가이던스 강도를 최소화 [S647, S665] | 실시간 이미지 생성이 필요할 때 |
## 📖 세부 내용 (Details)
CFG Scale은 역확산(Reverse Diffusion) 연산 중에 **무조건적 샘플링(Unconditional Sampling) 과정을 하이재킹**하여 화면의 붕괴를 예방하고 사용자의 의도를 시각화하는 물리적 메커니즘을 취한다 [S46, S1142]. 기술적으로는 프롬프트 임베딩이 노이즈 예측 모듈 내에서 행사하는 물리적 지배력을 수치화한 것이다 [S1106, S1142].
**실무적 조율 가이드:**
- **낮은 CFG (1~4):** 모델이 프롬프트를 무시하고 자유롭게 생성하도록 방치하며, 주로 추상적인 예술이나 실험적인 레이아웃 도출에 사용됨 [S1016, S1143].
- **표준 CFG (7~10):** 대부분의 상업적 프로덕션에서 권장하는 구간으로, 지시문의 내용(Subject, Style)을 정확히 반영하면서도 시각적 결함이 적음 [S823, S899, S1016].
- **높은 CFG (12~20+):** 프롬프트의 특정 키워드를 극도로 강조할 때 사용하나, 색상 반전(Inverting)이나 '딥 프라이드(Deep-fried)'라 불리는 과포화 현상이 발생할 위험이 높음 [S652, S1142].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **Flux의 가이던스 모순:** Flux Dev 모델은 아키텍처 상 CFG 1로 고정되도록 설계되었으나, 일부 플랫폼(fal.ai 등)에서는 별도의 'Guidance Scale' 매개변수를 통해 7-10 범위의 조절 인터페이스를 제공하는 구현상의 차이가 존재함 [S46, S823].
- **과거 신념의 붕괴:** 과거에는 CFG가 높을수록 품질이 좋다고 믿었으나, 최신 분석에 따르면 높은 CFG는 오히려 미세 질감(Texture)을 파괴하고 인위적인 보정감을 강화한다는 사실이 밝혀짐 [S652, S1142].
## 🛠️ 적용 사례 (Applied in summary)
- **Meteora Web 가구 카탈로그:** 제품의 색상 변체를 생성할 때 일관성을 유지하기 위해 CFG를 7.5로 고정하고, 네거티브 프롬프트 가중치를 조율하여 아티팩트를 제어함 [S5, S11].
- **ComfyUI 워크플로우:** 로컬 환경(RTX 3080 이상)에서 SDXL 모델 구동 시 CFG 6.0~7.0 구간을 기본 프리셋으로 설정하여 이미지의 유연성을 확보함 [S6, S811].
- **DALL-E 3 우회:** DALL-E 3는 사용자가 직접 CFG를 조절할 수 없으나, LLM이 프롬프트를 "리터럴(Literal)하게 해석하라"는 지시를 섞어 물리적 가이던스 강도를 높이는 효과를 유도함 [S47, S1014].
## 💻 코드 패턴 (Code patterns)
소스 내에 직접적인 알고리즘 코드는 없으나, 생성 명령 내 매개변수 적용 패턴이 기술됨.
```text
# Stable Diffusion (A1111/ComfyUI) 파라미터 구성 예시
Steps: 25, Sampler: Euler a, CFG scale: 7.5, Seed: 12345, Size: 1024x1024
# 고가이던스 실험 (키워드 강제)
Prompt: (golden sunrise:1.5), realistic mountain... CFG scale: 12.0
``` [S44, S1016, S1115]
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (물리적 아키텍처별 벤치마크 및 실무 가이드라인 기반)
- **출처 신뢰도:** A (공식 문서, 전문 기술 아카데미 및 에이전시 데이터)
- **신뢰 점수:** 0.95
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[image Prompt 작성 방법]]
- **관련 개념:** [[Diffusion Models]], [[Prompt Engineering]], [[Negative Prompt]], [[Saturation Artifacts]]
- **참조 맥락:** 모델별 적정 지시 강도를 설정하여 시각적 결함을 최소화하고 의도한 구도를 확보하고자 할 때 참조.
## 📚 출처 (Sources)
- [S44] 스테이블 디퓨전 가중치 조절 수식 및 역확산 연산
- [S46] 아키텍처 버전에 따른 세부 네거티브 구성법과 CFG 통제 기준
- [S50] Flux.1 엔진의 가이던스 내재화 및 우회 기법
- [S646] AUTOMATIC1111: CFG 샘플링의 기술적 정의
- [S652] 고수치 CFG와 네거티브 결합 시의 부작용 분석
- [S665] SD Turbo/LCM 모델의 저수치 CFG 운용 전략
- [S823] fal.ai 등 플랫폼별 Flux 가이던스 스케일 권장값
- [S1016] CFG Scale 설정 범위(7~12) 및 모델 순응도 제어
- [S1106] CFG Scale과 가이던스 강도의 물리적 상관관계
- [S1107] Positive/Negative 지시문과 CFG의 균형 제어
- [S1142] CFG Scale이 이미지 가시성 및 아티팩트에 미치는 영향
- [S1143] CFG를 '회피 맵(Avoidance Map)'의 강도로 정의하는 개념
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. 아키텍처별 CFG 최적화 표준 및 물리적 부작용 데이터 합성 완료.
+137
View File
@@ -0,0 +1,137 @@
---
id: controlnet
title: "ControlNet"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["컨트롤넷", "기하학적 구조 제어", "Pose Conditioning", "Depth Control", "구조적 일관성 모델", "이미지 조건부 생성"]
duplicate_of: ""
source_trust_level: "S"
confidence_score: 0.98
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "이미지 prompt 생성 예시", "Stable Diffusion", "ControlNet"]
raw_sources: ["Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog", "생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시", "How to Prompt FLUX. The BEST ways for prompting FLUX.1 SCHNELL and DEV including T5 and CLIP. - YouTube", "Ultimate Beginner Guide to Learning ComfyUI (2026) - YouTube"]
applied_in: ["Stable Diffusion 1.5/XL", "ComfyUI", "Automatic1111", "Flux.1 Dev ControlNet Upscaler", "Prescene.ai Workflow"]
github_commit: ""
---
# [[ControlNet]]
## 🎯 한 줄 통찰 (One-line insight)
ControlNet은 텍스트 프롬프트의 의미론적 한계를 넘어 포즈, 깊이, 외곽선 등의 물리적 기하 지도를 확산 모델에 강제로 주입하여, 프레임 간의 완벽한 구조적 일관성과 정밀한 객체 배치를 실현하는 핵심 컨디셔닝 메커니즘이다 [S1057, S1624].
## 🧠 핵심 개념 (Core concepts)
- **구조적 컨디셔닝 (Structural Conditioning):** 단순 텍스트 지시어가 아닌 포즈(OpenPose), 깊이(Depth), 외곽선(Canny) 등의 시각적 가이드를 통해 생성물의 뼈대를 결정함 [S1057, S1063].
- **결합 제어 (Locking Control):** 카메라 앵글과 캐릭터의 포지션을 물리적으로 고정하여, 여러 패널이 하나의 플립북처럼 연결되도록 보장함 [S1057, S1058].
- **어텐션 개입 (Attention Intervention):** 확산 모델의 UNet 구조 내부에서 특정 레이어에 조건을 추가하여, 프롬프트가 생성 도중 구조를 임의로 변경하지 못하도록 억제함 [S1056, S1624].
- **모델 확장성 (Extension Ecosystem):** Stable Diffusion 1.5/XL 및 최신 FLUX 모델과 연동되어 업스케일러, 인페인팅, 자세 변환 등 다양한 확장 기능을 지원함 [S852, S1624].
## 🧩 추출된 패턴 (Extracted patterns)
- **Geometry-First Pattern:** 프롬프트를 작성하기 전 ControlNet용 참조 이미지(pose.png 등)를 먼저 로드하여 레이아웃의 원근감을 선제적으로 할당함 [S1063].
- **Character-on-Model Lock:** 특정 캐릭터의 로컬 가중치(LoRA)와 ControlNet의 포즈 제어를 결합하여 에피소드 전체에서 동일한 인물과 복장을 유지함 [S1058].
- **Batch Consistency Logic:** 복수의 씬을 생성할 때 동일한 기하학적 맵(Control Map)을 공유하여 배경의 소실점과 객체의 비율이 흐트러지는 것을 방지함 [S1058, S1642].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Option) | 제어 방식 | 주요 장점 | 언제 선택 |
|---|---|---|---|
| **ControlNet (SD)** | 물리적 맵 주입 [S1057] | 완벽한 구도 및 포즈 고정 [S1063] | 상업용 스토리보드, 시나리오 보드 제작 시 [S1058] |
| **Reference Tag (--cref)** | 스타일/캐릭터 참조 [S1056] | 프롬프트 입력의 단순함 [S1056] | 시네마틱한 미적 완성도가 우선일 때 [S1057] |
| **Interactive Chat (DALL-E)** | 자연어 수정 [S1059] | 진입 장벽 낮음, 빠른 피드백 [S1059] | 아이디어 스케치 및 텍스트 포함 디자인 시 [S1060] |
## 📖 세부 내용 (Details)
### 1. 정밀 포즈 및 차원 제어 메커니즘 [S1057, S1063]
- **OpenPose 활용:** 인체의 관절 포인트를 수치화한 맵을 주입하여 캐릭터가 프롬프트와 무관하게 정확한 동작을 수행하도록 강제함 [S1063].
- **Depth/Mask 제어:** 이미지의 전경과 배경 간의 거리 정보를 인코딩하여 모델이 임의의 원근감을 생성하는 것을 차단하고, 특정 영역에만 마스크를 씌워 수정할 수 있는 인페인팅 환경을 제공함 [S1056, S1057].
### 2. 실무 산업군 적용 및 자동화 파이프라인 [S1058, S1642]
- **스토리보드 일관성:** 에피소드 형식의 시리즈나 만화 제작 시, ControlNet을 통해 '캐릭터-온-모델'을 유지하며 동일한 세트장에서 촬영한 듯한 연속성을 확보함 [S1058].
- **배치 렌더링 시스템:** ComfyUI 환경에서 시나리오 프롬프트가 담긴 CSV 파일을 ControlNet 노드와 연결하여 수백 장의 프레임을 무인 자동 양산하는 워크플로우를 구축함 [S1642].
### 3. 최신 기술 통합 (Upscaling & Flux) [S852, S1643]
- **ControlNet Upscaler:** 낮은 해상도로 생성된 초안의 기하 구조를 ControlNet으로 고정한 상태에서 디테일만 추가하여 고해상도로 뻥튀기하는 기술이 적용됨 [S852].
- **Hybrid Workflow:** KREA AI의 'Screen-to-Image' 기술과 연동하여 스케치업의 3D 모델링 변화를 ControlNet 조건으로 실시간 반영하는 피드백 루프가 형성됨 [S1642].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **제어력의 한계:** 과거에는 ControlNet이 Stable Diffusion만의 전유물이었으나, 최근 FLUX.1 Dev 전용 ControlNet Upscaler 등이 출시되면서 모델 간의 기술적 격차가 해소되고 있음 [S852, S1624].
- **Setup Overhead:** Midjourney의 참조 태그(`--sref`)는 즉시 사용 가능하지만, ControlNet은 GPU 자원 설정과 체크포인트 관리가 필요한 DIY 방식이라는 사용자 경험상의 차이가 존재함 [S1058].
## 🛠️ 적용 사례 (Applied in summary)
- **영화 제작 previs:** 감독과 아티스트가 실제 촬영 전 조명, 렌즈, 배우의 동선을 ControlNet으로 사전 시각화하여 제작 비용을 절감함 [S1055, S1061].
- **스튜디오 자산 관리:** 특정 브랜드의 색상 팔레트와 캐릭터를 모델 레벨에서 고정하고, ControlNet으로 다양한 마케팅 배너 구도를 대량 생산함 [S1057, S1642].
## 💻 코드 패턴 (Code patterns)
```python
# ComfyUI / Stable Diffusion API 기반 ControlNet 컨디셔닝 패턴
# [S1063, S1642] 소스 기반 논적 구조 재구성
workflow_node = {
"control_net_apply": {
"positive_prompt": "wide shot of a heroine in red trench coat, anxious gaze",
"control_type": "openpose", # 포즈 강제 제어 [S1063]
"control_image": "hero_pose_01.png", # 기하학적 기준 맵
"strength": 0.8, # 컨디셔닝 강도 (0.5 임계점 준수 권장 [S1642])
"start_percent": 0.0,
"end_percent": 1.0
},
"upscale_control": {
"model": "Flux.1-Dev-ControlNet-Upscaler", # 고해상도 변환용 [S852]
"upscale_by": 2.0
}
}
```
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (실제 기업용 스토리보딩 워크플로우 및 ComfyUI 노드 설계 근거 확보)
- **출처 신뢰도:** S (Prescene 기술 분석, Black Forest Labs 및 Stability AI 기술 사양 기반)
- **신뢰 점수:** 0.98
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[프롬프트 엔지니어링]] — 텍스트 기반 지시어와 ControlNet의 물리 가이드를 결합하는 최상위 기술 [S1622]
- [[확산 모델(Diffusion Model)]] — ControlNet 조건이 주입되는 신경망 연산 기저 [S1624]
- [[이미지 prompt 생성 예시]] — ControlNet 기법이 실제로 투영되는 구체적인 프롬프트 라이브러리 [S1063]
### 심층 후속 질문 (Deeper Research Questions)
- ControlNet의 가중치 텐서가 75토큰 청크 경계면에서 프롬프트 임베딩과 충돌할 때 발생하는 수치적 드리프트를 어떻게 최소화할 수 있는가? [S1631]
- FLUX의 플로우 매칭(Flow Matching) 아키텍처에 최적화된 ControlNet 학습 방식은 기존 Diffusion 기반과 수학적으로 어떻게 다른가? [S1643]
- 섭동 어텐션 가이던스(PAG)와 ControlNet을 병용했을 때 객체의 외곽선 선명도가 비선형적으로 증가하는 구체적인 임계점은? [S1644]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** `Denoising Strength 0.5` 임계값 설정을 통한 구조 보존형 인페인팅 [S1642].
- **System Design:** CSV 기반 Batch Rendering을 통한 에피소드별 시나리오 보드 자동 추출 [S1058, S1642].
- **Operation / Maintenance:** LoRA와 ControlNet의 가중치 합산 시 `1.0` 초과로 인한 노이즈 폭발 관리 [S1630].
### 인접 주변 주제
- [[LoRA 미세 조정]] — 캐릭터와 화풍을 고정하는 가중치 튜닝 기법 [S1058]
- [[시네마토그래피]] — ControlNet으로 고정된 구도 위에 렌즈와 조명 언어를 입히는 촬영 공학 [S1626]
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[이미지 prompt 생성 예시]]
- **관련 개념:** [[확산 모델(Diffusion Model)]], [[포즈 컨디셔닝]], [[구조적 일관성]]
- **참조 맥락:** 고품질 연속 이미지 생성, 캐릭터 고정 스토리보딩, 정밀 원근 제어 작업에서 필수 참조됨.
## 📚 출처 (Sources)
- [S852] Flux.1 Dev ControlNet Upscaler: Boost Image Resolution in ComfyUI - YouTube
- [S1055] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1057] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1058] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1061] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1063] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1622] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1624] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1631] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1642] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1643] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1644] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. High-density synthesis of geometric conditioning completed.
+134
View File
@@ -0,0 +1,134 @@
---
id: diffusion-models
title: "Diffusion Models"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["확산 모델", "디퓨전 모델", "Latent Diffusion", "Reverse Diffusion", "Denoising Process", "생성형 확산 모델"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.90
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "image Prompt 작성 방법", "Diffusion Models", "Stable Diffusion", "AI Architecture"]
raw_sources: [
"AI 이미지 프롬프트 엔지니어링의 이론적 기초와 모델별 최적화 실무 방법론",
"Flux vs Stable Diffusion vs Midjourney: Best AI Image Generator Comparison - Artsmart.ai",
"Midjourney vs Stable Diffusion vs Flux: Which Wins? (2025) - PXZ AI",
"Stable Diffusion Negative Prompt: Optimize Your AI Art - AI Photo Generator",
"Stable Diffusion Negative Prompts: The Ultimate Collection",
"How to Use Negative Prompts in Stable Diffusion (2025) - QWE AI Academy",
"AI for Images: Midjourney, DALL-E, Stable Diffusion, Firefly Complete Guide"
]
applied_in: ["E-commerce_Image_Batch_Automation", "Furniture_Product_Catalog_Generation", "ComfyUI_Node_Based_Workflows"]
github_commit: ""
---
# [[Diffusion Models]]
## 🎯 한 줄 통찰 (One-line insight)
디퓨전 모델은 무작위 노이즈 상태에서 의미론적 가이던스(프롬프트)를 통해 단계적으로 데이터를 복원하여 **수학적 확률 공간 내에서 시각적 실체를 조각해내는 역확산 알고리즘 체계**이다 [S432, S803].
## 🧠 핵심 개념 (Core concepts)
- **반복적 디노이징 (Iterative Denoising):** 훈련 데이터에 노이즈를 추가하는 확산 과정을 학습하고, 이를 역으로 수행하여 순수 노이즈에서 이미지를 생성하는 핵심 메커니즘 [S432, S803].
- **잠재 확산 모델 (Latent Diffusion Model):** 고해상도 픽셀 공간 대신 압축된 잠재 공간(Latent Space)에서 연산을 수행하여 계산 효율성을 극대화한 방식 (대표적으로 Stable Diffusion) [S432, S433].
- **역확산 가이던스 (Reverse Diffusion Guidance):** 텍스트 인코더가 생성한 벡터를 통해 노이즈 제거 방향을 결정함으로써 사용자의 의도를 시각화하는 과정 [S39, S1104, S1177].
- **분류기 없는 가이던스 (Classifier-Free Guidance, CFG):** 조건부 노이즈 예측과 무조건적 노이즈 예측 사이의 가중치를 조절하여 프롬프트 준수 강도를 수치적으로 통제하는 기법 [S46, S652, S1106].
## 🧩 추출된 패턴 (Extracted patterns)
- **조각가 패턴 (Sculptor Pattern):** 노이즈라는 거대한 대리석 블록에서 프롬프트라는 치슬(Chisel)을 사용해 불필요한 영역을 깎아내며 형태를 드러내는 설계 철학 [S803, S1176].
- **임계 지연 영향 (Critical Lag Influence):** 네거티브 프롬프트의 영향력이 생성 초기보다 **10단계 이후(Step 10+)**에 본격적으로 발휘되어 구조적 결함을 수정하는 시간적 패턴 [S1124].
- **장력 균형 패턴 (Tension Balance):** 긍정 임베딩과 부정 임베딩을 동일한 토큰 크기(예: 77토큰)로 수용하여 노이즈 예측 모듈 내에서 팽팽한 장력 균형을 유도하는 물리적 배치 [S46].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 아키텍처 (Generation) | 기술적 특성 | 주요 모델 예시 | 선택 기준 |
|---|---|---|---|
| **Pixel-based** | 픽셀 단위 직접 연산, 높은 하드웨어 사양 | DALL-E 2 (초기) [S568] | 정밀한 픽셀 제어가 필요할 때 |
| **Latent-based** | 압축 공간 연산, 고속 및 저사양 유리 | Stable Diffusion 1.5 / XL [S432, S433] | 오픈소스 기반 커스터마이징 필요 시 |
| **Transformer-based** | MMDiT, T5 인코더 결합으로 문맥 이해 극대화 | Flux.1, Stable Diffusion 3 [S46, S49] | 복잡한 자연어 및 텍스트 구현 중시 시 |
## 📖 세부 내용 (Details)
### 1. 물리적 작동 원리: 확산과 역확산
- **순방향 확산:** 원본 이미지에 미세한 가우시안 노이즈를 점진적으로 추가하여 완전한 노이즈 상태로 만드는 과정 [S432, S1177].
- **역방향 확산 (생성):** 인공지능이 노이즈 예측 모듈(U-Net 또는 Transformer)을 가동하여 현재 단계의 노이즈에서 '제거해야 할 노이즈'를 추론하고, 이를 반복 차감하여 형태를 구축함 [S44, S46, S803].
### 2. 가이던스(Conditioning)의 개입
- 모델은 단순히 이미지를 만드는 것이 아니라, 입력된 **프롬프트 벡터와 현재 노이즈 사이의 유사도를 계산**하여 다음 스텝의 픽셀 배치 확률을 업데이트함 [S39, S1106].
- **네거티브 프롬프트**는 역확산 과정에서 특정 레이아웃 영역으로 이미지가 발산하지 않도록 밀어내는 가상의 반발 가드레일 역할을 수행함 [S45, S1107].
### 3. 모델 버전별 진화 양상 [S46]
- **SD 1.5:** 해부학적 데이터가 한정적이어 대량의 네거티브 어휘(5-15개)를 통한 중량급 교정이 필수적임.
- **SDXL:** 듀얼 텍스트 인코더를 탑재하여 긴 네거티브 나열 시 오히려 묘사력 감퇴가 발생함 (2-5개 권장).
- **SD 3 / Flux:** MMDiT(Multi-Modal Diffusion Transformer) 구조를 채택하여 텍스트와 이미지의 결합 성능이 비약적으로 향상됨.
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **네거티브 프롬프트의 실효성 논란:** 과거에는 모든 결함을 네거티브 프롬프트로 해결하려 했으나, 최신 연구(ECCV 2024 등) 및 커뮤니티 테스트에 따르면 모델이 학습하지 못한 개념(완벽한 손가락 등)은 네거티브로 강제할 수 없으며, 이는 훈련 데이터의 한계임 [S645, S654, S1124].
- **Flux의 가이던스 강제:** 최신 Flux 모델은 기존의 CFG 스케일 대신 신경망 내부에 가이던스 메커니즘을 내재화하여 수치를 1로 고정하거나 별도의 매개변수로 우회 조절함 [S46].
## 🛠️ 적용 사례 (Applied in summary)
- **가구 제품 카탈로그 자동화:** 가구 클라이언트 프로젝트에서 Midjourney로 초기 시안을 잡고, Stable Diffusion의 역확산 제어 기술을 사용하여 50개 이상의 제품 변체를 동일한 조명과 배경 하에 생성함 [S5, S11].
- **ComfyUI 기반 워크플로우:** Python 3.10 환경에서 노드 기반 인터페이스를 통해 역확산 과정을 단계별로 시각화하고 대량의 이미지를 배치 처리하는 자동화 시스템 구축 [S6, S25].
## 💻 코드 패턴 (Code patterns)
소스 내에 직접적인 확산 알고리즘 코드는 없으나, 모델 가동을 위한 Python 실행 패턴이 기술됨.
```bash
# ComfyUI 기반 로컬 모델 가동 패턴
# 환경: Python 3.10, NVIDIA GPU (6GB+ VRAM)
git clone https://github.com/comfyanonymous/ComfyUI.git
pip install -r requirements.txt
python main.py
# 이후 Checkpoint(Latent Diffusion Weights)를 로드하여 노드 워크플로우 실행
``` [S6]
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (물리적 메커니즘과 모델별 아키텍처 분석 포함)
- **출처 신뢰도:** A (공식 기술 문서 및 ECCV 학술 연구 데이터 인용)
- **신뢰 점수:** 0.90
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[image Prompt 작성 방법]] — 확산 모델을 제어하기 위한 최상위 지시 체계
- [[Prompt Engineering]] — 확산 모델의 벡터 전이를 최적화하는 기술
- [[Negative Prompt]] — 역확산 과정에서의 반발 가이던스 상세 제어법
### 심층 후속 질문 (Deeper Research Questions)
- 잠재 공간의 압축률(VAE 성능)이 확산 모델의 세부 질감 복원력에 미치는 수학적 영향은? [S432, S1127]
- Transformer 아키텍처 기반의 확산 모델이 기존 U-Net 대비 자연어 순응도가 높은 물리적 이유는? [S46, S110]
- 디퓨전 단계별 스케줄러(Sampler) 변경이 프롬프트 가중치 해석의 정밀도를 어떻게 변화시키는가? [S1127]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** 고해상도 상업용 이미지 생성 파이프라인 설계 [S6, S15].
- **System Design:** 로컬 하드웨어 사양에 따른 적정 확산 모델(SD 1.5 vs XL vs Flux) 선택 [S6, S46].
- **Operation / Maintenance:** 모델 버전 업그레이드에 따른 가이던스 스케일(CFG) 마이그레이션 [S46, S730].
### 인접 주변 주제
- [[Multimodal AI]] — 텍스트와 이미지의 확률 밀도 결합 확장 방향.
- [[ControlNet]] — 확산 과정에 기하학적 제약 조건을 부여하는 추가 신경망 기술 [S7, S433].
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[image Prompt 작성 방법]]
- **관련 개념:** [[Latent Diffusion]], [[Reverse Diffusion]], [[CFG Scale]], [[Denoising Step]]
- **참조 맥락:** 인공지능 이미지 생성의 물리적 원리 이해 및 아키텍처별 프롬프트 최적화 시 참조.
## 📚 출처 (Sources)
- [S39] AI 이미지 프롬프트 엔지니어링 이론 기초와 공통 프레임워크
- [S44] 스테이블 디퓨전 가중치 조절 수식 및 역확산 연산
- [S45] 프롬프트 스케줄링 및 네거티브 반발 가드레일 원리
- [S46] 아키텍처 버전별 특성 비교 및 CFG 가이던스 통제 기준
- [S432] Diffusion Models 및 Latent Diffusion 정의 (Artsmart.ai)
- [S568] DALL-E 2의 CLIP 결합형 확산 모델 진화 (DataCamp)
- [S803] 역확산 과정과 조각가 비유 (PXZ AI)
- [S1104] 네거티브 프롬프트의 세부 가이던스 메커니즘
- [S1124] ECCV 2024: 네거티브 프롬프트의 시간적 지연 효과 분석
- [S1177] 확산(Diffusion)의 물리적 노이즈 주입 및 제거 정의
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. 확산 모델의 물리적 메커니즘과 모델별 비교 데이터 합성 완료.
+138
View File
@@ -0,0 +1,138 @@
---
id: lora-미세-조정
title: "LoRA 미세 조정"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["LoRA", "Low-Rank Adaptation", "로라", "가중치 미세 조정", "특정 화풍 학습", "SD LoRA", "Fine-tuning LoRA"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.94
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "이미지 prompt 생성 예시", "LoRA", "미세 조정"]
raw_sources: ["Stable Diffusion LoRA Training: A Beginner's Guide That Skips the Fluff | QWE AI Academy", "Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog", "Elegant Woman and Rugged Man in Cinematic Noir — Z-Image Base AI Generator | Proxima Pictures", "생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시", "ComfyUI Models Explained: Checkpoints, LoRAs, VAEs & Every Type You Need (2026 Guide) - YouTube", "Best Anime & Manga Art Prompts for AI Image Generation | Promptomania"]
applied_in: ["Stable Diffusion 1.5/XL/3.5", "Kohya-ss", "ComfyUI", "Automatic1111", "Proxima Studio"]
github_commit: ""
---
# [[LoRA 미세 조정]]
## 🎯 한 줄 통찰 (One-line insight)
LoRA는 거대 확산 모델의 전체 가중치를 수정하지 않고도 특정 캐릭터, 화풍, 사물을 저비용·고효율로 주입하여 시각적 정체성을 고정하는 모듈형 신경망 확장 기술이다 [S1345, S1624].
## 🧠 핵심 개념 (Core concepts)
- **경량형 미세 조정 (Low-Rank Adaptation):** 베이스 모델(Checkpoint)의 거대한 파라미터를 동결한 채, 작은 크기의 가중치 레이어만을 학습시켜 특정 도메인 지식을 추가함 [S1624].
- **에셋 및 화풍 주입:** 일반적인 프롬프트로 설명하기 힘든 특정 배우의 얼굴, 브랜드 고유 팔레트, 혹은 특수한 애니메이션 스타일을 모델 레벨에서 재현함 [S1057, S1345].
- **모듈형 결합 (Modular Interoperability):** 하나의 이미지 생성 시 여러 개의 LoRA를 동시에 호출하여 캐릭터와 배경 스타일을 각각 다른 학습 데이터 기반으로 혼합 가능함 [S1315, S1345].
- **학습 자원 효율성:** 전체 모델 학습에 비해 훨씬 적은 VRAM과 시간으로 학습이 가능하며, 파일 용량 또한 수십 MB 단위로 매우 작음 [S1345].
## 🧩 추출된 패턴 (Extracted patterns)
- **Character-on-Model Lock:** 영화 스토리보드나 만화 제작 시, 특정 캐릭터 LoRA를 호출하여 에피소드 전체에서 인물의 일관성을 물리적으로 고정함 [S1058, S1063].
- **가중치 슬라이딩 (Weight Blending):** `(LoRA_name:0.7)`과 같이 강도를 조절하여 베이스 모델의 화풍과 LoRA의 특징 사이의 균형점을 찾음 (예: 피부 질감을 위해 'Photorealistic Skin' LoRA를 30% 강도로 적용) [S811].
- **Batch Dataset Training:** 실제 현장 사진(Set photos)이나 제품 샘플을 데이터셋으로 구성하여 상업용 배너 제작을 위한 전용 모델 에셋을 구축함 [S1063, S1345].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Option) | 특징 | 장점 | 단점 |
|---|---|---|---|
| **LoRA** | 경량 레이어 추가 [S1624] | 낮은 학습 비용, 모듈형 사용 가능 [S1345] | 베이스 모델의 구조적 한계 내에서만 작동 [S1345] |
| **Checkpoint Fine-tuning** | 전체 파라미터 재학습 [S1624] | 모델의 기본 지능 및 미학 자체를 근본적으로 개조 [S1057] | 막대한 컴퓨팅 자원 필요, 파일 용량이 매우 큼 [S1058] |
| **ControlNet** | 외부 기하 지도 주입 [S1057] | 포즈, 원근, 형태를 프레임 단위로 완벽 제어 [S1063] | 텍스트/질감 고정보다는 형태 제어에 특화 [S1057] |
## 📖 세부 내용 (Details)
### 1. 학습 아키텍처 및 메커니즘 [S1345, S1624]
- LoRA는 **Stable Diffusion 1.5/XL** 환경에서 가장 활발하게 사용되며, 오픈소스 생태계를 통해 고도화되었다 [S1624].
- 학습 도구로는 **Kohya-ss**가 표준으로 사용되며, 로컬 GPU 혹은 클라우드 환경에서 학습이 진행된다 [S1345].
- 텍스트 인코더와 UNet의 특정 레이어에 저차원 행렬을 주입하여, 프롬프트 입력 시 해당 토큰이 LoRA 가중치를 거쳐 시각화되도록 유도한다 [S1315, S1345].
### 2. 프롬프트 내 LoRA 호출 및 최적화 [S811, S1063]
- **트리거 워드(Trigger Word):** LoRA 학습 시 지정된 특정 고유 단어를 프롬프트에 포함해야 해당 가중치가 활성화된다 [S1345].
- **강도 조절 기술:**
- 0.5 미만: 베이스 모델의 특징이 지배적이며 LoRA의 특징이 미세하게 반영됨 [S811].
- 0.7~1.0: LoRA가 의도한 화풍이나 캐릭터가 명확하게 표현되는 권장 구간 [S811].
- 1.2 이상: 가중치 과부하로 인해 이미지가 타버리거나(Burn) 노이즈가 발생할 위험이 큼 [S811, S1339].
### 3. 실무 도메인별 활용 사례 [S1058, S1063]
- **애니메이션 제작:** 특정 애니메이션 스튜디오의 화풍을 LoRA로 학습시켜 일관된 품질의 컷을 대량 양산함 [S669].
- **광고 및 커머스:** 실제 브랜드의 제품 외형을 학습시켜, 가상의 배경 프롬프트 위에 실제 제품이 놓인 듯한 합성 결과물을 생성함 [S1063].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **모델 호환성 제한:** Stable Diffusion 1.5용으로 제작된 LoRA 파일은 XL 모델에서 직접 사용할 수 없으며, 반드시 해당 아키텍처에 맞춰 재학습하거나 변환 과정을 거쳐야 한다 [S1345, S1624].
- **사용 가능성 확장:** 과거에는 Midjourney에서 LoRA를 지원하지 않았으나, 최근 `--sref``--cref`와 같은 참조 기능이 LoRA의 스타일/캐릭터 고정 역할을 부분적으로 대체하며 경쟁 구도를 형성하고 있다 [S1000, S1056].
## 🛠️ 적용 사례 (Applied in summary)
- **영화 스토리보딩:** Prescene.ai 워크플로우에서 배우의 얼굴 LoRA를 사용하여 수백 장의 씬 보드에서 주인공의 외모를 동일하게 유지함 [S1058].
- **디테일 향상:** Proxima Pictures 갤러리 사례에서 'Photorealistic Skin' LoRA를 적용해 AI 특유의 매끄러운 피부 질감을 실제 사람의 모공 질감으로 개선함 [S811].
- **애니메이션 자동화:** ComfyUI 노드에 'Anime LoRA'를 연결해 텍스트만으로 특정 장르의 작화 스타일을 강제함 [S669, S1315].
## 💻 코드 패턴 (Code patterns)
```python
# ComfyUI API / JSON Workflow 기반 LoRA 호출 패턴 예시
# [S1315, S1345] 기반 구조화
lora_node = {
"load_lora": {
"model": "SDXL_Base_Checkpoint.safetensors",
"lora_name": "Studio_Ghibli_Style_V2.safetensors", # 화풍 LoRA [S669]
"strength_model": 0.85, # 적용 강도 [S811]
"strength_clip": 1.0
},
"prompt_input": {
"text": "ghibli style, a lush forest clearing with sunlight filtering through leaves, mossy rocks" # 트리거 워드 포함
}
}
```
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (실제 Stable Diffusion 실무 최적화 방법론 및 학습 가이드 교차 검증 완료)
- **출처 신뢰도:** A (전문 교육 아카데미 및 이미지 생성 플랫폼 기술 문서 기반)
- **신뢰 점수:** 0.94
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[프롬프트 엔지니어링]] — LoRA를 제어하기 위한 언어적 입력 공학 [S1622]
- [[확산 모델(Diffusion Model)]] — LoRA 레이어가 삽입되는 신경망 근간 [S1624]
- [[ControlNet]] — LoRA와 병용하여 형태와 스타일을 동시에 고정하는 기술 [S1057]
### 심층 후속 질문 (Deeper Research Questions)
- LoRA의 랭크(Rank) 수치가 모델의 수렴 속도와 생성물의 세부 묘사 정밀도에 미치는 수학적 상관관계는? [S1345]
- 여러 개의 LoRA 가중치를 합산할 때 발생하는 '가중치 드리프트' 현상을 텐서 정규화로 방어하는 기법은 무엇인가? [S1338]
- FLUX 모델의 플로우 매칭 구조에 최적화된 새로운 형태의 미세 조정(예: DoRA)은 기존 LoRA와 어떻게 다른가? [S1643]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** `Kohya-ss`를 이용한 고품질 데이터셋 캡셔닝 및 학습 파이프라인 구축 [S1345].
- **System Design:** ComfyUI에서 캐릭터 LoRA와 배경 스타일 LoRA를 레이어드하여 일관된 씬 양산 시스템 설계 [S1058, S1315].
- **Operation / Maintenance:** 모델 업데이트 시 LoRA 가중치 재조정 및 호환성 테스트 주기 관리 [S1345].
### 인접 주변 주제
- [[이미지 prompt 생성 예시]] — LoRA 기법이 구체적인 화풍으로 투영된 사례 모음 [S669]
- [[시네마토그래피]] — LoRA로 고정된 인물 위에 카메라 광학 언어를 입히는 기법 [S1626]
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[이미지 prompt 생성 예시]]
- **관련 개념:** [[확산 모델(Diffusion Model)]], [[캐릭터 일관성]], [[경량 미세 조정]]
- **참조 맥락:** 특정 브랜드 IP 고정, 상업적 캐릭터 연속성 확보, 고유 화풍 모델링 작업 시 필수 참조됨.
## 📚 출처 (Sources)
- [S669] Best Anime & Manga Art Prompts for AI Image Generation | Promptomania
- [S811] Elegant Woman and Rugged Man in Cinematic Noir — Z-Image Base AI Generator | Proxima Pictures
- [S1000] Midjourney Prompt Guide 2026: Structure and Parameters
- [S1056] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1057] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1058] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1063] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1315] ComfyUI Models Explained: Checkpoints, LoRAs, VAEs & Every Type You Need (2026 Guide) - YouTube
- [S1345] Stable Diffusion LoRA Training: A Beginner's Guide That Skips the Fluff | QWE AI Academy
- [S1622] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1624] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. High-density synthesis of lightweight adaptation mechanics completed.
+141
View File
@@ -0,0 +1,141 @@
---
id: multimodal-ai
title: "Multimodal AI"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["멀티모달 인공지능", "복합 정보 처리 AI", "Multi-modal Generative AI", "다중 모달리티 AI", "Cross-modal AI"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.92
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "image Prompt 작성 방법", "Multimodal", "GPT-4o", "CLIP", "T5"]
raw_sources: [
"AI 이미지 프롬프트 엔지니어링의 이론적 기초와 모델별 최적화 실무 방법론",
"AI for Images: Midjourney, DALL-E, Stable Diffusion, Firefly Complete Guide",
"Creating images with Flux: Your prompt guide - Nebius",
"DALL·E 3 — Prompting Guide & Examples | Promptomania",
"How to Use DALL-E 3: Tips, Examples, and Features | DataCamp",
"Midjourney vs Stable Diffusion vs Flux: Which Wins? (2025) - PXZ AI",
"미드저니 사용법의 모든 것(AI 이미지 쉽게 만들기) - 크몽"
]
applied_in: ["Project_Nive_Video_Production", "JOGYM_Brand_Visual_Workflow", "Meteora_Web_E-commerce_Automation"]
github_commit: ""
---
# [[Multimodal AI]]
## 🎯 한 줄 통찰 (One-line insight)
멀티모달 AI는 텍스트, 이미지, 오디오 등 서로 다른 데이터 양식(Modality)을 단일 모델 내에서 통합 처리하거나 상호 전이시켜 **인간의 감각과 유사한 복합적 이해와 고차원적 시각 자산 생성을 구현하는 기술 체계**이다 [S41, S177].
## 🧠 핵심 개념 (Core concepts)
- **Modality Fusion (양식 융합):** 텍스트 설명과 시각적 참조(이미지)를 동일한 잠재 공간(Latent Space)에서 결합하여 물리적 지배력을 조율하는 환경 [S41, S432].
- **LLM-Image Bridge:** 거대 언어 모델(LLM)이 사용자의 추상적 자연어를 해부학적, 물리적 맥락이 포함된 고선명 프롬프트로 재구성하여 이미지 모델에 전달하는 협업 구조 (예: DALL-E 3) [S47, S590].
- **Dual Encoder Architecture:** 언어적 뉘앙스를 처리하는 T5 인코더와 시각적 의미를 처리하는 CLIP 인코더를 병렬로 사용하여 문맥 이해도를 극대화함 (예: Flux.1) [S110, S568].
- **Cross-modal Synthesis:** 텍스트에서 이미지(T2I), 이미지에서 영상(I2V), 텍스트에서 음성(TTS) 등으로 데이터 형식을 자유롭게 변환하는 생성 능력 [S177, S1257].
## 🧩 추출된 패턴 (Extracted patterns)
- **Visual Reference Dominance (시각 참조 패턴):** 텍스트만으로 묘사가 어려운 공간감이나 피사체 특징을 이미지 URL이나 `/blend` 명령어를 통해 최우선적으로 주입하는 전략 [S41, S1223].
- **Narrative Expansion (서사 확장 패턴):** 짧고 거친 구문 입력을 LLM이 시간적 인과성, 광학적 질감, 역사적 고증 세부사항을 덧붙인 정교한 지시문으로 자동 확장 [S47, S1014].
- **Chain of Generation (연쇄 생성 패턴):** 멀티모달 모델을 독립적으로 쓰지 않고, 이미지 생성 후 음성 합성(D-ID) 및 영상 변환(Runway) 모델을 연결하여 하나의 통합 콘텐츠를 완성하는 파이프라인 [S1257].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Modality Strategy) | 장점 | 단점 | 언제 선택 |
|---|---|---|---|
| **LLM Integrated (DALL-E 3)** | 자연어 순응력 극대화, 복잡한 지시 이행 [S4, S47] | 매개변수 미세 제어 부족, 스타일 편향 [S5, S48] | 기술적 용어보다 대화형 지시가 중요할 때 [S13, S1013] |
| **Reference Weighted (Midjourney)** | 시각적 영속성(Character/Style Ref) 우수 [S43, S744] | 텍스트 정확도 낮음, 수동 가중치 조절 필요 [S4, S43] | 특정 이미지의 '분위기'나 '인물' 보존이 필수일 때 [S41, S744] |
| **Encoder Hybrid (Flux.1)** | 해부학적 정확성과 텍스트 구현의 균형 [S49, S815] | 높은 계산 자원 요구, 커뮤니티 데이터셋 적음 [S361, S817] | 초실사 묘사와 정확한 철자 표기가 동시에 필요할 때 [S49, S819] |
## 📖 세부 내용 (Details)
### 1. 거대 언어 모델(LLM)과의 결합 (DALL-E 3 체계)
DALL-E 3는 ChatGPT의 대규모 언어 아키텍처와 통합되어 설계되었다 [S47]. 사용자가 짧은 아이디어를 입력하면, 상위 LLM이 장면의 시간적 인과성, 카메라의 원근 배치, 광학적 질감을 입체적으로 덧붙인 고선명 프롬프트로 다듬어 물리 생성 모듈로 넘겨준다 [S47, S1014]. 이는 사용자가 난해한 매개변수를 공부하지 않아도 고품질 결과물을 얻게 하는 멀티모달 최적화 방식이다 [S47, S590].
### 2. 시각적 참조를 통한 멀티모달 생성 (Midjourney 체계)
단순한 텍스트 묘사를 넘어 사용자가 PC에 저장된 이미지를 직접 업로드하거나 URL을 기입하여 공간과 피사체의 물리적 융합을 구현한다 [S41, S1223]. 특히 이미지 가중치 매개변수(`--iw`)를 0.5에서 2.0 범위로 인가하여 텍스트 설명 대비 참조 이미지가 결과물에 미칠 물리적 지배력을 정밀하게 조율할 수 있는 환경을 제공한다 [S41, S1224].
### 3. 고정밀 인코더 하이브리드 (Flux.1 및 SD 3 체계)
Flux.1은 언어적 맥락을 이해하는 T5 인코더와 시각적 패턴을 매칭하는 CLIP 인코더를 동시에 활용하여, 현존 모델 중 가장 완벽에 가까운 인체 해부학적 정확성과 타이포그래피 정렬 성능을 보여준다 [S49, S110]. 이는 텍스트 가이던스가 이미지 내의 물리적 위치(X, Y 좌표)와 텍스트 레이아웃을 직접적으로 통제할 수 있게 한다 [S49, S212].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **텍스트 이해의 한계:** 과거 모델은 "코끼리를 생각하지 마"라고 입력하면 코끼리를 생성하는 등 부정 명령을 이해하지 못했으나 [S1219], 최신 멀티모달 가드레일은 시스템 수준에서 이를 '네거티브 프롬프트' 영역으로 분리하여 처리한다 [S45, S733].
- **자연어 vs 파라미터:** DALL-E 3 등 최신 멀티모달은 특수 기호(`--`, `()`)를 배제하고 자연어만 선호하지만, Stable Diffusion 계열은 여전히 가중치 수식을 통한 수학적 제어가 더 정밀한 결과물을 도출한다는 상충된 데이터가 존재한다 [S47, S718].
## 🛠️ 적용 사례 (Applied in summary)
- **프로젝트 JOGYM 영상 제작:** Midjourney로 생성한 로고 스케치를 바탕으로 DALL-E와 Stable Diffusion으로 보조 이미지를 생성하고, D-ID 모델로 인물의 입 모양을 합성하여 트레일러 영상을 제작함 [S1257, S1258].
- **Meteora Web E-commerce:** Midjourney의 미적 품질과 Stable Diffusion의 ControlNet(기하학적 제어)을 결합하여 제품 사진의 배경을 자동 교체하고 수십 개의 색상 변체를 생성하는 파이프라인 구축 [S11, S14].
## 💻 코드 패턴 (Code patterns)
### Midjourney 멀티모달 이미지 블렌딩
```bash
/blend
# 프롬프트 입력창에 이미지 파일을 드래그하여 최대 5개까지 결합
# 결과물의 크기는 --dimensions 매개변수로 조정 가능
``` [S41, S1223]
### 이미지 가중치 조율 문법
```text
https://s.mj.run/example.jpg cute cat sitting on a rug --iw 1.5
# --iw 값이 2.0에 가까울수록 원본 이미지의 구성과 색상을 더 강하게 복제함
``` [S41, S1224]
### DALL-E 3 텍스트 렌더링 프롬프트 패턴
```text
"A high-quality 3D render of a neon sign that says 'OPEN' in bright pink cursive font, fixed on a brick wall at night."
# 따옴표("")를 사용해 출력할 텍스트를 명시하는 것이 멀티모달 텍스트 인쇄의 핵심
``` [S48, S1014]
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (실제 영상 제작 프로젝트 및 상용 워크플로우 적용 사례 기반)
- **출처 신뢰도:** A (공식 문서 및 전문 엔지니어 분석 데이터 기반)
- **신뢰 점수:** 0.92
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[image Prompt 작성 방법]] — 멀티모달 생성의 최상위 전략 지침
- [[Prompt Engineering]] — 텍스트와 이미지 간의 벡터 전이 최적화 기술
- [[Diffusion Models]] — 멀티모달 가이던스가 반영되는 물리적 생성 알고리즘
### 심층 후속 질문 (Deeper Research Questions)
- CLIP과 T5 인코더의 결합 가중치가 이미지의 물리적 정확도와 예술성 사이의 균형을 어떻게 결정하는가? [S46, S110]
- Sora와 같은 영상 모델에서 텍스트와 시간(Time) 축 모달리티의 결합 메커니즘은 무엇인가? [S177]
- 멀티모달 가드레일이 현존 작가의 화풍을 우회 어휘로 정화할 때 발생하는 데이터 손실률은? [S48]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** 이미지, 영상, 음성을 결합한 브랜드 트레일러 자동 제작 [S1257].
- **System Design:** LLM 기반 프롬프트 확장 엔진과 이미지 생성 모델의 통합 인터페이스 설계 [S47, S119].
- **Operation / Maintenance:** 모델 업데이트 시 시각적 참조 이미지의 해석 편향(Stylize) 재검정 전략 [S42, S1225].
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[image Prompt 작성 방법]]
- **관련 개념:** [[GPT-4o]], [[CLIP Encoder]], [[Visual Reference]], [[Cross-modal Generation]]
- **참조 맥락:** 고밀도 비주얼 콘텐츠 제작 및 인공지능 기반 미디어 융합 시스템 설계 시 참조.
## 📚 출처 (Sources)
- [S11] Meteora Web Agency: E-commerce Product variant techniques
- [S14] Meteora Web Agency: Tool Hybrid Workflow
- [S41] 미드저니 V6 멀티모달 생성 환경과 이미지 가중치 제어
- [S43] 미드저니 V6 고유 인물 보존 CREF 매개변수
- [S45] 스테이블 디퓨전 네거티브 반발 가드레일 원리
- [S46] 아키텍처별 텍스트 인코더 결합 성능 비교
- [S47] DALL-E 3와 거대 언어 모델(LLM)의 결합 구조
- [S48] DALL-E 3 철자 표기 및 리터럴 해석 강점
- [S49] Flux.1 아키텍처의 해부학적 정확성 및 타이포그래피 성능
- [S110] Flux.1 T5 및 CLIP 인코더의 문맥 이해 원리
- [S177] GPT-4o 멀티모달 플래그십 모델 정의
- [S1219] 미드저니 텍스트 프롬프트 데이터 수집 원리
- [S1223] 미드저니 이미지 섞기(Blend) 기능 상세
- [S1224] 미드저니 이미지 가중치(--iw) 수치별 영향력
- [S1257] 생성형 AI&그래픽스: 프로젝트 JOGYM 하이브리드 영상 제작 사례
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. 멀티모달 인터페이스 및 하이브리드 생성 파이프라인 분석 완료.
+151
View File
@@ -0,0 +1,151 @@
---
id: negative-prompt
title: "Negative Prompt"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["네거티브 프롬프트", "부정 프롬프트", "거부 필터", "Negative Prompting", "--no 파라미터", "Exclusion Prompt", "반발 가드레일"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.94
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "image Prompt 작성 방법", "Stable Diffusion", "Midjourney", "DALL-E 3"]
applied_in: ["Meteora_Web_E-commerce_Workflow", "Furniture_Product_Catalog_Project", "Realistic_Portrait_Refinement_Process"]
github_commit: ""
---
# [[Negative Prompt]]
## 🎯 한 줄 통찰 (One-line insight)
네거티브 프롬프트는 이미지 생성의 목적지가 아닌 **경계(Boundaries)**를 설정하는 도구로, 역확산 과정에서 모델이 원치 않는 통계적 확률 영역으로 표류하지 않도록 차단하는 **가상의 고차원 반발 가드레일**이다 [S45, S1105, S1176].
## 🧠 핵심 개념 (Core concepts)
- **회피 맵 (Avoidance Map):** 생성 과정 중 특정 개념(왜곡, 워터마크 등)에 해당하는 노이즈 예측을 의도적으로 거부하여 결과물에서 배제하는 메커니즘 [S1104, S1107, S1177].
- **추상어의 함정 (Abstract Term Trap):** "ugly", "bad anatomy" 같은 추상적 용어는 학습 데이터 라벨링 부재로 방어율이 낮으며, "extra fingers"와 같은 **구체적 형상 단위**의 어휘가 물리적 정밀도를 결정함 [S47, S649, S656].
- **임계 지연 영향 (Critical Lag Influence):** 네거티브 프롬프트의 실질적인 영향력은 생성 초기 단계가 아닌 **10단계 이후(Step 10+)**에 본격적으로 발휘되어 구조를 정제함 [S1124].
- **모델별 수용력 차이:** 아키텍처(SD 1.5 vs SDXL vs Flux)에 따라 네거티브 프롬프트의 최적 길이는 반비례하며, 최신 모델일수록 짧고 간결한 제외 지시를 선호함 [S46, S647, S1126].
## 🧩 추출된 패턴 (Extracted patterns)
- **3개 용어 전략 (Three-Term Strategy):** "blurry, low quality, watermark"라는 최소한의 핵심 단어만으로 시작하여 모델의 창의성을 저해하지 않으면서 기초 품질을 확보하는 패턴 [S648, S655].
- **조각가 패턴 (Sculpting Pattern):** 긍정 프롬프트를 원시 대리석 블록으로, 네거티브 프롬프트를 불필요한 부분을 깎아내는 **치슬(Chisel)**로 정의하여 점진적으로 형태를 드러내는 워크플로우 [S1176].
- **장력 균형 패턴 (Tension Balance):** 긍정 임베딩과 동일한 토큰 크기(77토큰)를 할당하여 노이즈 예측 모듈 내에서 두 영역 간의 수치적 평형을 유도함 [S46].
- **점진적 정제 (Iterative Refinement):** 처음부터 대량의 단어를 넣지 않고, 결과물에서 발견된 반복적 결함을 하나씩 네거티브에 추가하며 '깎아내는' 방식 [S1115, S1130, S1188].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 아키텍처 버전 (Model) | 권장 네거티브 범위 | CFG 가이던스 범위 | 물리적 제어 원리 |
|---|---|---|---|
| **Stable Diffusion 1.5** | 5~15개 내외 (중량급) [S46, S647] | 7 ~ 9 [S46] | 해부학적 데이터 한계로 인해 인체 교정을 위한 중량급 어휘 구성이 필수적임 [S46, S1126]. |
| **Stable Diffusion XL** | 2~5개 수준 (극소) [S46, S647] | 5 ~ 8 [S46] | 거대해진 듀얼 텍스트 인코더가 긴 나열 시 오히려 묘사력 감퇴 및 색조 열화를 초래함 [S46, S1126]. |
| **Flux (Dev/Schnell)** | 거의 불필요 (무시 가능) [S46, S50] | 1 (강제 고정) [S46] | 가이던스 메커니즘이 신경망에 내재화되어 있으며, 과도한 네거티브는 구도를 무너뜨림 [S46, S50, S215]. |
| **Midjourney V6** | `--no` 매개변수 사용 [S42, S733] | --s (Stylize) 연동 | 자연어 문장 끝에 특정 단어를 명시하여 물리적 데이터 수집을 직접 거부함 [S1220]. |
## 📖 세부 내용 (Details)
### 1. 작동 원리: 무조건적 샘플링의 하이재킹
네거티브 프롬프트는 단순한 필터링이 아니라, 샘플링 단계에서 **무조건적 조건(Unconditioned Noise)**을 사용자의 제외 지시문 벡터로 대체하는 기술적 '해킹'이다 [S45, S646]. 이를 통해 모델은 사용자가 지정한 개념을 생성할 확률이 가장 낮은 방향으로 픽셀을 배치하게 된다 [S45, S1104, S1177].
### 2. 카테고리별 실무 적용 전략
- **초실사 인물 (Portraits):** "waxy skin", "plastic skin", "doll-like" 등을 배제하여 과도한 보정감을 제거하고 피부 질감을 복원함 [S1118, S1121, S1157].
- **그래픽 디자인 (Logos):** "photorealistic", "3d", "shadow", "glossy"를 네거티브에 넣어 입체감을 제거하고 플랫한 2D 벡터 스타일을 강제함 [S1178, S1184].
- **풍경 및 건축 (Landscapes):** "people", "cars", "power lines" 등을 제거하여 현대적 흔적이 없는 태고의 자연경관을 구축함 [S1183, S1185].
### 3. 주요 주의사항 및 부작용
- **상충 지시의 오류:** 긍정 프롬프트에 "어두운 골목"을 넣고 네거티브에 "어둠(dark)"을 넣으면 모델은 수치적 혼란에 빠져 이미지가 진흙처럼 뭉개지는 아티팩트가 발생함 [S723, S1187].
- **과교정(Overcorrection):** 너무 긴 네거티브 목록은 이미지의 생동감(Soul)을 앗아가고 결과물을 평이하고 지루하게 만듦 [S652, S1180, S1187].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **텍스트 이해도 변화:** 과거 모델은 "코끼리를 생각하지 마"를 "코끼리"로 인식했으나 [S1219], 최신 모델(DALL-E 3, Flux)은 "no cats"와 같은 자연어 수준의 부정 지시를 직접 해석하기 시작함 [S170, S180, S207].
- **손가락 문제의 한계:** 대중적으로 손가락 오류를 네거티브로 고칠 수 있다고 믿지만, 실제 테스트 결과 모델의 훈련 데이터 자체가 부족한 경우 네거티브 프롬프트는 **거의 효과가 없음**이 밝혀짐 [S645, S654, S657].
## 🛠️ 적용 사례 (Applied in summary)
- **Meteora Web 가구 카탈로그:** 제품 사진의 배경을 화이트로 고정하기 위해 `--no shadow, clutter`를 사용하고, 인페인팅 단계에서 네거티브 프롬프트를 통해 미세 결함을 수정함 [S11].
- **상업용 로고 스케치:** Midjourney V6에서 로고 시안 도출 시 `--no text, typography`를 사용하여 글자가 뭉개지는 현상을 사전에 방단하고 순수 형상 위주의 결과물을 확보함 [S1256].
- **초실사 워치 광고:** Flux Pro 모델 사용 시 네거티브 가중치를 최소화하여 제품 표면의 물리적 반사광과 질감을 보존함 [S824, S825].
## 💻 코드 패턴 (Code patterns)
### Midjourney V6 표준 제외 문법
```bash
/imagine prompt: A majestic knight on horseback --no armor, helmet, shield --ar 16:9
# 특정 개체를 배제하여 렌더링 방향을 강제 전환함
``` [S1220, S42]
### Stable Diffusion 가중치 네거티브 패턴 (A1111)
```text
# 특정 결함에 1.4배의 회피 강도 부여
(extra fingers:1.4), (mutated hands:1.4), (deformed iris:1.2)
# 임베딩 토큰 활용 (고밀도 네거티브 유도)
<wrong>, EasyNegative, bad-prompt-v2
``` [S44, S45, S1115, S1188]
### DALL-E 3 구문형 부정 패턴
```text
"A high-quality landscape of a futuristic city, but specify that there should be NO flying cars or neon lights, focus on green vegetation."
# 매개변수 대신 자연어 구절 내에서 부정을 명시함
``` [S170, S180]
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (물리적 노이즈 예측 원리 및 모델별 벤치마크 데이터 포함)
- **출처 신뢰도:** A (공식 문서, 아카데믹 논문(ECCV 2024), 실무 에이전시 데이터 기반)
- **신뢰 점수:** 0.94
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[image Prompt 작성 방법]] — 이미지 생성 전략의 루트 문서
- [[Diffusion Models]] — 네거티브 가이던스가 개입하는 알고리즘 체계
- [[CFG Scale]] — 네거티브 프롬프트의 영향력을 증폭시키는 수치적 지표
### 심층 후속 질문 (Deeper Research Questions)
- 네거티브 프롬프트가 이미지의 동적 범위(Dynamic Range)와 대비에 미치는 수학적 영향은? [S1119, S1125]
- CLIP 인코더의 부정어 처리 한계가 멀티모달 모델에서 어떻게 극복되고 있는가? [S46, S110]
- 스케줄링 문법(`[negative:0.5]`)을 통한 단계별 제외 기법이 구조적 무결성에 기여하는 바는? [S45, S1128]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** e-커머스 제품 이미지 자동 생성 시의 일관된 배경 관리 [S11, S14].
- **System Design:** API 요청 시 사용 사례(Portraits vs Logos)에 따른 네거티브 프리셋 자동 할당 시스템 [S1131, S1132].
- **Operation / Maintenance:** 모델 업데이트(SD 1.5 -> SDXL) 시 기존 네거티브 라이브러리의 성능 저하 진단 및 다이어트 전략 [S647, S1126].
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[image Prompt 작성 방법]]
- **관련 개념:** [[Diffusion Models]], [[CFG Scale]], [[Weighting Syntax]], [[Visual Artifacts]]
- **참조 맥락:** 고품질 비주얼 에셋 제작 시 발생할 수 있는 해부학적/기술적 오류를 물리적 계층에서 사전 차단하기 위해 참조.
## 📚 출처 (Sources)
- [S11] Meteora Web Agency: E-commerce techniques
- [S42] 미드저니 핵심 파라미터 및 --no 제어 체계
- [S44] 스테이블 디퓨전 가중치 조절 수식 정의
- [S45] 역확산 과정의 반발 가드레일 물리 메커니즘
- [S46] 아키텍처 버전별 네거티브 구성 및 CFG 통제 기준
- [S47] 추상적 수식어와 구체적 형상 단위의 방어율 비교
- [S50] Flux.1 엔진의 가이던스 내재화 및 우회 기법
- [S170] DALL-E 3 자연어 기반 부정 기술 가이드
- [S180] DALL-E 3 구문 제약 및 속성 가이드
- [S215] Flux 모델의 프롬프트 가중치 미지원 및 구문형 강조 대안
- [S645] 네거티브 프롬프트 과부하의 부작용 분석
- [S646] AUTOMATIC1111: CFG 샘플링의 기술적 정의
- [S647] SD 1.5 vs SDXL 네거티브 행동 패턴 분리
- [S648] 3개 용어 전략(Three-Term Strategy) 수립
- [S649] 추상 용어(Ugly 등)의 학습 데이터 부재 진단
- [S1104] 네거티브 프롬프트의 실시간 가이던스 역할 정의
- [S1105] 목적지(Positive)와 경계(Negative)의 기능적 분리
- [S1107] CFG Scale과 회피 맵(Avoidance Map)의 상관관계
- [S1124] ECCV 2024: 네거티브 프롬프트의 시간적 지연 효과 연구
- [S1126] SDXL/Flux의 네거티브 슬롯 한계 및 효율화
- [S1130] 창작자를 위한 실무 네거티브 워크플로우 루프
- [S1132] 개발자를 위한 모듈형 네거티브 API 설계 패턴
- [S1176] 조각가와 치슬(Chisel)의 비유를 통한 프롬프트 설계 철학
- [S1177] 확산(Diffusion) 확률 공간 내에서의 개념 기피 원리
- [S1188] 텍스트 반전(Textual Inversion) 임베딩 기반의 네거티브 최적화
- [S1220] 미드저니 --no 파라미터의 데이터 수집 거부 원리
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. 모델별 물리적 아키텍처 차이에 따른 네거티브 최적화 전략 합성 완료.
+145
View File
@@ -0,0 +1,145 @@
---
id: prompt-engineering
title: "Prompt Engineering"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["프롬프트 엔지니어링", "인공지능 지시문 최적화", "지시어 설계", "AI Prompt Design", "Context Engineering", "프롬프트 최적화"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.92
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "image Prompt 작성 방법", "Prompt Engineering", "AI Optimization"]
raw_sources: [
"AI 이미지 프롬프트 엔지니어링의 이론적 기초와 모델별 최적화 실무 방법론",
"AI for Images: Midjourney, DALL-E, Stable Diffusion, Firefly Complete Guide",
"Prompt Engineering for AI Image Generation Tips - KnowledgeHut",
"FLUX.1 Prompt Manual: A Foundational Guide : r/FluxAI - Reddit",
"How to Use Negative Prompts in Stable Diffusion (2025) - QWE AI Academy",
"Stable Diffusion Negative Prompt: Optimize Your AI Art - AI Photo Generator",
"Complete Midjourney V6 Prompt Guide: Master Every Parameter"
]
applied_in: ["Meteora_Web_Furniture_Catalog_Automation", "Logo_Conceptualization_Workflow", "E-commerce_Product_Variant_Generation"]
github_commit: ""
---
# [[Prompt Engineering]]
## 🎯 한 줄 통찰 (One-line insight)
프롬프트 엔지니어링은 사용자의 추상적 의도를 신경망이 해독 가능한 **수학적 벡터 공간으로 전이시키는 정밀한 기술적 가교**이자, 무작위성을 제어하여 일관된 결과물을 도출하는 **전략적 협업 과정**이다 [S39, S1009].
## 🧠 핵심 개념 (Core concepts)
- **계층적 프레임워크 (S+E+M+S+L+C):** 대상(Subject), 환경(Environment), 매체(Medium), 스타일(Style), 조명(Lighting), 구도(Composition)를 순차적으로 배치하여 모델의 이해도를 극대화함 [S39, S1008].
- **무조건적 샘플링 제어 (Negative Prompting):** 역확산 과정에서 불필요한 요소(왜곡, 워터마크 등)로 이미지가 발산하지 않도록 막는 **반발 가드레일** [S45, S1107].
- **분류기 없는 가이던스 (CFG Scale):** 모델이 입력된 프롬프트를 얼마나 엄격하게 준수할지 결정하는 수치적 지표 [S46, S1142].
- **자연어 구문 전이:** 최신 모델(V6, DALL-E 3, Flux)일수록 키워드 나열보다 문맥적 흐름을 가진 **서사형 문장**을 더 정확하게 해석함 [S41, S730].
## 🧩 추출된 패턴 (Extracted patterns)
- **Chiseling (조각 패턴):** 처음부터 완벽을 기하기보다 짧은 프롬프트로 시작해 결함을 진단하고, 필요한 단어를 최소한으로 추가하며 정교하게 깎아내는 방식 [S1130, S1176].
- **Specific vs. Vague (구체성 패턴):** "멋진" 같은 추상어 대신 "Hasselblad X2D 100C" 같은 기술적 사양을 명시하여 물리적 렌더링 품질을 강제 유도함 [S107, S1210].
- **Concrete Negation (구체적 부정):** "ugly" 대신 "extra fingers", "fused limbs"와 같이 구체적인 형상 단위를 명시할 때 오류 방어율이 비약적으로 상승함 [S47, S650].
- **Order Primacy (우선순위 패턴):** 프롬프트의 가장 앞부분에 위치한 단어가 최종 이미지 생성에 가장 강력한 물리적 지배력을 행사함 [S62, S718].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Strategy) | 장점 | 단점 | 언제 선택 |
|---|---|---|---|
| **자연어 서사** | 문맥 이해도 높음, 사실적 상호작용 묘사 유리 [S41, S681] | 특정 요소 개별 가중치 조절이 어려움 [S215] | Midjourney V6, DALL-E 3, Flux 사용 시 [S4, S47] |
| **태그/키워드 나열** | 각 요소의 독립적 제어 용이, 수식 적용 가능 [S44] | 문맥이 끊겨 부자연스러운 배치 발생 가능 [S739] | Stable Diffusion 및 구형 모델 사용 시 [S44, S732] |
| **네거티브 누적** | 광범위한 아티팩트 사전 방지 [S1178] | 과도할 경우 이미지의 디테일과 생동감 훼손 [S46, S645] | SD 1.5 등 아티팩트가 잦은 모델 사용 시 [S46, S1126] |
## 📖 세부 내용 (Details)
### 1. 프롬프트 구성의 6대 요소 (Framework)
- **Subject:** 인물, 사물 등 주인공의 외양과 행동을 가장 먼저 상세히 명시 [S40, S956].
- **Environment:** 기후, 장소, 물리적 배경을 통해 장면의 서사적 깊이를 부여 [S40, S1010].
- **Medium & Style:** 사진, 유화, 3D 렌더링 등 물리적 형식과 인상주의 등 예술적 화풍 지정 [S40, S1011].
- **Lighting & Composition:** 광원의 방향(네온, 골든 아워)과 카메라 렌즈 사양(85mm, 조감도)을 통해 시선을 수학적으로 통제 [S40, S1210].
### 2. 모델별 최적화 실무 전략
- **Midjourney V6:** 키워드 스팸을 지양하고 **묘사적인 문장**을 사용하며, `--style raw` 파라미터로 인위적인 미적 편향을 제거함 [S42, S730].
- **Stable Diffusion:** `(keyword:factor)` 수법으로 중요도를 조율하고, `[keyword1 : keyword2 : factor]` 스케줄링으로 단계별 피사체 교체를 수행함 [S44, S45].
- **DALL-E 3:** **리터럴(Literal) 해석** 성능을 활용하여 "3마리의 고양이" 등 수량 제어와 정확한 텍스트 기입에 집중함 [S48, S1014].
- **Flux.1:** **액티브 내러티브** 기법을 적용하여 빛과 사물의 물리적 상호작용을 동사 위주로 묘사함 [S49, S109].
### 3. 네거티브 프롬프트의 물리적 메커니즘
- U-Net 노이즈 예측 모듈이 긍정과 부정 프롬프트를 동일한 토큰 크기로 수용하여 장력 균형을 유도함 [S46].
- **SDXL/Flux 주의사항:** 최신 모델은 긴 네거티브 목록 입력 시 오히려 품질이 저하되거나 stiffness(경직)가 발생하므로 3-5개의 핵심 단어만 사용 권장 [S46, S647, S1126].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **프롬프트 길이에 대한 모순:** 과거에는 길고 화려한 프롬프트가 고품질을 보장한다고 믿었으나, 최신 분석에 따르면 불필요한 단어는 모델의 이해도를 방해하며 핵심 요소 위주의 간결한 문장이 더 우수함 [S9, S725].
- **네거티브 프롬프트의 한계:** 네거티브 프롬프트는 훈련 데이터에 없는 개념(예: 완벽한 손가락)을 만들어낼 수 없으며, 단지 낮은 확률의 노이즈 영역에서 밀어내는 역할만 수행함 [S648, S654].
## 🛠️ 적용 사례 (Applied in summary)
- **Meteora Web Agency:** 가구 클라이언트 프로젝트에서 Stable Diffusion의 가중치 조율과 ControlNet을 결합하여 스튜디오 촬영 없이 80% 이상의 비용 절감 달성 [S1, S11].
- **로고 및 무드보드 워크플로우:** Midjourney로 초기 시안 도출 후 Vectorizer.ai를 통해 벡터화하거나 Photoshop Firefly로 부분 수정하는 하이브리드 공법 사용 [S9, S52, S1256].
## 💻 코드 패턴 (Code patterns)
### Stable Diffusion 가중치 및 스케줄링 (A1111)
```text
# 특정 단어의 표현 강도를 1.5배 증가
(golden sunrise:1.5)
# 단계별 피사체 교체 (전체 스텝의 50% 지점에서 교체)
[Joe Biden : Donald Trump : 0.5]
# 토큰 한계 우회 및 개념 분리
Subject details... BREAK Background details...
``` [S44, S45]
### Midjourney 매개변수 조합
```bash
/imagine prompt: A majestic dragon on a cliff --ar 16:9 --style raw --s 150 --v 6.1
``` [S42, S733]
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (공식 문서 및 상용 에이전시의 실무 데이터 기반)
- **출처 신뢰도:** A
- **신뢰 점수:** 0.92
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[image Prompt 작성 방법]] — 이미지 생성의 최상위 전략 가이드
- [[Diffusion Models]] — 프롬프트가 작동하는 물리적 알고리즘 배경
- [[Multimodal AI]] — 텍스트와 시각 정보를 융합 처리하는 모델 체계
### 심층 후속 질문 (Deeper Research Questions)
- CLIP 인코더의 아키텍처 차이가 프롬프트 해석 정밀도에 미치는 영향은? [S46, S110]
- LLM(ChatGPT)을 프롬프트 최적화 에이전트로 활용할 때의 프롬프트 손실률은? [S47, S1267]
- 각 모델의 고유 미적 편향(Stylize)을 제거하는 수학적 원리는? [S42, S69]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** e-커머스 카탈로그 자동 생성 파이프라인 [S1, S11].
- **System Design:** LLM 기반 프롬프트 생성기와 이미지 모델의 통합 인터페이스 설계 [S47, S119].
- **Operation / Maintenance:** 모델 버전 업그레이드 시 기존 프롬프트 라이브러리의 유효성 검증 전략 [S729, S850].
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[image Prompt 작성 방법]]
- **관련 개념:** [[Negative Prompt]], [[CFG Scale]], [[Parameter Control]], [[Natural Language Syntax]]
- **참조 맥락:** 상용 프로덕션 환경에서의 이미지 생성 품질 통제 및 비용 최적화.
## 📚 출처 (Sources)
- [S1] Meteora Web Agency Guide
- [S39] AI 이미지 프롬프트 엔지니어링 이론 기초
- [S40] 프롬프트 구성 프레임워크 세부 요소
- [S42] 미드저니 핵심 파라미터 제어 체계
- [S44] 스테이블 디퓨전 가중치 문법
- [S46] 아키텍처 버전별 네거티브 구성 원리
- [S49] Flux.1 액티브 내러티브 기법
- [S62] 프롬프트 구조 및 우선순위 법칙
- [S107] 기술적 장비 명시를 통한 품질 제어
- [S647] 모델별 네거티브 프롬프트 행동 차이
- [S1008] Prompt Engineering Universal Framework
- [S1107] CFG Scale and Avoidance Mapping
- [S1176] Negative Prompt as a Chisel (Sculpting Analogy)
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. 프롬프트 엔지니어링의 이론적 기초와 실무적 패턴 합성 완료.
+131
View File
@@ -0,0 +1,131 @@
---
id: stable-diffusion
title: "Stable Diffusion"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["SD", "스테이블 디퓨전", "Latent Diffusion Model", "오픈소스 이미지 AI", "A1111", "ComfyUI", "SDXL"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.92
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "image Prompt 작성 방법", "Stable Diffusion", "Open Source AI", "Denoising"]
raw_sources: [
"AI for Images: Midjourney, DALL-E, Stable Diffusion, Firefly Complete Guide",
"AI 이미지 프롬프트 엔지니어링의 이론적 기초와 모델별 최적화 실무 방법론",
"Stable Diffusion prompt: a definitive guide - Stable Diffusion Art",
"Flux vs Stable Diffusion vs Midjourney Comparison - Artsmart.ai",
"Midjourney vs Stable Diffusion vs Flux: Which Wins? (2025) - PXZ AI",
"How to Use Negative Prompts in Stable Diffusion (2025) - QWE AI Academy",
"Stable Diffusion Negative Prompt: Optimize Your AI Art - AI Photo Generator",
"How to use positive and negative prompts in Stable Diffusion - Graydient AI"
]
applied_in: ["Meteora_Web_Furniture_Variant_Catalog", "E-commerce_Image_Batch_Automation"]
github_commit: ""
---
# [[Stable Diffusion]]
## 🎯 한 줄 통찰 (One-line insight)
Stable Diffusion은 잠재 공간(Latent Space)에서의 **역확산(Reverse Diffusion) 연산을 사용자에게 완전히 개방**하여, 수학적 가중치 조절과 보조 신경망 결합을 통해 **이미지 생성의 전 과정을 미세 통제할 수 있게 하는 오픈소스 워크호스**이다 [S5, S44, S432].
## 🧠 핵심 개념 (Core concepts)
- **잠재 확산 모델 (Latent Diffusion):** 고해상도 픽셀 공간이 아닌 압축된 잠재 공간에서 연산을 수행하여 계산 효율성을 극대화하고 로컬 환경 구동을 가능케 함 [S432, S433].
- **확장 신경망 (Extensions):** **ControlNet**(기하학적 제어) 및 **LoRA**(미세 조정 모델)를 결합하여 특정 화풍이나 구도를 기하학적으로 강제함 [S5, S433, S1016].
- **가중치 문법 (Weighting Syntax):** 텍스트 임베딩 단계에서 토큰별 물리적 지배력을 숫자로 조율(Factor)하는 연산 체계 [S44, S721].
- **무조건적 샘플링 가이던스 (Negative Prompting):** 생성 과정에서 불필요한 확률 영역으로의 발산을 막는 반발 가드레일을 독립된 입력 필드로 관리 [S45, S46, S1107].
## 🧩 추출된 패턴 (Extracted patterns)
- **조각가 패턴 (Sculptor Pattern):** 노이즈라는 거대한 대리석에서 긍정 프롬프트(목적지)와 부정 프롬프트(경계)라는 치슬(Chisel)을 사용해 형태를 깎아내는 설계 철학 [S803, S1176].
- **프롬프트 스케줄링 (Morphing Pattern):** 생성 단계(Step)별로 피사체나 화풍을 교체하여 글로벌 구도와 마이크로 텍스처를 분리 제어하는 패턴 [S45].
- **계단식 가중치 누적 (Nested Weighting):** 소괄호(`()`)나 대괄호(`[]`)를 중첩 사용하여 특정 키워드의 중요도를 지수적으로 증폭시키거나 감쇄시키는 방식 [S44, S721].
- **점진적 정제 루프 (Iterative Refinement):** 짧은 프롬프트로 시작해 결함을 진단하고, 필요한 기술적 어휘를 최소한으로 추가하며 결과물을 깎아내는 워크플로우 [S1115, S1130].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Option) | 장점 | 단점 | 언제 선택 |
|---|---|---|---|
| **Stable Diffusion** | **최대 제어권**, 로컬 실행, 무한한 커스터마이징, 비용 무료 [S5, S13, S804] | 높은 학습 곡선, 하드웨어(GPU) 사양 요구, 품질 불균형 [S13, S806] | **상업용 제품 카탈로그 일관성 유지**, 특정 캐릭터/포즈의 정밀 제어 필요 시 [S5, S11, S809] |
| **Midjourney** | 압도적 미적 품질, 자연어 순응도 높음, 저사양 가능 [S3, S768, S796] | 폐쇄형 시스템, 텍스트 구현 약함, 구독료 발생 [S4, S798] | 신속한 컨셉 아트 및 시각적 영감이 최우선일 때 [S14, S800, S838] |
| **DALL-E 3** | 극강의 자연어 이해, 타이포그래피 정확도 [S4, S48, S1013] | 매개변수 미세 제어 불가, 일러스트 편향 [S5, S48] | 복잡한 상황 묘사나 텍스트 포함 드래프트 제작 시 [S4, S52] |
## 📖 세부 내용 (Details)
### 1. 물리적 노이즈 제어 문법
- **가중치 수식:** `(keyword:factor)` 형태를 취하며, 1.0보다 크면 표현 강도가 증가하고 작으면 약화됨 [S44, S721]. AUTOMATIC1111 환경에서 `(keyword)`는 1.1배, `[keyword]`는 0.9배의 가중치를 가짐 [S44, S721].
- **스케줄링:** `[keyword1 : keyword2 : factor]` 문법을 통해 전체 생성 스텝 중 특정 시점(factor)에서 피사체를 교체할 수 있음 (예: 초기엔 인물 형상, 후기엔 텍스처 반영) [S45].
- **토큰 최적화:** 75(또는 77)토큰 한계를 우회하기 위해 `BREAK` 구문을 사용하여 강제 청크 분할을 적용, 개념 간 간섭을 차단함 [S45, S46].
### 2. 아키텍처 버전별 진화 및 최적화 전략 [S46, S647]
- **V1.5:** 해부학적 데이터가 한정적이므로 인체 교정을 위해 5~15개 내외의 **중량급 네거티브 프롬프트**가 필수적임.
- **XL (SDXL):** 거대해진 듀얼 텍스트 인코더를 사용하여 긴 네거티브 나열 시 오히려 품질이 저하됨. 2~5개의 **극소 품질 지시어**만 권장함.
- **V3 / 3.5:** MMDiT 구조로 텍스트 결합력이 우수해져 네거티브가 거의 불필요하며, 과도한 제약은 본래의 디테일을 훼손함.
### 3. CFG Scale (가이던스) 운용 [S46, S1016, S1142]
- 모델이 프롬프트를 얼마나 엄격하게 준수할지 결정하는 수치로, **7~12 범위**가 창의성과 정확성의 스윗 스팟으로 간주됨.
- CFG가 15 이상으로 높아지면 색상 과포화나 구조 붕괴(Deep-fried artifacts)가 발생할 위험이 비약적으로 상승함.
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **프롬프트 길이에 대한 모순:** 과거에는 "masterpiece", "8k" 등 대량의 미사여구가 품질을 높인다고 믿었으나, OpenCLIP 등 최신 인코더에서는 이러한 단어가 **오히려 노이즈를 유발**하거나 성능을 저하시키는 것으로 판명됨 [S45, S646, S725].
- **부정 프롬프트의 한계:** 네거티브 프롬프트는 훈련 데이터에 없는 개념(예: 완벽한 손가락)을 강제할 수 없으며, 단지 낮은 확률의 노이즈 영역으로 밀어내는 역할만 수행함 [S648, S654].
## 🛠️ 적용 사례 (Applied in summary)
- **Meteora Web 가구 카탈로그:** 제품의 원형(Silhouette)을 ControlNet으로 고정하고, Stable Diffusion의 가중치 조율을 통해 **동일 조명/배경 하에 50개 이상의 제품 색상 변체**를 생성하여 비용을 80% 절감함 [S5, S11, S30].
- **E-commerce 배치 자동화:** Python 스크립트와 결합된 ComfyUI 워크플로우를 통해 수백 장의 제품 이미지를 일괄 생성 및 배경 제거(rembg) 처리하는 파이프라인 구축 [S6, S11, S25].
## 💻 코드 패턴 (Code patterns)
### 로컬 환경 구축 패턴 (Windows/NVIDIA)
```bash
# ComfyUI 또는 A1111 구동을 위한 필수 환경
# 사양: Python 3.10.6, NVIDIA GPU (6GB+ VRAM 권장) [S6, S812]
git clone https://github.com/comfyanonymous/ComfyUI.git # 또는 A1111 리포지토리
pip install -r requirements.txt
python main.py # 실행 후 localhost:8188 또는 7860 접속 [S6, S812]
```
### A1111 프롬프트 가중치 응용 패턴
```text
# 특정 요소 강조 및 네거티브 필터링 예시
Prompt: (golden sunrise:1.2), photorealistic, (Hasselblad X2D 100C:1.1)
Negative: (extra fingers:1.4), blurry, low quality, watermark, [shadow]
# ( )는 1.1배 증가, [ ]는 0.9배 감소, 숫자는 직접 지정 [S44, S721, S1017]
```
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (실무 에이전시의 대량 생산 파이프라인 적용 데이터 기반)
- **출처 신뢰도:** A (공식 문서, 전문 기술 블로그, 커뮤니티 검증 데이터 포함)
- **신뢰 점수:** 0.92
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[image Prompt 작성 방법]]
- **관련 개념:** [[Diffusion Models]], [[Prompt Engineering]], [[ControlNet]], [[Negative Prompt]], [[CFG Scale]]
- **참조 맥락:** 고밀도 제어가 필요한 상업용 시각 자산 제작 및 로컬 하이브리드 워크플로우 설계 시 참조.
## 📚 출처 (Sources)
- [S5] Meteora Web Agency: Total Control with Stable Diffusion
- [S6] ComfyUI Local Installation and Python 3.10 requirements
- [S11] AI for E-commerce: Product Variant Generation Techniques
- [S44] 스테이블 디퓨전 가중치 조절 수식 및 역확산 연산 가이드
- [S45] 프롬프트 스케줄링 및 BREAK 청크 분할 원리
- [S46] 아키텍처 버전별(SD 1.5, XL, 3.5) 네거티브 구성 및 CFG 통제 기준
- [S432] Latent Diffusion 정의 및 훈련 데이터 역확산 프로세스
- [S433] ControlNet 및 LoRA 신경망 확장 기법 정의
- [S647] 모델 버전별 네거티브 프롬프트 행동 차이 분석
- [S721] ( ) 및 [ ] 괄호 가중치 수학적 배수 처리 정의
- [S803] 역확산 과정과 조각가 패턴 비유
- [S804] 스테이블 디퓨전의 오픈소스 특성 및 완전 제어권 정의
- [S812] A1111 설치 단계 및 환경 사양 가이드
- [S1016] CFG Scale 설정 범위(7~12) 및 모델 순응도 제어
- [S1107] Positive/Negative 지시문과 CFG의 균형 제어
- [S1176] 조각가와 치슬(Chisel)의 비유를 통한 프롬프트 설계 철학
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. 로컬 제어 문법과 버전별 최적화 전략 합성 완료.
@@ -0,0 +1,182 @@
---
id: image-prompt-작성-방법
title: "image Prompt 작성 방법"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["AI 이미지 프롬프트 엔지니어링", "Image Prompt Engineering", "AI 그림 명령어 작성법", "프롬프트 최적화 방법론"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.88
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "image Prompt 작성 방법", "Prompt Engineering", "Midjourney", "Stable Diffusion", "DALL-E 3", "Flux"]
raw_sources: [
"AI for Images: Midjourney, DALL-E, Stable Diffusion, Firefly Complete Guide",
"AI 이미지 프롬프트 엔지니어링의 이론적 기초와 모델별 최적화 실무 방법론",
"Complete Midjourney V6 Prompt Guide: Master Every Parameter",
"Creating images with Flux: Your prompt guide - Nebius",
"DALL-E: Tips for Writing Effective Prompts - Brightspace Community",
"DALL·E 3 — Prompting Guide & Examples | Promptomania",
"DALL·E 3를 사용하여 이미지 생성 - AIPRM",
"FLUX.1 Prompt Guide: Pro Tips and Common Mistakes to Avoid",
"FLUX.1 Prompt Manual: A Foundational Guide : r/FluxAI - Reddit",
"Flux vs Stable Diffusion vs Midjourney Comparison - Artsmart.ai",
"Free AI Prompt Library — 4,000+ Midjourney, DALL-E & FLUX Prompts | PromptSpace",
"How to Use DALL-E 3: Tips, Examples, and Features | DataCamp",
"How to Use Negative Prompts in Stable Diffusion (2025) - QWE AI Academy",
"How to Write Better Prompts for Flux AI | Eachlabs",
"How to use positive and negative prompts in Stable Diffusion - Graydient AI",
"Midjourney V6 Prompt Guide: 15 Formulas That Actually Work in 2026",
"Midjourney vs Flux AI Comparison - Dirtyline Studio",
"Midjourney vs Stable Diffusion vs Flux: Which Wins? (2025) - PXZ AI",
"Midjourney Documentation: Parameter List / Prompt Basics",
"Prompt Engineering for AI Image Generation Tips - KnowledgeHut",
"Stable Diffusion Negative Prompt: Optimize Your AI Art - AI Photo Generator",
"Stable Diffusion Negative Prompts: The Ultimate Collection",
"미드저니 사용법: ai 그림 초보를 위한 프롬프트 팁 - 패스트캠퍼스",
"미드저니 사용법: 프롬프트 작성 가이드 I 이랜서 블로그",
"미드저니 사용법의 모든 것(AI 이미지 쉽게 만들기) - 크몽"
]
applied_in: ["Meteora_Web_Agency_E-commerce_Workflow", "Furniture_Product_Catalog_Automation"]
github_commit: ""
---
# [[image Prompt 작성 방법]]
## 🎯 한 줄 통찰 (One-line insight)
프롬프트 엔지니어링은 사용자의 시각적 의도를 신경망이 해독 가능한 **수학적 벡터 공간으로 전이시키는 정밀한 기술적 협업 과정**이며, 각 모델의 아키텍처 특성에 맞춘 **구조적 묘사와 매개변수 제어**가 품질을 결정한다 [S2].
## 🧠 핵심 개념 (Core concepts)
- **공통 프레임워크 (S+E+M+S+L+C):** 대상(Subject), 환경(Environment), 매체(Medium), 스타일(Style), 조명(Lighting), 구도(Composition)의 계층적 배치 [S2, S20].
- **모델별 언어 이해도 차이:** Midjourney V6/DALL-E 3/Flux는 **자연어 문장**을 선호하나, Stable Diffusion은 **태그 나열 및 가중치 수식**에 더 민감함 [S2, S16, S18].
- **네거티브 프롬프팅 (Negative Prompting):** 역확산 과정에서 불필요한 요소(왜곡, 텍스트 등)로 이미지가 발산하지 않도록 막는 **반발 가드레일** 역할 [S2, S13, S21].
- **매개변수 제어 (Parameter Control):** 종횡비(`--ar`), 예술적 변형(`--s`), 무작위성(`--c`) 등 하이픈 기반의 연산 장치를 통한 세부 조정 [S2, S3, S19].
## 🧩 추출된 패턴 (Extracted patterns)
- **액티브 내러티브 (Active Narrative):** 정적인 단어 나열보다 **빛과 환경의 상호작용**을 동사 위주로 묘사할 때 사실성이 극대화됨 (특히 Flux 모델) [S2, S4].
- **계단식 레이어링 (Cascading Layering):** 프롬프트 내에서 피사체를 전경, 중경, 배경의 순서로 배치하여 개념 간 간섭을 최소화 [S2, S8, S9].
- **역공학 기반 최적화 (Reverse Engineering):** 선호하는 이미지의 설명을 생성 AI(ChatGPT 등)를 통해 묘사하게 한 후 이를 기반으로 프롬프트를 재구성 [S12, S14].
- **점진적 정제 (Iterative Refinement):** 짧은 프롬프트에서 시작해 결함을 진단하고, 필요한 기술적 어휘를 최소한으로 추가하며 'Chiseling' 하듯 깎아냄 [S15, S21, S22].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Model) | 장점 | 단점 | 언제 선택 |
|---|---|---|---|
| **Midjourney** | 압도적인 예술적 미학, 시네마틱 질감 [S1, S2] | 텍스트 구현력 부족, Discord 기반 워크플로우 [S1, S18] | 미적 품질이 최우선인 브랜드/콘셉트 아트 제작 시 [S1, S18] |
| **DALL-E 3** | 뛰어난 자연어 순응력, 정확한 수량/철자 제어 [S2, S12] | 매개변수 미세 제어 불가, 인위적인 일러스트 질감 [S1, S2] | 복잡한 지시나 텍스트가 포함된 빠른 드래프트 필요 시 [S1, S2] |
| **Stable Diffusion** | 로컬 실행, 무한한 커스터마이징(LoRA, ControlNet) [S1, S2] | 높은 학습 곡선, 하드웨어 사양 요구 [S1, S18] | 동일 피사체의 일관된 변형 및 물리적 정밀 제어 필요 시 [S1, S2] |
| **Flux.1** | 현존 최강의 해부학적 정확성(손가락 등), 텍스트 구현 [S2, S18] | 예술적 화풍의 다양성 부족, 신규 모델로 자료 적음 [S18] | 초실사 인물 사진 및 상업적 타이포그래피 포함 이미지 [S4, S18] |
## 📖 세부 내용 (Details)
### 1. 프롬프트의 기본 구조 (Anatomy of a Prompt)
- **Subject (대상):** 인물, 사물 등 주인공의 외양과 행동을 가장 먼저 명시 [S2, S19].
- **Environment (환경):** 시간대, 장소, 기후 등 서사적 깊이 추가 [S2, S20].
- **Medium/Style (매체/스타일):** 사진, 유화, 3D 렌더링 등 물리적 형식 지정 [S2, S16].
- **Lighting/Composition (조명/구도):** 광원의 방향과 카메라 렌즈 사양(예: 85mm, wide angle)을 통해 시선을 수학적으로 통제 [S2, S20, S21].
### 2. 모델별 최적화 실무 전략
- **Midjourney V6:** 키워드 나열보다 **묘사적인 문장**을 사용하고, `--style raw` 파라미터를 통해 인위적인 미적 편향을 제거 가능 [S2, S3, S16].
- **Stable Diffusion:** `(keyword:factor)` 수법으로 중요도를 조율하며, `[keyword1 : keyword2 : factor]` 스케줄링을 통해 생성 단계별 피사체 교체 가능 [S2, S15].
- **DALL-E 3:** ChatGPT와 협업하여 추상적인 아이디어를 고선명 문장으로 다듬어 입력하며, 따옴표(`""`) 내부에 정확한 출력 텍스트를 기입 [S2, S12].
- **Flux.1:** 괄호 가중치를 인식하지 못하므로 "with a strong emphasis on..." 같은 **구문형 강조** 표현을 사용 [S2, S8].
### 3. 네거티브 프롬프트 활용 원칙
- **추상어 지양:** "ugly", "bad anatomy" 대신 "extra fingers", "misaligned eyes" 등 **구체적인 형상 단위**의 어휘를 사용해야 정밀도가 배가됨 [S2, S13, S21].
- **아키텍처별 차이:** SD 1.5는 15개 내외의 대량 단어가 필요하나, SDXL 및 SD 3 이상은 긴 목록 입력 시 오히려 품질이 저하되므로 3-5개의 핵심 단어만 권장 [S2, S13].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **자연어 vs 태그:** 과거에는 쉼표로 분할된 '태그 누적형'이 주류였으나, 최신 모델(V6, DALL-E 3, Flux)은 **자연어 구문**을 더 정확하게 이해하며 키워드 스팸은 오히려 품질을 저하시킴 [S2, S16].
- **Flux Dev 모델의 백색 배경 결함:** Flux Dev 모델에서 "white background"를 명시하면 회색조 블러 이미지가 출력되는 부작용이 발견됨. "minimal design showing clean details"로 우회 기입 권장 [S2, S8].
## 🛠️ 적용 사례 (Applied in summary)
- **Meteora Web Agency:** e-커머스 랜딩 페이지 및 제품 상세 페이지 제작 시 Midjourney와 Stable Diffusion을 혼합 사용 [S1].
- **가구 클라이언트 프로젝트:** 스튜디오 촬영 비용을 절감하기 위해 Stable Diffusion의 ControlNet으로 포즈를 고정하고, 프롬프트 변형으로 수십 개의 제품 색상 및 재질 옵션을 생성 [S1].
- **로고 및 무드보드:** Midjourney로 초기 시안 도출 후 Vectorizer.ai를 통해 벡터화하는 파이프라인 구축 [S1, S2, S25].
## 💻 코드 패턴 (Code patterns)
### Midjourney V6 표준 문법
```bash
/imagine prompt: [Image Prompt(s)] [Text Prompt] [--parameters]
# 예시:
/imagine prompt: https://example.com/ref.jpg minimalist ceramic vase, natural lighting, 8k --ar 16:9 --v 6.1 --s 250
``` [S2, S3]
### Stable Diffusion 가중치 및 스케줄링 (A1111)
```text
# 가중치 조절 (1.1배 증가)
(golden sunrise:1.1)
# 단계별 교체 (초기 50% 지점에서 도널드 트럼프를 조 바이든으로 교체)
[Donald Trump : Joe Biden : 0.5]
# 청크 분할 (75토큰 한계 우회)
Subject details... BREAK Background details...
``` [S2, S15]
### Flux.1 구문형 강조 패턴
```text
"A high-detail cinematic capture of an astronaut on Mars, with a focus on the reflections on the helmet visor, highly realistic textures."
``` [S2, S8]
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (실제 비즈니스 적용 사례 근거 포함)
- **출처 신뢰도:** A (공식 문서, 전문 엔지니어 분석 및 커뮤니티 검증 데이터 기반)
- **신뢰 점수:** 0.88
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[Prompt Engineering]] — AI 모델에 전달하는 모든 지시문의 최적화 원론
- [[Diffusion Models]] — 이미지 생성 AI의 핵심 작동 알고리즘
- [[Multimodal AI]] — 텍스트와 이미지를 동시에 처리하는 모델 체계
### 심층 후속 질문 (Deeper Research Questions)
- 각 모델의 CLIP 인코더 성능 차이가 프롬프트 해석 정밀도에 미치는 영향은 무엇인가? [S2, S21]
- ControlNet과 IP-Adapter를 활용한 시각적 프롬프트 제어의 물리적 한계는 어디까지인가? [S1, S2]
- LoRA 학습 데이터셋의 라벨링 방식이 프롬프트 트리거 어휘의 효과를 어떻게 결정하는가? [S2, S13]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** e-커머스 제품 이미지 자동 생성 파이프라인 [S1].
- **System Design:** LLM(ChatGPT)과 이미지 생성 모델을 결합한 통합 에이전트 설계 [S2, S12].
- **Operation / Maintenance:** 모델 업데이트(V6 -> V7 등)에 따른 기존 프롬프트 라이브러리 마이그레이션 전략 [S16, S18].
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[image Prompt 작성 방법]]
- **관련 개념:** [[Midjourney V6]], [[Stable Diffusion XL]], [[Flux.1]], [[Negative Prompt]]
- **참조 맥락:** 상업용 비주얼 콘텐츠 제작 및 프롬프트 자동화 시스템 설계 시 참조.
## 📚 출처 (Sources)
- [S1] Meteora Web Agency, "AI for Images: Midjourney, DALL-E, Stable Diffusion, Firefly Complete Guide"
- [S2] Markdown Data, "AI 이미지 프롬프트 엔지니어링의 이론적 기초와 모델별 최적화 실무 방법론"
- [S3] Free AI Prompt Maker, "Complete Midjourney V6 Prompt Guide: Master Every Parameter"
- [S4] Nebius AI Studio, "Creating images with Flux: Your prompt guide"
- [S5] Brightspace Community, "DALL-E: Tips for Writing Effective Prompts"
- [S6] Promptomania, "DALL·E 3 — Prompting Guide & Examples"
- [S7] AIPRM, "DALL·E 3를 사용하여 이미지 생성"
- [S8] getimg.ai, "FLUX.1 Prompt Guide: Pro Tips and Common Mistakes to Avoid"
- [S9] Reddit r/FluxAI, "FLUX.1 Prompt Manual: A Foundational Guide"
- [S10] Artsmart.ai, "Flux vs Stable Diffusion vs Midjourney Comparison Guide"
- [S11] PromptSpace, "Free AI Prompt Library — 4,000+ Prompts"
- [S12] DataCamp, "How to Use DALL-E 3: Tips, Examples, and Features"
- [S13] QWE AI Academy, "How to Use Negative Prompts in Stable Diffusion (2025)"
- [S14] Eachlabs, "How to Write Better Prompts for Flux AI"
- [S15] Graydient AI, "How to use positive and negative prompts in Stable Diffusion"
- [S16] Howard Huang, "Midjourney V6 Prompt Guide: 15 Formulas That Actually Work"
- [S17] Dirtyline Studio, "Midjourney vs Flux AI Comparison"
- [S18] PXZ AI, "Midjourney vs Stable Diffusion vs Flux: Which Wins? (2025)"
- [S19] Midjourney Docs, "Parameter List / Prompt Basics"
- [S20] KnowledgeHut, "Prompt Engineering for AI Image Generation Tips"
- [S21] AI Photo Generator, "Stable Diffusion Negative Prompt: Optimize Your AI Art"
- [S22] Free AI Prompt Maker, "Stable Diffusion Negative Prompts: The Ultimate Collection"
- [S23] 패스트캠퍼스, "미드저니 사용법: ai 그림 초보를 위한 프롬프트 팁"
- [S24] 이랜서 블로그, "미드저니 사용법: 프롬프트 작성 가이드"
- [S25] 크몽, "미드저니 사용법의 모든 것(AI 이미지 쉽게 만들기)"
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. 정밀한 모델별 문법과 실무 워크플로우 반영 완료.
@@ -0,0 +1,159 @@
---
id: 시네마토그래피
title: "시네마토그래피"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["Cinematography", "시네마틱 스타일", "촬영 공학", "이미지 광학 제어", "Camera and Lighting", "필름 메커니즘"]
duplicate_of: ""
source_trust_level: "S"
confidence_score: 0.98
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "이미지 prompt 생성 예시", "시네마토그래피"]
raw_sources: ["생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시", "Camera + Lighting Prompt Cheatsheet for AI Images Guide", "Cinematic AI Generator Prompts | Proxima Pictures", "8 Components of Great AI Art Prompts | Microsoft Copilot", "Photography Modifiers in AI-Generated Images | CodeSignal Learn", "Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog", "Elegant Woman and Rugged Man in Cinematic Noir — Z-Image Base AI Generator | Proxima Pictures", "Runway Resources | AI Image Prompting Guide: 68 Ready-to-Use Prompts"]
applied_in: ["Midjourney V8.1", "Stable Diffusion XL", "DALL-E 3", "Z-Image Base", "Gemini 2.5 Flash Image"]
github_commit: ""
---
# [[시네마토그래피]]
## 🎯 한 줄 통찰 (One-line insight)
AI 이미지 생성에서 시네마토그래피는 물리적 광학 법칙과 조명 공학을 텍스트 토큰으로 인코딩하여 결과물의 서사적 깊이와 시각적 전율을 결정짓는 정밀 제어 앵커이다 [S758, S1622].
## 🧠 핵심 개념 (Core concepts)
- **카메라 우선 구조화 (Lead with Camera):** 피사체 묘사보다 "Wide shot, 35mm lens"와 같은 카메라 사양을 프롬프트 서두에 배치하여 전체 레이아웃의 원근감을 선제적으로 할당하는 전략 [S1062, S1643].
- **렌즈 기하학 모사:** 초점거리(85mm, 50mm 등)와 조리개($f/1.4 - f/8.0$) 수치를 통해 공간의 압축률과 피사체의 투시 왜곡을 수학적으로 조율함 [S1625, S1626].
- **조명 아키텍처:** 광원의 종류(Softbox, Neon)와 조사 각도($45^\circ$, Rim light)를 명시하여 물리적 입체감과 명암비(Contrast)를 연산함 [S703, S1626].
- **광학적 결함 주입 (Optical Imperfections):** 색수차(Chromatic aberration), 필름 그레인, 렌즈 왜곡 등을 의도적으로 기술하여 인공적인 질감을 배제하고 사실성을 확보함 [S33, S1626, S1639].
## 🧩 추출된 패턴 (Extracted patterns)
- **심도 제어 패턴:** 인물 사진에는 85mm 렌즈와 $f/1.8$ 이하의 낮은 조리개 값을 결합하여 배경 보케(Bokeh)를 극대화하고 시선을 고정함 [S133, S1625, S1626].
- **삼각형 하이라이트 패턴 (Rembrandt):** 측면 상단 광원을 지시하여 뺨 부분에 삼각형 빛 패치를 형성, 고전 회화와 같은 드라마틱한 분위기 연출 [S710, S1626].
- **분리 및 할로 패턴 (Rim Light):** 피사체 배후에 강력한 광원을 배치하여 어두운 배경으로부터 실루엣을 명확히 분리하고 고급스러운 마감 부여 [S708, S1626].
- **감정적 앵글 매칭:** 네덜란드 앵글(Dutch angle)로 불안함을, 로우 앵글(Low angle)로 피사체의 권위와 힘을 시각화함 [S1062, S1260].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 렌즈 유형 | 시각적 특성 | 주요 강점 | 최적 활용 도메인 |
|---|---|---|---|
| **85mm Portrait** | 얼굴 왜곡 제거, 얕은 심도 [S1625] | 부드러운 배경 보케 유도 [S1626] | 패션 뷰티 화보, 인물 클로즈업 [S1625] |
| **50mm Standard** | 인간 안구와 유사한 원근감 [S1625] | 무왜곡 평면 구성 [S1626] | 커머스 제품 촬영, 스틸 라이프 [S1625] |
| **35mm Cinematic** | 피사체와 배경의 이상적 비중 [S1625] | 자연스러운 3인칭 시점 [S1626] | 영화 스틸컷, 스토리보드 구성 [S1625] |
| **24mm Wide** | 전경의 역동적 왜곡 [S1625] | 소실점과 기하학적 투시 강조 [S1626] | 건축 외관, 광활한 자연 풍경 [S1625] |
## 📖 세부 내용 (Details)
### 1. 전문 조명 기법의 렌더링 제어 [S1626]
- **소프트박스 조명:** 피사체 사선 상단에서 확산된 부드러운 빛을 묘사한다. 피부 질감을 플랫하게 정돈하여 상업 광고에 적합하며, 그림자 경계면이 매우 부드럽다 [S707, S1626].
- **키아로스쿠로(Chiaroscuro):** 명암 대조를 극단적으로 강화하여 연극적이고 신비로운 연출을 구성한다 [S710, S1509].
- **체적 조명(Volumetric Light):** 안개나 먼지 입자에 빛이 부딪혀 빛의 다발이 형성되는 현상을 유도하여 밀도 있는 대기감을 생성한다 [S808, S1637].
### 2. 필름 및 기계 메커니즘 묘사 [S1626]
- **DSLR 바디 세팅:** 특정 카메라 모델(예: Canon EOS 5D Mark IV)과 함께 셔터 스피드($1/125\text{s}$), ISO(100) 등을 수치로 명시하여 고해상도 생성 한계를 정교하게 활성화한다 [S33, S1626].
- **아날로그 필터링:** "VHS color palette"나 "scan lines"를 주입하여 현대적인 디지털 픽셀을 90년대 브라운관 브로드캐스트 사양으로 강제 변환시킨다 [S1638, S1639].
### 3. 화면 구도와 프레이밍 [S1260, S1622]
- **황금비 및 3분할 법칙:** "Rule of thirds"를 명시하여 시각적 균형과 안정감을 확보한다 [S33, S759].
- **시점 제어:** 눈높이 샷(Eye-level)은 연결성과 신뢰감을, 부감 샷(Bird's eye)은 피사체의 취약함을 시각적으로 은유한다 [S1260].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **시네마틱 키워드의 모호성:** "Cinematic"이라는 단일 키워드만으로는 모델이 무작위 결과물을 내놓을 가능성이 높으므로, 반드시 구체적인 조명 방향과 대비 수치를 수반해야 한다 [S705, S718].
- **해상도와 구도의 관계:** 과거에는 업스케일링 과정에서 구도가 망가지는 현상이 잦았으나, **Midjourney V8.1**(--hd)과 같은 최신 엔진은 초기 단계부터 2K 고화질로 렌더링하여 구조적 완벽성을 유지한다 [S1628].
## 🛠️ 적용 사례 (Applied in summary)
- **영화 스토리보딩:** Midjourney와 Stable Diffusion을 활용하여 조명과 렌즈 값을 사전 시각화, 제작 효율을 증대시킨 사례 [S1054, S1061].
- **상업 브랜드 캠페인:** 버거킹 프랑스의 할로윈 캠페인에서 AI 특유의 '비현실적 조명'을 의도적으로 공포 컨텐츠로 활용함 [S920, S966].
- **Z-Image Base 최적화:** $cfg\_scale$ 4.5와 16:9 종횡비를 설정하여 질감과 조명의 시네마틱 선명도를 확보하는 실무 세팅 [S809, S810].
## 💻 코드 패턴 (Code patterns)
```python
# Python - Gemini 2.5 Flash Image API를 활용한 시네마토그래피 프롬프트 주입 예시
from vertexai.preview.vision_models import ImageGenerationModel
def generate_cinematic_asset(subject, scene_context):
model = ImageGenerationModel.from_pretrained("gemini-2.5-flash-image")
# [S1184, S1625, S1626, S1644] 기반 시네마틱 프롬프트 조립
# 카메라 사양 선제 배치 패턴 준수
cinematic_prompt = (
f"Cinematic wide shot, 35mm lens, {scene_context}. "
f"Subject: {subject}. "
"Lighting: Rembrandt lighting with deep chiaroscuro, volumetric fog. "
"Technical: 8k resolution, shot on full-frame DSLR, f/2.8, realistic skin pores."
)
response = model.generate_images(
prompt=cinematic_prompt,
number_of_images=1,
aspect_ratio="16:9"
)
return response
# 실행 예시: 1920년대 배경의 인물 대조 샷 생성
generate_cinematic_asset("an elegant woman in a pearl necklace", "Art Deco ballroom background")
```
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (물리적 카메라 메커니즘과 AI 렌더링 엔진 연산 원리 교차 검증)
- **출처 신뢰도:** S (Midjourney Docs, CodeSignal 기술 가이드, 전문 시네마틱 분석 포함)
- **신뢰 점수:** 0.98
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[프롬프트 엔지니어링]] — 텍스트 기반 시각 제어 기술의 모체
- [[확산 모델(Diffusion Model)]] — 시네마틱 지시어가 노이즈 제거 과정에 개입하는 물리 엔진
- [[이미지 prompt 생성 예시]] — 시네마토그래피 기법이 적용되는 실무 라이브러리
### 심층 후속 질문 (Deeper Research Questions)
- 섭동 어텐션 가이던스(PAG)가 조명의 반사광(Reflection)과 굴절률(Refraction)을 독립적으로 강화하는 연산 방식은 무엇인가? [S1644]
- 75토큰 청크 경계에서 'BREAK' 구문이 조명 가중치의 텐서 연속성을 물리적으로 어떻게 보존하는가? [S1631]
- 플로우 매칭(Flow Matching) 아키텍처가 네거티브 구문 없이도 시네마틱한 대비를 자연어만으로 구현하는 내부 기작은? [S1643]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** 고해상도 베이스 생성 패러다임(--hd)을 통한 드리프트 방지 [S1628].
- **System Design:** ComfyUI 기반 CSV 배치 처리로 일관된 촬영 톤의 스토리보드 양산 [S1642].
- **Operation / Maintenance:** Denoising Strength 0.5 임계값 제어를 통한 시네마틱 구도 보존 수정 [S1642].
### 인접 주변 주제
- [[ControlNet]] — 프롬프트를 넘어서는 기하학적 촬영 각도 강제 제어
- [[LoRA 미세 조정]] — 특정 영화 감독의 고유 화풍과 조명 톤을 모델 레벨에서 고정
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[이미지 prompt 생성 예시]]
- **관련 개념:** [[프롬프트 엔지니어링]], [[광학적 시각 제어]], [[필름 메커니즘]]
- **참조 맥락:** 고품질 영화적 비주얼 에셋 제작 및 AI 기반 영상 스토리보딩 설계 시 핵심 지침으로 참조됨.
## 📚 출처 (Sources)
- [S33] 25+ AI Prompts for Stunning Anime-Style Illustrations | The GBTI Network
- [S703] Camera + Lighting Prompt Cheatsheet for AI Images Guide
- [S705] Camera + Lighting Prompt Cheatsheet for AI Images Guide
- [S708] Camera + Lighting Prompt Cheatsheet for AI Images Guide
- [S710] Camera + Lighting Prompt Cheatsheet for AI Images Guide
- [S758] Cinematic AI Generator Prompts | Proxima Pictures
- [S759] Cinematic AI Generator Prompts | Proxima Pictures
- [S808] Elegant Woman and Rugged Man in Cinematic Noir — Z-Image Base AI Generator | Proxima Pictures
- [S809] Elegant Woman and Rugged Man in Cinematic Noir — Z-Image Base AI Generator | Proxima Pictures
- [S810] Elegant Woman and Rugged Man in Cinematic Noir — Z-Image Base AI Generator | Proxima Pictures
- [S1062] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1260] Runway Resources | AI Image Prompting Guide: 68 Ready-to-Use Prompts
- [S1509] The Best AI Prompts for Surrealism, Sci-Fi, and Abstract Art
- [S1622] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1625] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1626] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1628] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1631] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1638] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1639] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1642] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1643] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1644] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. High-density synthesis of technical optical control completed.
@@ -0,0 +1,191 @@
---
id: 이미지-prompt-생성-예시
title: "이미지 prompt 생성 예시"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["Image Prompt Examples", "AI 이미지 프롬프트 예시", "Prompt Engineering Examples", "프롬프트 구조화 예시", "AI Art Prompts", "이미지 생성 명령어 예시"]
duplicate_of: ""
source_trust_level: "A"
confidence_score: 0.95
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "이미지 prompt 생성 예시", "prompt engineering"]
raw_sources: ["#10: Prompt Generator 사이트 추천 - 메일리", "25+ AI Prompts for Stunning Anime-Style Illustrations | The GBTI Network", "3D Character Emergence Prompt: Sketchbook to Life Art - Big ...", "50 Best AI Image Prompts for AI Image Generators — OpenArt Blog", "8 Components of Great AI Art Prompts | Microsoft Copilot", "AI Art Prompts: 5 Examples + Guide to Creating Them - Meta AI", "AI Image Prompts: Image Prompting Guide With Examples | LTX Blog", "Abstract Art AI Generator Prompts - Proxima Pictures", "Anime Art Style Prompts for AI Image Generators: 8 Styles I Tested - SpacePrompts", "Anime prompts: 30 AI ideas for characters, scenes, styles, and video - Picsart", "Best AI Image Generators of 2026 - CNET", "Best Abstract Art & Backgrounds Prompts for AI Image Generation | Promptomania", "Best Anime & Manga Art Prompts for AI Image Generation | Promptomania", "Camera + Lighting Prompt Cheatsheet for AI Images Guide", "DALL·E 3 Prompts for Blog Images: Consistent Styles, Quality, and Workflow - Data Studios", "Elegant Woman and Rugged Man in Cinematic Noir — Z-Image Base AI Generator | Proxima Pictures", "How to Use DALL-E 3: Tips, Examples, and Features | DataCamp", "Master DALL-E 3: Complete Guide with Expert Prompt Examples - HBLAB GROUP", "Midjourney Prompt Guide 2026: Structure and Parameters", "Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog", "Negative Prompts Explained: What They Are, How They Work, and ...", "Parameter List - Midjourney Docs", "Photography Modifiers in AI-Generated Images | CodeSignal Learn", "Prompt Basics - Midjourney Docs", "Prompt weighting - AI Image Generator API - Flux/Stable Diffusion - Dezgo", "Renovation Transformation Prompt: Two-Stage Structural Accuracy", "Stable Diffusion Prompt Guide", "Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy", "The 8 best AI image generators in 2026 - Zapier", "The Best 25 Midjourney Prompts for Lighting - OpenArt", "The Best AI Prompts for Surrealism, Sci-Fi, and Abstract Art", "Where can i find good prompts which can be used to generate images as i want. Are there any resources or something for that? - Reddit", "Z-Image Base AI Prompts — Text-to-Image Gallery | Proxima Pictures", "[13기 물결] 미드저니 프롬프트 생성기 공유 - 지피터스", "[Midjourney] Midjourney 사용방법③ - AIPRM을 이용한 프롬프트 만들기", "생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시"]
applied_in: ["Midjourney V8.1", "Stable Diffusion 1.5/XL/3.5", "DALL-E 3", "FLUX.1", "Nano Banana Pro (Gemini 3)"]
github_commit: ""
---
# [[이미지 prompt 생성 예시]]
## 🎯 한 줄 통찰 (One-line insight)
정교하게 설계된 프롬프트 구조(피사체-스타일-구도-조명-기술사양)는 AI 이미지 모델의 확률적 무작위성을 통제하고 창작자의 의도를 물리적 실재 수준으로 구체화하는 핵심 앵커이다 [S1623].
## 🧠 핵심 개념 (Core concepts)
- **표준 프롬프트 수식 (Standard Formula):** 피사체(Subject) + 비주얼 스타일(Style) + 구도(Composition) + 조명(Lighting) + 색상 팔레트(Color) + 기술적 사양(Technical)의 계층적 조합 [S83, S229, S1623].
- **모델 도메인 최적화:** 모델별 아키텍처 특성(예: DALL-E의 자연어 이해, SD의 정밀 제어, MJ의 예술적 화풍)에 따른 프롬프트 전략 수립 [S1061, S1625].
- **사진학적 수치 모사:** 렌즈 초점거리(85mm, 35mm), 조리개(f/8), ISO 등 실제 카메라 메커니즘을 텍스트 토큰으로 인코딩하여 사실성 확보 [S1182, S1626].
- **가중치 및 매개변수 제어:** 구문 가중치(Weighting), 네거티브 프롬프트, 모델 고유 파라미터(Chaos, Stylize 등)를 통한 세부 튜닝 [S1336, S1628, S1630].
## 🧩 추출된 패턴 (Extracted patterns)
- **Lead with Camera:** 피사체 묘사보다 카메라 구도("Wide shot", "Low angle")를 프롬프트 서두에 우선 배치하여 전체 레이아웃의 원근감을 선제 할당함 [S1063, S1643].
- **Dual-Layer Consistency:** 캐릭터를 "2D 연필 스케치"와 "3D 일러스트"로 동시에 정의하여 차원을 넘나드는 물리적 일관성을 유지함 [S58, S61, S1636].
- **Geometric Invariance Logic:** 비포-애프터 변환 시 천장 높이, 창문 위치 등을 "INPUT REQUIREMENT: Do NOT change" 블록으로 강제 고정하여 공간 왜곡 방지 [S1224, S1640].
- **Iterative Refinement:** 단순 명사로 시작해 결과를 평가하며 점진적으로 구체적 형용사와 기술 사양을 얹는 반복 정제 파이프라인 [S206, S233, S1624].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Option) | 장점 | 단점 | 언제 선택 |
|---|---|---|---|
| **Midjourney V8.1** | 압도적인 시네마틱 화풍, 강력한 스타일/캐릭터 참조 기능 [S1057, S1625] | 폐쇄적 에코시스템, 높은 사용 비용 [S1057, S1625] | 예술적 영감, 고퀄리티 일회성 컨셉 아트 필요 시 [S1058, S1625] |
| **Stable Diffusion** | 로컬 설치 가능, LoRA/ControlNet을 통한 정밀한 물리 제어 [S1058, S1625] | 높은 하드웨어 사양 요구, 복잡한 설정법 [S1059, S1625] | 상업용 캐릭터 고정, 기술적 반복 작업 필요 시 [S1059, S1625] |
| **DALL-E 3** | 완벽한 자연어 문맥 이해, 이미지 내 텍스트 렌더링 우수 [S1060, S1625] | 엄격한 안전 필터, 세션 종료 시 일관성 유지 한계 [S1060, S1625] | 빠른 아이디어 시각화, 타이포그래피 포함 디자인 시 [S1061, S1625] |
| **FLUX.1** | 극단적인 프롬프트 지시 이행력, 자연스러운 리얼리즘 [S1118, S1625] | 네거티브 프롬프트 미지원으로 인한 역방향 제어 불가 [S1117, S1632] | 복잡한 묘사 충실도와 리얼리티가 핵심일 때 [S1625] |
## 📖 세부 내용 (Details)
### 1. 분야별 고밀도 프롬프트 예시 분석
- **상업용 럭셔리 제품:** "Luxury glass dropper bottle on white marble, high key photography, 50mm lens, f/8, diffused softbox lighting from camera-left" [S1633].
- 물리적 원리: 50mm 렌즈는 왜곡 없는 평면 구성을 보장하며, f/8 조리개는 제품 전체의 선명도를 확보함 [S1634].
- **3D 캐릭터 입체 연출:** "Young boy stepping out from sketchbook pages, torn paper edges, 3D hand grips the paper, warm depth of field" [S60, S1635].
- 물리적 원리: 'torn and jagged paper edges'와 같은 파괴 질감을 명세하여 2D와 3D 간의 기하학적 접점을 형성함 [S1636].
- **90년대 레트로 애니메이션:** "1990s retro anime screenshot, VHS color palette, cel-shaded, hand-painted watercolor background, light grain and scan lines" [S415, S675, S1639].
- 물리적 원리: 'VHS color palette'와 'scan lines'는 디지털 이미지를 아날로그 하드웨어 사양으로 강제 하향시켜 시대적 질감을 구현함 [S1640].
### 2. 정밀 광학 및 조명 제어 기술 [S1626-S1627]
- **인물용 85mm 렌즈:** f/1.4~f/2.2 설정으로 극도로 얕은 심도를 유도, 배경 보케(Bokeh)를 극대화하여 시선을 피사체에 고정 [S1626].
- **림 라이팅(Rim Lighting):** 피사체 배후에서 광원을 투사하여 머리카락과 어깨선에 날카로운 할로 효과(Halo effect) 형성, 배경과의 명확한 분리 [S709, S1627].
- **렘브란트 조명:** 측면 상단 광원으로 뺨 부분에 삼각형 빛 패치(Triangle cheek highlight)를 형성하여 드라마틱한 명암비 확보 [S711, S1627].
### 3. 플랫폼별 가중치 연산 수식 [S1630-S1631]
- **Stable Diffusion:**
- `(keyword:weight)`: 0.7~1.5 범위를 권장하며 1.8 이상 시 이미지 노이즈 폭발 [S1336, S1630].
- `BREAK`: 75토큰 단위의 청크를 강제 분할하여 서로 다른 영역의 색상이 섞이는 'Color Bleeding' 현상 방지 [S1338, S1631].
- **Midjourney:**
- `--stylize (0-1000)`: 모델 고유의 예술적 편향성 강도 조절 [S1003, S1628].
- `--chaos (0-100)`: 생성된 4장 이미지 간의 변이 다양성 결정 [S1004, S1628].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **네거티브 프롬프트의 불필요성:** 기존 Stable Diffusion 1.5에서는 긴 장문의 네거티브 구문이 필수였으나, 최신 FLUX.1 모델은 아키텍처상 이를 지원하지 않으며 오직 긍정형 문장으로만 모든 요소를 제어함 [S1117, S1130, S1632].
- **Midjourney 버전 표기:** 일부 자료에서는 V7을 최신으로 표기하나, 2026년 6월 기준 HD 이미지와 개선된 Describe 툴을 탑재한 V8.1이 최신 스테이블 버전임 [S1006].
## 🛠️ 적용 사례 (Applied in summary)
- **실제 프로젝트:** Burger King 프랑스의 할로윈 캠페인에서 AI 특유의 'unnaturalness'를 의도적으로 활용하여 호러 컨텐츠 제작 [S921, S966].
- **비즈니스 자동화:** batton Inc.에서 이미지 생성 AI를 랜딩 페이지 디자인에 자동화하여 배너 클릭률 1.8배 향상 [S923, S968].
- **파일 경로 및 커밋:** 소스 내 구체적인 Git 커밋 해시는 확인되지 않으나, Python 기반 Gemini 이미지 생성 API 구현 패턴이 기술됨 [S1183, S1644].
## 💻 코드 패턴 (Code patterns)
```python
# Python 3.x - Gemini Image Generation API 사용 예시
import PIL.Image
from vertexai.preview.vision_models import ImageGenerationModel
def generate_image(prompt_text, output_file):
# 모델 초기화 (소스에서 gemini-2.5-flash-image 사용 명시)
model = ImageGenerationModel.from_pretrained("gemini-2.5-flash-image")
# 프롬프트 예시: 인물 사진 (85mm, soft lighting)
# [S1184, S1195, S1644]
response = model.generate_images(
prompt=prompt_text,
number_of_images=1,
language="en",
aspect_ratio="16:9"
)
# 결과 저장
response.save(output_file)
# 실행 예시: DSLR 기계 메커니즘을 상세히 기술한 고해상도 프롬프트 주입
prompt = "Ultra-high-res portrait of a woman, shot on Canon EOS 5D Mark IV, 85mm f/1.4, ISO 100, softbox key light, realistic skin pores"
generate_image(prompt, "result.png")
```
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (실제 기업 적용 사례 및 물리적 렌더링 분석 근거 확보)
- **출처 신뢰도:** A (Midjourney/OpenAI 공식 문서 및 전문가용 렌더링 가이드 교차 검증)
- **신뢰 점수:** 0.95
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[프롬프트 엔지니어링]] — 텍스트 기반 AI 제어 기술의 모체
- [[확산 모델(Diffusion Model)]] — 이미지 생성의 근간이 되는 확률적 역방향 노이즈 제거 메커니즘
- [[시네마토그래피]] — AI 프롬프트에 이식되는 실제 촬영 기술의 표준
### 심층 후속 질문 (Deeper Research Questions)
- FLUX의 플로우 매칭 아키텍처가 네거티브 프롬프트 없이도 정교한 배제 제어를 수행하는 구체적인 수치 연산 원리는 무엇인가?
- 75토큰 청크 경계에서 가중치가 단절되는 문제를 해결하기 위한 'BREAK' 구문의 텐서 합산 메커니즘은 어떻게 작동하는가?
- Midjourney V8.1의 개인화 프로필(Personalization Profile)이 개별 사용자의 신경망 가중치를 어떻게 동적으로 재배합하는가?
- 이미지 내 텍스트 가독성을 극대화하기 위한 토큰 정렬 최적화 기법은 모델별로 어떻게 다른가?
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** 고밀도 기술 사양(렌즈, 조명)을 포함한 프롬프트 뱅크 구축 [S788, S1643].
- **System Design:** ComfyUI 기반 CSV 일괄 생성 파이프라인 설계 [S1064, S1644].
- **Operation / Maintenance:** Denoising Strength 임계값(0.5) 준수를 통한 이미지 부분 수정 일관성 관리 [S1562, S1644].
### 인접 주변 주제
- [[ControlNet]] — 프롬프트의 한계를 넘어서는 기하학적 형태 제어 확장
- [[LoRA 미세 조정]] — 특정 화풍이나 캐릭터를 모델 레벨에서 고정하는 기법
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[이미지 prompt 생성 예시]]
- **관련 개념:** [[프롬프트 엔지니어링]], [[확산 모델(Diffusion Model)]], [[광학적 시각 제어]]
- **참조 맥락:** 고품질 AI 이미지 에셋 제작 및 워크플로우 자동화 설계 시 참조됨.
## 📚 출처 (Sources)
- [S5] #10: Prompt Generator 사이트 추천 - 메일리
- [S16] Anime Art Style Prompts for AI Image Generators: 8 Styles I Tested - SpacePrompts
- [S35] How to Use DALL-E 3: Tips, Examples, and Features | DataCamp
- [S38] Midjourney Prompt Guide 2026: Structure and Parameters
- [S52] Renovation Transformation Prompt: Two-Stage Structural Accuracy
- [S56] 3D Character Emergence Prompt: Sketchbook to Life Art - Big ...
- [S58] Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy
- [S83] 50 Best AI Image Prompts for AI Image Generators — OpenArt Blog
- [S137] 50 Best AI Image Prompts for AI Image Generators — OpenArt Blog
- [S198] AI Art Prompts: 5 Examples + Guide to Creating Them - Meta AI
- [S229] AI Image Prompts: Image Prompting Guide With Examples | LTX Blog
- [S413] Anime prompts: 30 AI ideas for characters, scenes, styles, and video - Picsart
- [S415] Anime prompts: 30 AI ideas for characters, scenes, styles, and video - Picsart
- [S450] Anime prompts: 30 AI ideas for characters, scenes, styles, and video - Picsart
- [S705] Camera + Lighting Prompt Cheatsheet for AI Images Guide
- [S711] Camera + Lighting Prompt Cheatsheet for AI Images Guide
- [S781] DALL·E 3 Prompts for Blog Images: Consistent Styles, Quality, and Workflow - Data Studios
- [S870] How to Use DALL-E 3: Tips, Examples, and Features | DataCamp
- [S923] Master DALL-E 3: Complete Guide with Expert Prompt Examples - HBLAB GROUP
- [S1004] Midjourney Prompt Guide 2026: Structure and Parameters
- [S1061] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1063] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1111] Negative Prompts Explained: What They Are, How They Work, and ...
- [S1117] Negative Prompts Explained: What They Are, How They Work, and ...
- [S1130] Negative Prompts Explained: What They Are, How They Work, and ...
- [S1168] Parameter List - Midjourney Docs
- [S1184] Photography Modifiers in AI-Generated Images | CodeSignal Learn
- [S1224] Renovation Transformation Prompt: Two-Stage Structural Accuracy
- [S1305] Stable Diffusion Prompt Guide - YouTube
- [S1336] Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy
- [S1338] Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy
- [S1384] The 8 best AI image generators in 2026 - Zapier
- [S1623] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1625] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1626] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1627] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1628] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1630] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1631] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1632] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1633] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1635] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1636] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1639] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1640] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1643] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1644] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. High-density synthesis of 73 sources completed.
@@ -0,0 +1,178 @@
---
id: 프롬프트-엔지니어링
title: "프롬프트 엔지니어링"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["Prompt Engineering", "명령어 설계", "Image Prompting", "시각적 지시어 공학", "프롬프트 최적화", "Prompt Craft"]
duplicate_of: ""
source_trust_level: "S"
confidence_score: 0.98
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "이미지 prompt 생성 예시", "프롬프트 엔지니어링"]
raw_sources: ["#10: Prompt Generator 사이트 추천 - 메일리", "50 Best AI Image Prompts for AI Image Generators — OpenArt Blog", "8 Components of Great AI Art Prompts | Microsoft Copilot", "AI Art Prompts: 5 Examples + Guide to Creating Them - Meta AI", "AI Image Prompts: Image Prompting Guide With Examples | LTX Blog", "Anime Art Style Prompts for AI Image Generators: 8 Styles I Tested - SpacePrompts", "Anime prompts: 30 AI ideas for characters, scenes, styles, and video - Picsart", "Camera + Lighting Prompt Cheatsheet for AI Images Guide", "DALL·E 3 Prompts for Blog Images: Consistent Styles, Quality, and Workflow - Data Studios", "How to Use DALL-E 3: Tips, Examples, and Features | DataCamp", "Master DALL-E 3: Complete Guide with Expert Prompt Examples - HBLAB GROUP", "Midjourney Prompt Guide 2026: Structure and Parameters", "Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog", "Negative Prompts Explained: What They Are, How They Work, and ...", "Photography Modifiers in AI-Generated Images | CodeSignal Learn", "Renovation Transformation Prompt: Two-Stage Structural Accuracy", "Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy", "Stable Diffusion Prompt Guide - YouTube", "The 8 best AI image generators in 2026 - Zapier", "Where can i find good prompts which can be used to generate images as i want. Are there any resources or something for that? - Reddit", "생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시"]
applied_in: ["Midjourney V8.1", "Stable Diffusion XL/3.5", "DALL-E 3", "FLUX.1 Pro", "Nano Banana Pro"]
github_commit: ""
---
# [[프롬프트 엔지니어링]]
## 🎯 한 줄 통찰 (One-line insight)
프롬프트 엔지니어링은 인간의 추상적 의도를 AI가 물리적으로 해석 가능한 구조적 데이터(피사체-스타일-조명-광학 사양)로 번역하여, 생성의 무작위성을 통제된 예술적 생산으로 전환하는 정밀 언어 공학이다 [S224, S1623].
## 🧠 핵심 개념 (Core concepts)
- **표준 프롬프트 수식 (Formula):** [피사체] + [스타일] + [구도] + [조명] + [색상] + [기술 사양]의 계층적 조합을 통해 모델의 의미론적 모호성을 해소함 [S83, S229, S1623].
- **의미론적 구체성 (Specificity):** "큰(big)" 대신 "거대한(gigantic)"이나 "탑처럼 솟은(towering)"과 같은 구체적 동의어를 선택하여 디퓨전 노이즈 제어력을 높임 [S1202, S1624].
- **모델 아키텍처 최적화:** 자연어 이해가 뛰어난 DALL-E 3와 정밀 가중치 제어가 핵심인 Stable Diffusion 등 모델별 특성에 맞춘 지시어 최적화 [S1061, S1625].
- **반복적 정제 (Iterative Refinement):** 핵심 어휘로 시작해 생성 결과를 평가하고 디테일을 점진적으로 추가하여 시각적 왜곡을 방지하는 워크플로우 [S120, S1624].
## 🧩 추출된 패턴 (Extracted patterns)
- **카메라 우선 구조화 (Lead with Camera):** 피사체보다 카메라 구도("Wide shot", "Low angle")를 서두에 배치하여 전체 레이아웃의 원근감을 선제 할당함 [S1063, S1643].
- **긍정 묘사 원칙:** "케이크 없음"이라고 하면 케이크가 생성될 확률이 높으므로, 모델이 이해하기 쉬운 긍정형 문장으로 제외 요소를 우회함 [S1202, S1211, S1632].
- **기하학적 불변성 논리 (Geometric Invariance Logic):** 공간 변환 시 "INPUT REQUIREMENT: Do NOT change" 블록을 사용하여 창문 위치나 천장 높이의 왜곡을 방지함 [S1224, S1640].
- **75토큰 청크 관리:** Stable Diffusion의 75토큰 한계를 인지하고 `BREAK` 구문으로 색상 누출(Color Bleeding)을 방지함 [S1338, S1631].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Option) | 장점 | 단점 | 언제 선택 |
|---|---|---|---|
| **자연어 기반 (DALL-E 3)** | 대화하듯 수정 가능, 완벽한 문맥 이해 [S863, S1625] | 세부 파라미터 제어 한계, 세션 종료 시 망각 [S1060] | 빠른 아이디어 시각화 및 타이포그래피 필요 시 [S1625] |
| **파라미터 기반 (Midjourney)** | `--sref`, `--cref` 등 강력한 참조 기능 [S1000, S1628] | 폐쇄적 환경, 높은 기술적 숙련도 요함 [S1057] | 시네마틱한 미적 완성도와 일관성이 핵심일 때 [S1625] |
| **수치 가중치 기반 (Stable Diffusion)** | 단어별 가중치(`1.1`, `1.5`) 및 로컬 확장성 [S1336, S1630] | 설정 복잡도 높음, 하드웨어 의존적 [S1059] | 특정 캐릭터 고정 및 물리적 정밀 제어 필요 시 [S1625] |
| **플로우 매칭 (FLUX.1)** | 극단적인 지시 이행력, 고도의 리얼리즘 [S1118, S1625] | 네거티브 프롬프트 미지원 [S1117, S1632] | 복잡한 묘사 충실도가 최우선인 제작 시 [S1625] |
## 📖 세부 내용 (Details)
### 1. 광학적 제어 및 사진학적 이식 [S1182, S1626]
- **초점거리 수치 모사:** 85mm(인물 왜곡 제거 및 보케), 50mm(제품 촬영 및 무왜곡 평면), 24mm(광활한 풍경 및 투시 강조) 등 실제 렌즈 메커니즘을 텍스트 토큰으로 인코딩하여 사실성을 확보함 [S1626].
- **조명 기법 정밀화:** `Softbox`는 피부 질감을 부드럽게 정돈하고, `Rim lighting`은 피사체 뒤에서 빛을 쏘아 배경과 분리하며, `Rembrandt`는 드라마틱한 명암비와 뺨의 삼각형 하이라이트를 생성함 [S1627].
### 2. 구문 가중치 연산 메커니즘 [S1336, S1630]
- **수치 멀티플라이어:** `(keyword:1.5)` 형식을 통해 해당 속성의 투사 비율을 선형적으로 조정하며, 안전 대역인 `0.7~1.5`를 준수해야 함 [S1336, S1630].
- **괄호 중첩:** 괄호 하나당 `1.1배`씩 가중치가 증폭되며, 3단계 중첩(`(((keyword)))`) 초과 시 렌더링이 깨질 위험이 큼 [S1336, S1630].
### 3. 네거티브 프롬프트와 사후 통제 [S1111, S1631]
- **역방향 예측 연산:** 모델이 생성하지 말아야 할 요소(extra fingers, blurry)를 명시하여 시각적 결함을 배제하는 필터로 작동함 [S1111, S1631].
- **모델별 차이:** Stable Diffusion 1.5에서는 장문의 네거티브 구문이 필수적이나, SD 3.5나 FLUX.1 같은 최신 아키텍처는 이를 최소화하거나 미지원함 [S1117, S1632].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **네거티브 프롬프트의 소멸:** 과거에는 모든 모델에 필수였으나, 최신 **FLUX.1** 모델은 아키텍처상 네거티브 구문을 완전히 무시하며 오직 긍정형 문장으로만 제어 가능함 [S1117, S1632].
- **가중치 임계값:** 가중치를 높일수록 강조된다는 보편적 인식과 달리, `1.8~2.0`을 초과하면 디퓨전 노이즈가 폭발하여 이미지가 뭉개지는 물리적 한계가 존재함 [S1340, S1630].
## 🛠️ 적용 사례 (Applied in summary)
- **비즈니스 자동화:** batton Inc.에서 랜딩 페이지 배너 디자인에 프롬프트 엔지니어링을 적용하여 클릭률을 1.8배 향상시킴 [S923, S968].
- **브랜드 마케팅:** Burger King 프랑스는 AI의 'unnaturalness'를 의도적으로 유도하는 프롬프트를 설계하여 할로윈 호러 컨텐츠를 제작함 [S921, S966].
- **Midjourney V8.1:** 사용자의 과거 선택 데이터를 기반으로 스타일 생략 시에도 개인의 성향을 자동 배합하는 '개인화 프로필' 기능이 통합됨 [S1006, S1629].
## 💻 코드 패턴 (Code patterns)
```python
# Python 3.x - Gemini Image Generation API (Photography Modifiers 적용)
from vertexai.preview.vision_models import ImageGenerationModel
def generate_engineered_image(subject, camera_lens, lighting):
model = ImageGenerationModel.from_pretrained("gemini-2.5-flash-image")
# 5단계 포뮬러 기반 프롬프트 조립 패턴 [S1184, S1623, S1644]
prompt = (
f"Ultra-high-res portrait of {subject}, shot on full-frame DSLR, "
f"{camera_lens}, {lighting}, realistic skin pores, "
"dramatic cinematic atmosphere, 8k resolution"
)
response = model.generate_images(
prompt=prompt,
number_of_images=1,
aspect_ratio="16:9"
)
return response
# 실행 예시: 85mm 렌즈와 렘브란트 조명을 명시한 고밀도 프롬프트 주입
# [S1626, S1627]
generate_engineered_image("an elderly fisherman", "85mm f/1.4", "Rembrandt lighting")
```
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (실무 산업군 적용 사례 및 물리적 렌더링 분석 완료)
- **출처 신뢰도:** S (Midjourney, OpenAI 공식 문서 및 학술적 Markdown 분석 기반)
- **신뢰 점수:** 0.98
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[확산 모델(Diffusion Model)]] — 프롬프트 엔진이 개입하는 확률적 노이즈 제거 메커니즘 [S1623]
- [[광학적 시각 제어]] — 카메라와 조명 언어를 통한 이미지 질감 통제 기술 [S1626]
- [[시네마토그래피]] — AI 프롬프트에 이식되는 전문 촬영 예술의 표준 사양 [S1627]
### 심층 후속 질문 (Deeper Research Questions)
- FLUX 모델의 플로우 매칭(Flow Matching) 아키텍처가 긍정 지시문만으로 배제 제어를 수행하는 구체적인 수치 연산 원리는 무엇인가? [S1645]
- 75토큰 청크 경계면에서 가중치 텐서가 단절되는 현상을 수학적으로 보정할 수 있는 `BREAK` 이외의 대안적 임베딩 기법이 존재하는가? [S1631]
- Midjourney V8.1의 '섭동 어텐션 가이던스(PAG)'가 렌더링 정확도를 향상시키는 구조적 방식은 무엇인가? [S1646]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** 고밀도 기술 사양(f-stop, ISO)을 포함한 프롬프트 라이브러리 구축 [S705, S1643].
- **System Design:** ComfyUI 기반의 CSV 일괄 생성 파이프라인 설계를 통한 에셋 양산 [S1064, S1644].
- **Operation / Maintenance:** Denoising Strength 임계값(`0.5`)을 고정하여 이미지 부분 수정 시 일관성 유지 [S1533, S1644].
### 인접 주변 주제
- [[ControlNet]] — 프롬프트를 넘어서는 기하학적 형태 제어 기법 [S1058]
- [[LoRA 미세 조정]] — 특정 스타일이나 캐릭터를 모델 가중치 레벨에서 고정하는 방식 [S1058]
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[이미지 prompt 생성 예시]]
- **관련 개념:** [[확산 모델(Diffusion Model)]], [[광학적 시각 제어]], [[기하학적 불변성 논리]]
- **참조 맥락:** 고품질 이미지 에셋 제작 공정 및 생성형 AI 워크플로우 설계 시 핵심 지침으로 참조됨.
## 📚 출처 (Sources)
- [S3] Midjourney Prompt Guide 2026: Structure and Parameters
- [S5] AI Image Prompts: Image Prompting Guide With Examples | LTX Blog
- [S9] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S12] 50 Best AI Image Prompts for AI Image Generators — OpenArt Blog
- [S83] 50 Best AI Image Prompts for AI Image Generators — OpenArt Blog
- [S121] 50 Best AI Image Prompts for AI Image Generators — OpenArt Blog
- [S197] AI Art Prompts: 5 Examples + Guide to Creating Them - Meta AI
- [S224] AI Image Prompts: Image Prompting Guide With Examples | LTX Blog
- [S229] AI Image Prompts: Image Prompting Guide With Examples | LTX Blog
- [S705] Camera + Lighting Prompt Cheatsheet for AI Images Guide
- [S863] How to Use DALL-E 3: Tips, Examples, and Features | DataCamp
- [S921] Master DALL-E 3: Complete Guide with Expert Prompt Examples - HBLAB GROUP
- [S923] Master DALL-E 3: Complete Guide with Expert Prompt Examples - HBLAB GROUP
- [S999] Midjourney Prompt Guide 2026: Structure and Parameters
- [S1000] Midjourney Prompt Guide 2026: Structure and Parameters
- [S1033] Midjourney Prompt Guide 2026: Structure and Parameters
- [S1057] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1061] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1063] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S1111] Negative Prompts Explained: What They Are, How They Work, and ...
- [S1117] Negative Prompts Explained: What They Are, How They Work, and ...
- [S1118] Negative Prompts Explained: What They Are, How They Work, and ...
- [S1182] Photography Modifiers in AI-Generated Images | CodeSignal Learn
- [S1202] Prompt Basics - Midjourney Docs
- [S1211] Prompt Basics - Midjourney Docs
- [S1224] Renovation Transformation Prompt: Two-Stage Structural Accuracy
- [S1336] Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy
- [S1338] Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy
- [S1340] Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy
- [S1483] The Best 25 Midjourney Prompts for Lighting - OpenArt
- [S1533] Where can i find good prompts which can be used to generate images as i want. Are there any resources or something for that? - Reddit
- [S1623] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1625] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1626] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1627] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1628] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1629] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1630] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1631] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1632] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1643] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1644] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1645] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1646] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. High-density synthesis of model-specific mechanisms completed.
@@ -0,0 +1,180 @@
---
id: 확산-모델(diffusion-model)
title: "확산 모델(Diffusion Model)"
category: "AI_and_ML"
status: "draft"
verification_status: "conceptual"
canonical_id: ""
aliases: ["Diffusion Model", "디퓨전 모델", "역방향 노이즈 제거 모델", "확산 생성 모델", "CFG 메커니즘", "Flow Matching"]
duplicate_of: ""
source_trust_level: "S"
confidence_score: 0.98
created_at: 2026-06-26
updated_at: 2026-06-26
review_reason: ""
merge_history: []
tags: ["research", "이미지 prompt 생성 예시", "확산 모델"]
raw_sources: ["생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시", "The 8 best AI image generators in 2026 - Zapier", "Negative Prompts Explained: What They Are, How They Work, and ...", "Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy", "Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog", "Master DALL-E 3: Complete Guide with Expert Prompt Examples - HBLAB GROUP"]
applied_in: ["Stable Diffusion 1.5/XL/3.5", "Midjourney V8.1", "DALL-E 3", "FLUX.1 (Flow Matching variant)"]
github_commit: ""
---
# [[확산 모델(Diffusion Model)]]
## 🎯 한 줄 통찰 (One-line insight)
확산 모델은 무작위 노이즈에서 시작하여 프롬프트라는 의미론적 앵커를 따라 시각적 질서를 단계적으로 복원해나가는 반복적 역방향 연산 체계이다 [S1374, S1622].
## 🧠 핵심 개념 (Core concepts)
- **역방향 노이즈 제거 (Denoising):** 완전한 무작위 노이즈 필드에서 시작하여, 프롬프트에 대한 모델의 이해도에 맞춰 여러 단계를 거치며 노이즈를 제거해 이미지를 렌더링하는 핵심 기법 [S1374].
- **교차 주의 집중 (Cross-Attention):** 텍스트 인코더가 단어를 다차원 임베딩 벡터로 변환하고, 이를 확산 과정에 개입시켜 시각적 결과물과 언어적 지시를 결합하는 연산 메커니즘 [S1622].
- **분류기 없는 가이던스 (Classifier-Free Guidance, CFG):** 긍정 프롬프트 기반 예측과 부정(혹은 빈) 프롬프트 기반 예측을 비교하여, 최종 결과물을 긍정 방향으로 밀어내고 부정 요소로부터 멀어지게 조율하는 제어판 [S1112].
- **75토큰 청크 (75-Token Chunk):** CLIP 아키텍처의 한계로 인해 프롬프트를 75개 토큰 단위로 분할하여 독립된 텐서로 처리하는 구조적 임계점 [S1337, S1631].
## 🧩 추출된 패턴 (Extracted patterns)
- **단계적 구체화 패턴:** 초기 노이즈에서 주 피사체의 윤곽을 먼저 잡고, 이후 단계를 거치며 조명, 질감, 기술적 사양을 얹는 물리적 생성 파이프라인 [S1622, S1623].
- **기하학적 불변성 유지:** 프롬프트 최상단에 "Do NOT change" 블록을 배치하거나 이미지 가중치(--iw 2.0)를 높여 확산 과정 중의 공간적 상상력을 억제하고 원본 지오메트리를 고정함 [S1223, S1640].
- **네거티브 필터링:** 역방향 예측 연산을 통해 형태 왜곡(Disfigured)이나 원치 않는 요소(Bad anatomy)를 생성 공정에서 원천 배제함 [S1111, S1631].
## ⚖️ 비교 및 선택 기준 (Comparison & decision criteria)
| 항목 (Option) | 생성 방식 | 특징 | 장점 |
|---|---|---|---|
| **표준 확산 모델** (SD 1.5/XL) | 단계적 노이즈 제거 | CFG를 통한 정밀 제어 [S1112] | 오픈소스 생태계, 높은 제어력 [S1624] |
| **플로우 매칭** (FLUX.1) | Flow Matching (MMDiT) | 네거티브 프롬프트 미지원 [S1117] | 극단적인 지시 이행력 및 리얼리즘 [S1624] |
| **자기회귀 모델** (GPT Image 2) | Autoregression | 이미지 조각을 순차 예측 [S1375] | 완벽한 자연어 문맥 이해 [S1381, S1624] |
## 📖 세부 내용 (Details)
### 1. 프롬프트 임베딩과 시각적 합성 메커니즘 [S1622]
- 텍스트 인코더(CLIP, T5-XXL 등)는 인간의 언어를 모델이 이해할 수 있는 **다차원 벡터**로 변환한다 [S1622, S1625].
- 이 벡터 데이터는 확산 모델의 **UNet** 구조 내부에서 교차 주의 집중 연산을 통해 노이즈 제거 과정에 물리적 앵커로 주입된다 [S1622, S1624].
- 구체적인 명사("세 마리의 벵갈 고양이")를 사용하면 모델의 의미론적 모호성을 해소하여 노이즈 제어력을 높일 수 있다 [S1622].
### 2. 가중치 연산과 CFG 스케일 제어 [S1112, S1630]
- **CFG 스케일:** 수치가 높을수록 프롬프트에 엄격히 부합하려 하나 너무 높으면 이미지가 과포화(Crispy)되고, 낮으면 창의성이 증가하지만 지시를 무시한다 [S1112].
- **수치 멀티플라이어:** `(keyword:1.5)`와 같은 표기는 해당 속성이 이미지에 투사되는 비중을 선형적으로 높이며, 안전 범위는 보통 **0.7 ~ 1.5** 사이이다 [S1630].
- **BREAK 구문:** 75토큰 경계에서 가중치 작용이 단절되는 것을 방지하고 색상 누출(Color Bleeding)을 차단하기 위해 강제로 청크를 분리한다 [S1337, S1631].
### 3. 모델 아키텍처의 진화와 특성 [S1624-S1625]
- **Stable Diffusion 3.5:** Triple Text Encoder와 MMDiT(Multimodal Diffusion Transformer) 기술을 사용하여 복잡한 다중 피사체 구도와 자연어 텍스트 구현력을 강화했다 [S1624].
- **FLUX.1:** 전통적인 디퓨전 대신 플로우 매칭 아키텍처를 채택하여 네거티브 구문 없이 오직 긍정형 문장만으로도 극사실적인 렌더링이 가능하다 [S1117, S1632].
## ⚖️ 모순 및 업데이트 (Contradictions & updates)
- **네거티브 프롬프트의 가용성:** Stable Diffusion 계열에서는 네거티브 프롬프트가 이미지 품질 향상의 필수 요소이나, 최신 모델인 **FLUX.1**은 아키텍처상 이를 지원하지 않으므로 긍정 묘사로만 제어해야 한다 [S1117, S1632].
- **고해상도 생성 방식:** 과거에는 낮은 해상도 생성 후 업스케일을 진행했으나, **Midjourney V8.1** 등 최신 엔진은 노이즈 생성 단계 초기부터 직접 2K 고화질로 렌더링하여 구조적 드리프트를 방지한다 [S1628, S1629].
## 🛠️ 적용 사례 (Applied in summary)
- **영화 스토리보딩:** Midjourney와 Stable Diffusion을 활용해 조명, 렌즈, 배치를 사전에 시각화하여 제작 효율성을 높임 [S1054, S1642].
- **상업 광고:** Burger King 프랑스 캠페인에서 AI 특유의 '비현실성'을 의도적으로 활용하여 호러 컨텐츠를 제작한 사례 [S921, S966].
- **실시간 렌더링:** KREA AI의 'Screen-to-Image' 연동을 통해 스케치업 모델링 변화를 실시간으로 확산 모델 결과물로 출력 [S1643].
## 💻 코드 패턴 (Code patterns)
```python
# Python - Gemini 2.5 Flash Image (확산 기반 고해상도 생성 모델) API 활용 [S1183, S1644]
from vertexai.preview.vision_models import ImageGenerationModel
def generate_diffusion_image(prompt_text):
# 모델 초기화 (소스에서 강력한 편집성과 사실성을 갖춘 모델로 명시됨)
model = ImageGenerationModel.from_pretrained("gemini-2.5-flash-image")
# 프롬프트 조립 패턴: 피사체 + 스타일 + 조명 + 기술 사양 [S1622]
# 사실적인 질감을 위해 DSLR 메커니즘을 텍스트로 인코딩 [S1627]
refined_prompt = (
f"{prompt_text}, cinematic style, 85mm f/1.4 lens, "
"softbox lighting, realistic skin pores, high dynamic range"
)
response = model.generate_images(
prompt=refined_prompt,
number_of_images=1,
aspect_ratio="16:9"
)
return response
# 실행 예시: 인물 사진 생성 시 광학 제어 수치 주입
generate_diffusion_image("A portrait of an elderly watchmaker")
```
## ✅ 검증 상태 및 신뢰도
- **상태:** draft
- **검증 단계:** conceptual (주요 모델 제작사의 공식 가이드 및 렌더링 메커니즘 분석 기반)
- **출처 신뢰도:** S (기술적 가이드와 실무 최적화 방법론이 교차 검증된 소스)
- **신뢰 점수:** 0.98
- **중복 검사 결과:** 신규 생성 (New discovery)
## 🔗 관련 문서 링크 (Related document links)
### 상위/유사 개념
- [[프롬프트 엔지니어링]] — 확산 모델을 제어하기 위한 언어적 입력 공학 [S1622]
- [[광학적 시각 제어]] — 물리적 카메라 사양을 모델에 이식하는 기술 [S1626]
- [[시네마토그래피]] — AI 생성물의 미적 완성도를 높이는 실사 촬영 표준 [S1627]
### 심층 후속 질문 (Deeper Research Questions)
- FLUX의 플로우 매칭(Flow Matching) 아키텍처가 수학적으로 전통적인 노이즈 역방향 제거와 구별되는 지점은 무엇인가? [S1644]
- 75토큰 청크 단위의 분할이 UNet의 어텐션 레이어 가중치 분포에 미치는 비선형적 영향은 어떻게 계산되는가? [S1631]
- 섭동 어텐션 가이던스(PAG)가 노이즈 제거 과정에서 특정 시각 레이어의 해상도를 독립적으로 강화하는 방식은 무엇인가? [S1645]
### 실무 적용 맥락 (Practical Application Contexts)
- **Implementation:** 가중치 안전 대역(0.7~1.5) 준수를 통한 이미지 일관성 확보 [S1630].
- **System Design:** ComfyUI 기반 CSV 배치 처리로 대량의 시나리오 보드 자동 양산 [S1642].
- **Operation / Maintenance:** Denoising Strength 임계점(0.5) 제어를 통한 이미지 부분 수정(Inpainting) 품질 관리 [S1643].
### 인접 주변 주제
- [[ControlNet]] — 확산 과정에 기하학적 형태 가이드를 추가하는 기술 [S1058]
- [[LoRA 미세 조정]] — 특정 데이터셋의 가중치를 주입하여 화풍을 고정하는 기법 [S1058]
## 🔗 지식 그래프 (Knowledge Graph)
- **상위/루트:** [[이미지 prompt 생성 예시]]
- **관련 개념:** [[프롬프트 엔지니어링]], [[역방향 노이즈 제거]], [[가중치 연산]]
- **참조 맥락:** 고품질 생성 AI 결과물 도출을 위한 엔진 레벨의 제어 원리로 참조됨.
## 📚 출처 (Sources)
- [S1] Stable Diffusion Prompt Weights: The Syntax Guide | QWE AI Academy
- [S2] Negative Prompts Explained: What They Are, How They Work, and ...
- [S3] Midjourney Prompt Guide 2026: Structure and Parameters
- [S6] Midjourney Prompt Guide 2026: Structure and Parameters
- [S8] 25+ AI Prompts for Stunning Anime-Style Illustrations | The GBTI Network
- [S9] Midjourney vs. Stable Diffusion vs. DALL·E 3 for Storyboarding | Prescene Blog
- [S10] Best AI Image Generators of 2026 - CNET
- [S11] The 8 best AI image generators in 2026 - Zapier
- [S12] 50 Best AI Image Prompts for AI Image Generators — OpenArt Blog
- [S13] Midjourney V6 Parameters Guide | PDF - Scribd
- [S14] Parameter List - Midjourney Docs
- [S15] How to Prompt FLUX. The BEST ways for prompting FLUX.1 - YouTube
- [S16] Master DALL-E 3: Complete Guide with Expert Prompt Examples - HBLAB GROUP
- [S17] Where can i find good prompts which can be used... - Reddit
- [S18] Photography Modifiers in AI-Generated Images | CodeSignal Learn
- [S19] Camera + Lighting Prompt Cheatsheet for AI Images Guide
- [S20] The Best 25 Midjourney Prompts for Lighting - OpenArt
- [S21] #10: Prompt Generator 사이트 추천 - 메일리
- [S22] Stable Diffusion prompt: a definitive guide
- [S23] [Midjourney] Midjourney 사용방법③ - AIPRM을 이용한 프롬프트 만들기
- [S24] 3D Character Emergence Prompt: Sketchbook to Life Art - Big ...
- [S25] Elegant Woman and Rugged Man in Cinematic Noir - Proxima Pictures
- [S26] Cinematic AI Generator Prompts | Proxima Pictures
- [S27] Best Anime & Manga Art Prompts | Promptomania
- [S28] Anime prompts: 30 AI ideas for characters, scenes... - Picsart
- [S29] Renovation Transformation Prompt: Two-Stage Structural Accuracy
- [S30] Best Abstract Art & Backgrounds Prompts | Promptomania
- [S31] Abstract Art AI Generator Prompts - Proxima Pictures
- [S33] Stable Diffusion Prompt Guide - YouTube
- [S1374] The 8 best AI image generators in 2026 - Zapier
- [S1375] The 8 best AI image generators in 2026 - Zapier
- [S1622] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1623] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1624] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1625] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1626] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1627] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1628] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1629] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1630] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1631] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1632] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1640] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1642] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1643] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
- [S1644] 생성형 이미지 모델의 프롬프트 엔지니어링 메커니즘과 도메인별 최적화 및 실무 예시 (Markdown)
## 📝 변경 이력 (Change history)
- 2026-06-26: Initial draft generated via Datacollector_MAC P-Reinforce engine. High-density synthesis of technical diffusion mechanics completed.
@@ -0,0 +1,24 @@
# 핸드폰에 붙이는 필름을 판매하고 있어. 기능은 3d 앱을 사용하면 화면을 3d 화면으로 입
> 1인 기업 모드 Intent Alignment 에서 사용자가 직접 제공한 정보. (2026-06-26)
## 원본 요청
핸드폰에 붙이는 필름을 판매하고 있어.
기능은 3d 앱을 사용하면 화면을 3d 화면으로 입체감을 잘 보이게 하는 기능이 있어. 단점으로는 3d 로 보이게 하는 필름이다 보니 일반 상태에서 화면을 보면 화면에 미세한 줄들이 보여서 예민한 사람들은 픽셀이 깨져 보이는 듯한 느낌을 받을 수 있어.
지원 기기는 아이폰 15, 16, 17만 지원을 하고 있고 안드로이드는 지원을 하지 않는 약점이 있어.
구매자 기록을 보니 35세 이상.
물론 판매는 많이 안되었어.
서비스 제공은
1. 내 로컬 모바일 장비에 있는 영상을 3d 입체감으로 보여주는 기능.
2. 내 로컬 모바일 장비에 있는 사진을 3d 입체감을 보여주는 기능.
3. 우리 회사에서 제공하는 영상을 볼 수 있어. (뮤직 비디오)
-- 문제는 우리가 제공하는 콘텐츠의 수량으 매우 빈약해.
이런 상황인데 어떻게 마케팅을 해야. 제고 5만개를 판매 할 수 있을까?
마케팅할 돈도 매우 빈약해.
## 확인된 정보
### Q. 현재 확보된 마케팅 예산의 구체적인 범위(예: 월 100만 원 미만 등)는 어느 정도인가요? / 판매 중인 필름의 현재 판매 가격대와 마진율은 어떻게 되나요? (수익성 기반 전략 수로를 위해 필요)
필름 가격은 4만원이야. 마케팅 예산은 2억 정도 있지만.. 2억 없이 홍보 할 수 있는 방법에 대한 아이디어가 필요해. 차라리 물건을 무료로 일부를 뿌린다거나..