-
Notifications
You must be signed in to change notification settings - Fork 0
LLM 전략
MinJun Choi edited this page Jul 12, 2026
·
1 revision
감정 캐릭터 6종을 어떻게 생성할지(아키텍처)와 어떤 모델을 쓸지(선정) 정리합니다. 전제: 무료 서비스 · 대규모 사용자 · 저토큰 우선 · 품질/톤 유지.
단일 LLM 호출 + 멀티 페르소나 프롬프팅 (확정)
- 캐릭터별로 개별 호출하지 않고, 하나의 LLM 호출에 6개 감정 페르소나를 함께 프롬프팅
- 응답은 구조화 출력(JSON) 으로 받음 — 예:
{ 참여캐릭터: [{ name, message }] }
| 기준 | 단일 호출 | 캐릭터별 개별 호출 |
|---|---|---|
| 토큰 / 비용 | 1회 + 시스템 프롬프트 캐싱 | ~6배 호출 · 컨텍스트 반복 |
| 캐릭터 간 대댓글 | 한 응답에서 자연스럽게 상호작용 | 서로 못 봄 → 오케스트레이션 필요 |
| 무료·대규모 적합성 | ✅ | ❌ (비용·레이트리밋 부담) |
- 단일 호출이 메시지 배열을 반환 → 클라이언트가 순차 등장(타이핑 인디케이터)으로 연출
- 스트리밍으로 첫 메시지를 빠르게 노출 → 생성이 2~3초 걸려도 체감 지연이 낮음
- 구조화 출력(JSON 스키마) — 형식 붕괴·헛소리 방지
- 시스템 프롬프트 = 캐릭터 바이블 + few-shot → 프롬프트 캐싱으로 반복 비용 절감
- 참여 캐릭터 사전 선별 — 온디바이스 감정 판별로 등장 캐릭터를 정해 넘겨 모델 부담·토큰 감소
- eval 셋으로 6캐릭터 한국어 말투 일관성 검증
| 모델 | 입력 | 출력 | 메모 |
|---|---|---|---|
| Gemini 2.5 Flash ⭐ | $0.30 | $2.50 | 기본 후보 (비용·속도·한국어 균형) |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | 최저가 — 품질 통과 시 채택 |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | |
| Gemini 3.5 Flash | $1.50 | $9.00 | 최신 Flash, 상대적 고가 |
| Claude Haiku 4.5 | $1.00 | $5.00 | 공감·위로 톤 강점 (톤 대안) |
| Claude Sonnet 5 | $3.00 | $15.00 | 품질 상위, 필요 시 승급 |
출력 = 여러 캐릭터의 짧은 메시지라 출력 단가가 비용을 좌우한다.
-
기본:
gemini-2.5-flash— 비용·속도·한국어 균형, 저리스크 -
비용 최적화:
gemini-2.5-flash-lite를 eval에서 비교 (통과 시 출력비 대폭 절감) -
톤 대안: 공감·위로 톤이 핵심 차별점이면
Claude Haiku 4.5를 eval 비교
감정 6캐릭터 한국어 eval 셋으로 (a) Flash vs Flash-Lite(비용), (b) vs Haiku(톤)을 비교해 최종 확정한다.