Skip to content

LLM 전략

MinJun Choi edited this page Jul 12, 2026 · 1 revision

🤖 LLM 전략

감정 캐릭터 6종을 어떻게 생성할지(아키텍처)와 어떤 모델을 쓸지(선정) 정리합니다. 전제: 무료 서비스 · 대규모 사용자 · 저토큰 우선 · 품질/톤 유지.


🏗️ 생성 아키텍처

단일 LLM 호출 + 멀티 페르소나 프롬프팅 (확정)

  • 캐릭터별로 개별 호출하지 않고, 하나의 LLM 호출에 6개 감정 페르소나를 함께 프롬프팅
  • 응답은 구조화 출력(JSON) 으로 받음 — 예: { 참여캐릭터: [{ name, message }] }

왜 단일 호출인가

기준 단일 호출 캐릭터별 개별 호출
토큰 / 비용 1회 + 시스템 프롬프트 캐싱 ~6배 호출 · 컨텍스트 반복
캐릭터 간 대댓글 한 응답에서 자연스럽게 상호작용 서로 못 봄 → 오케스트레이션 필요
무료·대규모 적합성 ❌ (비용·레이트리밋 부담)

💬 카톡 느낌 (실시간 대화)

  • 단일 호출이 메시지 배열을 반환 → 클라이언트가 순차 등장(타이핑 인디케이터)으로 연출
  • 스트리밍으로 첫 메시지를 빠르게 노출 → 생성이 2~3초 걸려도 체감 지연이 낮음

🛡️ 품질을 지키는 안전장치

  • 구조화 출력(JSON 스키마) — 형식 붕괴·헛소리 방지
  • 시스템 프롬프트 = 캐릭터 바이블 + few-shot프롬프트 캐싱으로 반복 비용 절감
  • 참여 캐릭터 사전 선별 — 온디바이스 감정 판별로 등장 캐릭터를 정해 넘겨 모델 부담·토큰 감소
  • eval 셋으로 6캐릭터 한국어 말투 일관성 검증

💰 모델 후보 비교 (1M 토큰당 · 2026-07)

모델 입력 출력 메모
Gemini 2.5 Flash $0.30 $2.50 기본 후보 (비용·속도·한국어 균형)
Gemini 2.5 Flash-Lite $0.10 $0.40 최저가 — 품질 통과 시 채택
Gemini 3.1 Flash-Lite $0.25 $1.50
Gemini 3.5 Flash $1.50 $9.00 최신 Flash, 상대적 고가
Claude Haiku 4.5 $1.00 $5.00 공감·위로 톤 강점 (톤 대안)
Claude Sonnet 5 $3.00 $15.00 품질 상위, 필요 시 승급

출력 = 여러 캐릭터의 짧은 메시지라 출력 단가가 비용을 좌우한다.


✅ 결정 방침

  1. 기본: gemini-2.5-flash — 비용·속도·한국어 균형, 저리스크
  2. 비용 최적화: gemini-2.5-flash-lite를 eval에서 비교 (통과 시 출력비 대폭 절감)
  3. 톤 대안: 공감·위로 톤이 핵심 차별점이면 Claude Haiku 4.5를 eval 비교

감정 6캐릭터 한국어 eval 셋으로 (a) Flash vs Flash-Lite(비용), (b) vs Haiku(톤)을 비교해 최종 확정한다.


🔗 관련 문서

Clone this wiki locally