스냅스 상담 챗봇 · 모델 교체 검토

GPT-4o 라우팅을 지금 바꾸면 무엇이 좋아지나

현행 GPT-4o mini / GPT-4o 난이도 라우팅과 2026년 8월 기준 최신 모델을 실제 한국어 상담 프롬프트로 호출해 비교했다. 결론부터: 응답이 0.6초 느려지는 대신 지능은 4.4배, 비용은 78% 줄일 수 있다.

결론

현행 조합을 GPT-5.6 Luna (low / medium) 라우팅으로 교체하는 것을 권장한다. 라우팅 구조는 그대로 두고 모델 ID만 바꾸면 된다.

월 비용 (10만 요청)
−78%
$35.12 → $7.61
지능 (AA Intelligence Index)
4.4배
6.7 / 11.1 → 33.9 / 38.9
평균 응답시간
+0.6초
1.73초 → 2.31초 (가중)
교체 난이도
모델 ID만
라우팅 로직 변경 불필요

1. 현행 진단 — 빠르지만, 지능이 두 세대 뒤처졌다

속도는 문제가 아니다. 문제는 지능 대비 가격이다.

GPT-4o와 4o-mini는 실측 평균 1.6~1.8초로 여전히 빠르다. 상담 챗봇의 실시간성 요건은 충분히 만족한다. 다만 ArtificialAnalysis 지능 지수(II)에서 4o-mini는 6.7, 4o는 11.1로, 두 모델 모두 AA에서 이미 deprecated로 분류돼 있다. 지금 나오는 소형 모델들이 II 33~41 구간이라는 점을 감안하면 격차가 크다.

특히 뼈아픈 건 고난도 슬롯의 가격이다. GPT-4o는 호출당 $0.001042로 이번에 측정한 후보군 중 세 번째로 비싼데, 지능은 최하위권이다.

4o-mini II
6.7
AA 추정 · deprecated
4o II
11.1
AA 추정 · deprecated
4o 호출 비용
$0.00104
Luna medium의 10.8배
현행 월 비용
$35.12
10만 요청 기준 추정

2. 지능 대비 비용

오른쪽 아래로 갈수록 좋다 — 싸고 똑똑하다.

현행 사용 모델 교체 후보
가로축 = AA Intelligence Index · 세로축 = 실측 호출당 비용(로그 스케일, 상담 프롬프트 4종 × 2회 평균). 회색 점선 아래·오른쪽 영역이 현행 GPT-4o보다 싸면서 더 똑똑한 구간이다.

3. 응답 속도 — 실시간성은 지킬 수 있는가

상담 챗봇에서 가장 중요한 제약. 평균만이 아니라 최악값을 봐야 한다.

평균 응답 완료 첫 토큰(TTFT) 측정 중 최악값
스트리밍 기준. TTFT는 사용자가 "응답이 시작됐다"고 느끼는 시점, 평균은 답변이 끝나는 시점. 세로선은 8회 측정 중 가장 느렸던 값 — Claude Haiku와 DeepSeek은 평균은 무난하지만 최악값이 10초를 넘어 상담 UX에 위험하다.

주목할 점은 Gemini 3.5 Flash-Lite가 현행 4o-mini보다 빠르다는 것이다(1.20초 vs 1.79초). 최악값도 2.31초로 가장 안정적이다. 속도가 절대 기준이라면 이쪽이 답이다.

4. 전체 실측 데이터

한국어 상담 프롬프트 4종(쉬움 2 / 어려움 2) × 2회 = 모델당 8회 호출.

2026-08-07 측정 · OpenRouter 경유 · 시스템 프롬프트 포함
모델IITTFT평균최악쉬움어려움$/호출
II에 * 표시는 ArtificialAnalysis 추정치. 그 외는 실측 벤치마크 값.

5. 월 비용 시뮬레이션

월 10만 요청 · 저난도 70% / 고난도 30% 가정. 실제 트래픽 비율에 맞춰 재계산 필요.

실측 호출당 비용 × 라우팅 비율. 상담 답변은 출력 토큰이 짧아(60~200 토큰) 단가표보다 실측 비용이 훨씬 신뢰할 만하다.

6. 선택지 세 가지

무엇을 최우선으로 두느냐에 따라 답이 갈린다.

권장 · 균형

Luna low + Luna medium

현행 라우팅 구조를 그대로 두고 모델만 교체.

  • 월 $7.61 — 78% 절감
  • II 33.9 / 38.9 — 지능 4.4배
  • 평균 2.05 / 2.92초 (+0.6초)
  • 최악값 5.4초로 안정적
  • 컨텍스트 1M — 대화 이력 부담 없음
속도 최우선

Gemini 3.5 Flash-Lite 단일

라우팅을 없애고 단일 모델로 단순화.

  • 평균 1.20초 — 현행보다 빠름
  • 최악값 2.31초로 전체 1위
  • II 37.4 — 현행 대비 3.4배
  • 월 $27.34 — 22% 절감
  • 라우팅 로직 제거로 운영 단순화
품질 최우선

Luna low + Terra low

어려운 상담에 더 똑똑한 모델을 배치.

  • 고난도 II 41.3 — 후보 중 최상위권
  • 월 $25.06 — 29% 절감
  • 평균 2.42초 (+0.8초)
  • Luna·Terra 모두 50% 할인 중 — 정가 복귀 시 월 약 $50으로 현행보다 비싸짐

7. 후보에서 뺀 모델과 이유

  • Claude Haiku 4.5 — 평균 3.48초는 견딜 만하지만 최악값 10.88초로 편차가 크다. 상담 중 10초 침묵은 이탈로 이어진다. II 24.1로 가격($0.00116) 대비 지능도 낮다.
  • Gemini 3.6 Flash — II 51.6으로 후보 중 가장 똑똑하지만, 짧은 상담 질문에도 reasoning 토큰을 평균 885개나 쓴다. 결과는 평균 6.70초 · 호출당 $0.00763으로 현행 4o의 7.3배 비용. 상담용으로 과하다.
  • DeepSeek V4 Flash 0731 — 단가는 최저($0.00006)지만 최악값 13.12초. reasoning을 꺼도 어려운 질문에서 평균 5.10초가 걸린다. 또한 reasoning_effort 파라미터가 신뢰성 있게 작동하지 않았다(low가 max보다 토큰을 3.7배 더 소모). 배치·비동기 요약 워크로드에는 여전히 매력적이다.
  • Claude Sonnet 5 / GPT-5.6 Sol — 상담 챗봇에 필요한 지능 수준을 크게 상회하며, 비용과 지연 모두 부담. 에스컬레이션 전용 3차 슬롯으로는 검토 여지가 있다.

8. 방법론과 한계

  • 요금·레이턴시는 OpenRouter API, 지능 점수는 ArtificialAnalysis Intelligence Index를 사용했다. AA 값은 OpenRouter 경유 데이터와 AA 사이트 원본을 교차 검증해 일치를 확인했다.
  • 실측은 OpenRouter를 통해 실제 한국어 상담 프롬프트 4종을 각 2회 스트리밍 호출해 TTFT·완료시간·토큰·비용을 기록했다.
  • 모델당 8회 호출은 경향 파악에는 충분하나 p95 같은 꼬리 지연을 확정하기엔 부족하다. 최종 선정 모델은 도입 전 수백 회 규모로 재측정할 것을 권한다.
  • GPT-5.6 Luna와 Terra는 OpenRouter에서 50% 프로모션 할인 중이다. 정가는 Luna $0.2/$1.2, Terra $2/$12 (1M 토큰). 할인 종료 시 Luna 조합 월 비용은 $7.61 → 약 $15.2로 오르지만, 그래도 현행 대비 57% 저렴하다.
  • 비용 시뮬레이션의 트래픽 10만 건·7:3 비율은 가정값이다. 실제 로그의 라우팅 분포를 넣어 재계산해야 한다.
  • 이번 측정은 속도·비용·범용 지능만 다뤘다. 한국어 상담 품질, 스냅스 도메인 정확도, 툴 콜 안정성은 별도 평가가 필요하다.