현행 GPT-4o mini / GPT-4o 난이도 라우팅과 2026년 8월 기준 최신 모델을 실제 한국어 상담 프롬프트로 호출해 비교했다. 결론부터: 응답이 0.6초 느려지는 대신 지능은 4.4배, 비용은 78% 줄일 수 있다.
결론
현행 조합을 GPT-5.6 Luna (low / medium) 라우팅으로 교체하는 것을 권장한다. 라우팅 구조는 그대로 두고 모델 ID만 바꾸면 된다.
월 비용 (10만 요청)
−78%
$35.12 → $7.61
지능 (AA Intelligence Index)
4.4배
6.7 / 11.1 → 33.9 / 38.9
평균 응답시간
+0.6초
1.73초 → 2.31초 (가중)
교체 난이도
모델 ID만
라우팅 로직 변경 불필요
1. 현행 진단 — 빠르지만, 지능이 두 세대 뒤처졌다
속도는 문제가 아니다. 문제는 지능 대비 가격이다.
GPT-4o와 4o-mini는 실측 평균 1.6~1.8초로 여전히 빠르다. 상담 챗봇의 실시간성 요건은 충분히 만족한다. 다만 ArtificialAnalysis 지능 지수(II)에서 4o-mini는 6.7, 4o는 11.1로, 두 모델 모두 AA에서 이미 deprecated로 분류돼 있다. 지금 나오는 소형 모델들이 II 33~41 구간이라는 점을 감안하면 격차가 크다.
특히 뼈아픈 건 고난도 슬롯의 가격이다. GPT-4o는 호출당 $0.001042로 이번에 측정한 후보군 중 세 번째로 비싼데, 지능은 최하위권이다.
4o-mini II
6.7
AA 추정 · deprecated
4o II
11.1
AA 추정 · deprecated
4o 호출 비용
$0.00104
Luna medium의 10.8배
현행 월 비용
$35.12
10만 요청 기준 추정
2. 지능 대비 비용
오른쪽 아래로 갈수록 좋다 — 싸고 똑똑하다.
현행 사용 모델교체 후보
가로축 = AA Intelligence Index · 세로축 = 실측 호출당 비용(로그 스케일, 상담 프롬프트 4종 × 2회 평균). 회색 점선 아래·오른쪽 영역이 현행 GPT-4o보다 싸면서 더 똑똑한 구간이다.
3. 응답 속도 — 실시간성은 지킬 수 있는가
상담 챗봇에서 가장 중요한 제약. 평균만이 아니라 최악값을 봐야 한다.
평균 응답 완료첫 토큰(TTFT)측정 중 최악값
스트리밍 기준. TTFT는 사용자가 "응답이 시작됐다"고 느끼는 시점, 평균은 답변이 끝나는 시점. 세로선은 8회 측정 중 가장 느렸던 값 — Claude Haiku와 DeepSeek은 평균은 무난하지만 최악값이 10초를 넘어 상담 UX에 위험하다.
주목할 점은 Gemini 3.5 Flash-Lite가 현행 4o-mini보다 빠르다는 것이다(1.20초 vs 1.79초). 최악값도 2.31초로 가장 안정적이다. 속도가 절대 기준이라면 이쪽이 답이다.
4. 전체 실측 데이터
한국어 상담 프롬프트 4종(쉬움 2 / 어려움 2) × 2회 = 모델당 8회 호출.
2026-08-07 측정 · OpenRouter 경유 · 시스템 프롬프트 포함
모델
II
TTFT
평균
최악
쉬움
어려움
$/호출
II에 * 표시는 ArtificialAnalysis 추정치. 그 외는 실측 벤치마크 값.
5. 월 비용 시뮬레이션
월 10만 요청 · 저난도 70% / 고난도 30% 가정. 실제 트래픽 비율에 맞춰 재계산 필요.
실측 호출당 비용 × 라우팅 비율. 상담 답변은 출력 토큰이 짧아(60~200 토큰) 단가표보다 실측 비용이 훨씬 신뢰할 만하다.
6. 선택지 세 가지
무엇을 최우선으로 두느냐에 따라 답이 갈린다.
권장 · 균형
Luna low + Luna medium
현행 라우팅 구조를 그대로 두고 모델만 교체.
월 $7.61 — 78% 절감
II 33.9 / 38.9 — 지능 4.4배
평균 2.05 / 2.92초 (+0.6초)
최악값 5.4초로 안정적
컨텍스트 1M — 대화 이력 부담 없음
속도 최우선
Gemini 3.5 Flash-Lite 단일
라우팅을 없애고 단일 모델로 단순화.
평균 1.20초 — 현행보다 빠름
최악값 2.31초로 전체 1위
II 37.4 — 현행 대비 3.4배
월 $27.34 — 22% 절감
라우팅 로직 제거로 운영 단순화
품질 최우선
Luna low + Terra low
어려운 상담에 더 똑똑한 모델을 배치.
고난도 II 41.3 — 후보 중 최상위권
월 $25.06 — 29% 절감
평균 2.42초 (+0.8초)
Luna·Terra 모두 50% 할인 중 — 정가 복귀 시 월 약 $50으로 현행보다 비싸짐
7. 후보에서 뺀 모델과 이유
Claude Haiku 4.5 — 평균 3.48초는 견딜 만하지만 최악값 10.88초로 편차가 크다. 상담 중 10초 침묵은 이탈로 이어진다. II 24.1로 가격($0.00116) 대비 지능도 낮다.
Gemini 3.6 Flash — II 51.6으로 후보 중 가장 똑똑하지만, 짧은 상담 질문에도 reasoning 토큰을 평균 885개나 쓴다. 결과는 평균 6.70초 · 호출당 $0.00763으로 현행 4o의 7.3배 비용. 상담용으로 과하다.
DeepSeek V4 Flash 0731 — 단가는 최저($0.00006)지만 최악값 13.12초. reasoning을 꺼도 어려운 질문에서 평균 5.10초가 걸린다. 또한 reasoning_effort 파라미터가 신뢰성 있게 작동하지 않았다(low가 max보다 토큰을 3.7배 더 소모). 배치·비동기 요약 워크로드에는 여전히 매력적이다.
Claude Sonnet 5 / GPT-5.6 Sol — 상담 챗봇에 필요한 지능 수준을 크게 상회하며, 비용과 지연 모두 부담. 에스컬레이션 전용 3차 슬롯으로는 검토 여지가 있다.
8. 방법론과 한계
요금·레이턴시는 OpenRouter API, 지능 점수는 ArtificialAnalysis Intelligence Index를 사용했다. AA 값은 OpenRouter 경유 데이터와 AA 사이트 원본을 교차 검증해 일치를 확인했다.
실측은 OpenRouter를 통해 실제 한국어 상담 프롬프트 4종을 각 2회 스트리밍 호출해 TTFT·완료시간·토큰·비용을 기록했다.
모델당 8회 호출은 경향 파악에는 충분하나 p95 같은 꼬리 지연을 확정하기엔 부족하다. 최종 선정 모델은 도입 전 수백 회 규모로 재측정할 것을 권한다.
GPT-5.6 Luna와 Terra는 OpenRouter에서 50% 프로모션 할인 중이다. 정가는 Luna $0.2/$1.2, Terra $2/$12 (1M 토큰). 할인 종료 시 Luna 조합 월 비용은 $7.61 → 약 $15.2로 오르지만, 그래도 현행 대비 57% 저렴하다.
비용 시뮬레이션의 트래픽 10만 건·7:3 비율은 가정값이다. 실제 로그의 라우팅 분포를 넣어 재계산해야 한다.
이번 측정은 속도·비용·범용 지능만 다뤘다. 한국어 상담 품질, 스냅스 도메인 정확도, 툴 콜 안정성은 별도 평가가 필요하다.