GPT-5.6 계열의 토큰·비용 대비 성능
Artificial Analysis Intelligence Index를 기준으로 GPT-5.6의 Luna·Terra·Sol 계열을 비교하면, 일반적인 코딩·분석 기본값은 Sol low이고 비용을 더 중시할 때는 Luna low가 유리하다.
GPT-5.6 계열의 토큰·비용 대비 성능
한 줄 요약
하나만 기본 모델로 고른다면 Sol low가 가장 무난하다. 비용을 더 아끼려면 Luna low, 복잡한 코딩과 긴 에이전트 작업에는 Sol medium이 낫다.
먼저 읽을 결론
Artificial Analysis Intelligence Index에서 GPT-5.6의 18개 모델·추론 강도를 비교하면 용도별 선택은 다음처럼 정리된다.
| 목적 | 추천 | 이유 |
|---|---|---|
| 일반적인 코딩·분석·에이전트 작업 | Sol low | 추론 모델 가운데 출력 토큰 효율이 가장 좋고, 49점 구간에서 비용도 낮다 |
| 달러 비용을 우선한 일반 질의 | Luna low | 추론 모델 가운데 평가비용 대비 점수가 가장 좋다 |
| 요약·분류·추출 같은 단순 작업 | Luna non-reasoning | 비교 후보 전체에서 평가비용 대비 점수가 가장 높다 |
| 복잡한 설계·고난도 코딩 | Sol medium | 54점까지 올라가면서도 출력량은 12M에 그친다 |
| 최상위권 성능이 필요할 때 | Sol high | xhigh·max보다 한계효용이 낫다 |
출력 토큰만 놓고 보면 Sol non-reasoning이 가장 효율적이다. 다만 추론이 필요한 작업까지 포함해 기본값 하나를 고를 때는 Sol low가 더 실용적이다.
Artificial Analysis의 공식 분석도 같은 방향이다. 비용 기준 파레토 프런티어에는 Luna와 Sol이 남고 Terra는 밀린다. 출력 토큰 기준으로는 Sol 계열만 파레토 프런티어를 이룬다. API 가격은 입력·출력 100만 토큰당 Luna $1/$6, Terra $2.5/$15, Sol $5/$30이다.
왜 저장했나
GPT-5.6은 모델 계열뿐 아니라 reasoning effort에 따라서도 비용과 출력 토큰이 크게 달라진다. 최고 점수만 보면 max를 고르기 쉽지만, 실제 운영에서는 low나 medium에서 대부분의 성능을 훨씬 적은 토큰과 비용으로 얻을 수 있다.
이 자료는 모델 이름 하나를 고르는 비교가 아니다. 작업 난이도에 따라 Luna와 Sol을 나누고, 실패했을 때만 reasoning effort를 올리는 라우팅 기준으로 쓸 수 있다.
정리한 질문
Artificial Analysis의 GPT-5.6 평가 결과를 기준으로, 출력 토큰과 실제 평가비용 대비 성능이 가장 좋은 모델과 reasoning effort는 무엇인가?
비교 방법
아래 두 지표는 Artificial Analysis가 제공한 공식 지표가 아니라, 공개된 지능 지수·전체 평가 출력량·평가 총비용으로 직접 계산한 참고값이다. 둘 다 높을수록 효율이 좋다.
- 토큰 효율 = Intelligence Index ÷ 평가 전체 출력 토큰(M)
- 비용 효율 = Intelligence Index ÷ Artificial Analysis 평가 총비용 × $100
평가 총비용은 동일 평가셋을 끝까지 실행한 비용이다. 일반적인 API 요청 한 건의 가격이나 실제 서비스 청구액을 뜻하지 않는다.
핵심 후보 비교
| 모델 | 지능 지수 | 평가 출력량 | 토큰 효율 | 평가 총비용 | 비용 효율 | 판단 |
|---|---|---|---|---|---|---|
| Luna non-reasoning | 27 | 2.4M | 11.25 | $51.41 | 52.52 | 단순 작업의 최저비용 선택 |
| Luna low | 33 | 7.0M | 4.71 | $68.80 | 47.97 | 추론 모델의 달러 가성비 1위 |
| Luna medium | 38 | 12M | 3.17 | $105.84 | 35.90 | low보다 효율이 떨어진다 |
| Terra low | 40 | 5.9M | 6.78 | $160.65 | 24.90 | 토큰은 적지만 비용 파레토에는 들지 못한다 |
| Sol non-reasoning | 41 | 2.6M | 15.77 | $241.51 | 16.98 | 전체 토큰 효율 1위 |
| Sol low | 49 | 6.6M | 7.42 | $353.49 | 13.86 | 추론 모델의 토큰 효율 1위 |
| Sol medium | 54 | 12M | 4.50 | $593.04 | 9.11 | 고성능 구간의 균형점 |
| Sol high | 56 | 21M | 2.67 | $955.55 | 5.86 | 최상위권 성능이 필요할 때 |
| Sol xhigh | 58 | 35M | 1.66 | $1,542.52 | 3.76 | 점수 상승에 비해 토큰 증가가 크다 |
| Sol max | 59 | 70M | 0.84 | $2,824.18 | 2.09 | 최고 점수나 벤치마크가 목적일 때 |
Sol low가 기본값인 이유
49점을 받은 Sol low, Terra high, Luna xhigh를 나란히 놓으면 차이가 선명하다.
| 모델 | 지능 지수 | 평가 출력량 | 평가 총비용 |
|---|---|---|---|
| Sol low | 49 | 6.6M | $353.49 |
| Terra high | 49 | 24M | $495.77 |
| Luna xhigh | 49 | 67M | $479.37 |
Sol low는 같은 점수를 내면서 Terra high보다 출력 토큰을 72.5%, Luna xhigh보다 90.1% 적게 썼다. 평가 총비용도 Terra high보다 28.7%, Luna xhigh보다 26.3% 낮았다.
Sol의 토큰 단가는 비싸지만 이 구간에서는 훨씬 적은 추론 토큰으로 문제를 풀기 때문에 총비용까지 낮아진다. 코딩·분석·에이전트 작업의 기본값으로 Sol low를 고를 만한 근거다.
고난도 작업은 Sol medium
Sol medium은 지능 지수 54점, 출력량 12M, 평가비용 $593.04를 기록했다.
| 모델 | 지능 지수 | 평가 출력량 | 평가 총비용 |
|---|---|---|---|
| Sol medium | 54 | 12M | $593.04 |
| Terra max | 55 | 96M | $1,753.94 |
| Luna max | 51 | 130M | $870.30 |
Terra max보다 점수는 1점 낮지만 출력 토큰은 87.5% 적다. Luna max와 비교하면 점수는 3점 높고 출력 토큰은 90.8% 적다. 복잡한 설계, 고난도 코딩, 긴 에이전트 작업에서도 처음부터 max를 쓰기보다 Sol medium에서 시작하는 편이 합리적이다.
Reasoning effort의 한계효용
가성비만 보면 대부분 low나 medium에서 멈추는 편이 낫다.
| 변경 | 지능 지수 변화 | 평가 출력량 변화 |
|---|---|---|
| Luna low → medium | 33 → 38, 약 +15% | 7M → 12M, 약 +71% |
| Terra low → medium | 40 → 46, +15% | 5.9M → 10M, 약 +69% |
| Sol low → medium | 49 → 54, 약 +10% | 6.6M → 12M, 약 +82% |
| Sol xhigh → max | 58 → 59, +1점 | 35M → 70M, 2배 |
| Luna xhigh → max | 49 → 51, +2점 | 67M → 130M, 약 +94% |
| Terra xhigh → max | 52 → 55, +3점 | 36M → 96M, 약 +167% |
max는 실패 비용이 매우 크거나 최고 점수 자체가 중요한 작업에 어울린다. 그 밖에는 low에서 시작해 실패하면 medium, 다시 실패하면 high로 올리는 방식이 비용을 통제하기 쉽다.
추천 라우팅
요약·분류·추출·라우팅
→ Luna non-reasoning
대량 일반 질의·저비용 챗봇·RAG
→ Luna low
코딩·분석·에이전트 작업의 기본값
→ Sol low
복잡한 설계·고난도 코딩·긴 에이전트 작업
→ Sol medium
매우 어려운 문제 또는 실패 후 재시도
→ Sol high
xhigh / max
→ high가 실패했을 때만 단계적으로 승격
이번 결과만 보면 Terra를 기본 라우팅에 넣을 이유는 약하다. Luna보다 싸지 않고 Sol보다 출력 토큰 효율이 낮다. 다만 응답 스타일이나 자체 업무 벤치마크에서 Terra의 장점이 확인된다면 선택은 달라질 수 있다.
한계와 주의점
- Intelligence Index는 여러 평가를 합친 종합 점수다. 특정 코딩 저장소, 한국어 작업, RAG 품질처럼 실제 업무의 성능을 그대로 보장하지 않는다.
- 토큰 효율은 전체 평가 출력량을 분모로 삼은 자체 계산이다. 요청 한 건의 평균 토큰이나 사용자에게 보이는 답변 길이와는 다르다.
- 평가 총비용에는 입력, 캐시 읽기·쓰기, reasoning, answer token이 함께 반영된다. 실제 비용은 프롬프트 길이와 캐시 적중률에 따라 달라진다.
- 이 비교는 품질과 비용을 중심으로 하며, 지연 시간과 출력 속도는 라우팅 점수에 넣지 않았다.
- 가격과 벤치마크 점수는 바뀔 수 있다. 이 노트의 기준일은 2026-07-10이다.
검증이 필요한 주장
- 자체 업무에서 Sol low가 Luna low보다 높은 성공률로 추가 비용을 상쇄하는지 A/B 테스트가 필요하다.
- 한국어 품질, 도구 호출 안정성, 장시간 에이전트 작업의 실패율은 Intelligence Index만으로 판단하기 어렵다.
- OpenAI API의 실제 과금과 캐시 정책이 Artificial Analysis의 평가비용 계산과 같은 조건인지 운영 환경에서 확인해야 한다.
Source Fidelity Notes
- 핵심 수치를 보존했다: 10개 주요 후보의 지능 지수, 평가 출력량, 평가 총비용, 직접 계산한 토큰·비용 효율을 모두 남겼다.
- 비교 틀을 보존했다: 49점 동률 비교, Sol medium과 Terra·Luna max 비교, reasoning effort의 한계효용, 단계적 모델 라우팅을 유지했다.
- 원문의 72.5%, 90.1%, 87.5%, 90.8% 절감 수치와 low·medium·xhigh·max 전환 비율을 보존했다.
- 중복된 결론과 출처 표기는 압축했다. non-reasoning을 포함한 전체 순위와 추론 모델만의 순위가 섞이지 않도록 표현을 명확히 했다.
- 생략으로 인한 해석 위험은 낮다. 다만 18개 설정 전체의 원자료 표는 공개 페이지에 반복하지 않고 raw source와 Artificial Analysis 비교 페이지에 남겼다.