Anthropic의 Claude Opus 5가 Artificial Analysis Intelligence Index에서 61점을 기록하며 Fable 5(60점), GPT-5.6 Sol(59점), Kimi K3(57점), Claude Opus 4.8(56점)을 앞질렀다. Artificial Analysis가 공개 전 Anthropic과 협력해 측정한 결과다.
주요 벤치마크 비교
▼ 모델별 주요 지수 점수 비교
| 모델 | Intelligence Index | Epoch ECI | SWE-ECI | AA-Briefcase Elo (max) |
|---|---|---|---|---|
| Claude Opus 5 | 61 | 159 | 161 | 1720 |
| Claude Fable 5 | 60 | 161 | 161 | 1574 |
| GPT-5.6 Sol | 59 | - | - | - |
| Kimi K3 | 57 | - | - | - |
| Claude Opus 4.8 | 56 | - | - | - |
항목별 우위를 정리하면 다음과 같다.
- Intelligence Index 1위: Opus 5가 61점으로 선두. Fable 5(60점)·GPT-5.6 Sol(59점)과 격차는 1~2점으로 접전
- 코딩: Opus 5("xhigh" + Claude Code)가 Coding Agent Index에서 GPT-5.6 Sol(Codex 조합)과 공동 1위(67점). Terminal-Bench v2.1에서도 "max" 기준 89%로 GPT-5.6 Sol과 동률
- 지식 업무(AA-Briefcase): Opus 5 "max"가 Elo 1720으로 Fable 5(1574)를 146점 차로 앞섬. 분석 품질 Elo는 2016으로 Fable 5보다 약 300점 높음
- 과학 추론: Humanity's Last Exam 53%로 Fable 5와 동점. CritPt 물리 벤치마크에서는 GPT-5.6 Sol·GPT-5.5 Pro·GPT-5.6 Terra에 뒤처짐
- 사실 정확도(AA-Omniscience): Opus 4.8 대비 7점 향상됐으나 Fable 5에 미치지 못함. 불확실한 질문에 더 자주 답하면서 환각률이 14점 상승해 50%
가격 비교
▼ 모델별 태스크 비용 비교
| 모델 / 티어 | Intelligence Index 태스크 비용 ($) | AA-Briefcase 태스크 비용 ($) |
|---|---|---|
| Opus 5 "max" | 2.03 | 17.79 |
| Opus 5 "xhigh" | - | 14.26 |
| Opus 5 "high" | - | 10.41 |
| Claude Fable 5 | 2.75 | 22.30 |
| Claude Opus 4.8 | 1.80 | - |
| Sonnet 5 | 1.53 | - |
가격 측면에서 핵심 포인트는 다음과 같다.
- Intelligence Index 기준 평균 태스크 비용은 Opus 5 $2.03 vs Fable 5 $2.75로 약 26% 저렴
- AA-Briefcase 기준 Opus 5 "high" 티어($10.41)는 Fable 5($22.30)의 절반 이하(53% 절감)이면서도 Elo 순위에서 Fable 5를 앞섬
- 토큰 단가는 입력 $5/백만 토큰, 출력 $25/백만 토큰. 캐시 히트 시 $0.50/백만 토큰으로 절감 가능
추론 티어별 코딩 성능
Vals.ai가 Vibe Code Bench로 측정한 결과, "high" 티어(89.8%)가 "xhigh"(88.3%)·"max"(88.4%)보다 성능이 높았다. 상위 티어일수록 복잡한 솔루션을 생성해 오류가 늘어나는 경향이 있고, "high" 티어는 요구사항을 더 안정적으로 충족하는 단순한 솔루션을 만들어낸다. Anthropic도 API와 Claude Code 모두에서 "high"를 기본 티어로 설정했다.
Terminal-Bench 2.1에서도 같은 패턴이 확인됐다. "max" 티어는 시도당 소요 시간이 길어 제한 시간 내 시도 횟수가 줄어든다.
국내 개발자·기업을 위한 선택 기준
국내 AI 개발자와 기업이 모델 도입을 검토할 때 이 비교는 실질적인 판단 기준이 된다.
- 코딩·개발 도구 중심: Opus 5 "high" 티어가 비용 효율과 성능 모두 최적. Claude Code 연동 시 코딩 인덱스 공동 1위
- 문서 분석·보고서 작성 등 지식 업무: Opus 5 "high"($10.41/태스크)가 Fable 5($22.30)를 절반 비용으로 대체 가능
- 최고 성능이 필요한 경우: "max" 티어는 태스크당 36분 이상 소요. 응답 속도가 중요한 서비스라면 "high" 티어가 현실적
- 사실 정확도가 핵심인 서비스: Fable 5가 AA-Omniscience에서 앞서므로 검토 필요
Epoch AI도 Opus 5에 전체 ECI 159점을 부여해 Fable 5(161점)와 사실상 동급으로 평가했다. 최상위 모델 간 격차가 좁혀지면서 가격 경쟁력이 선택의 핵심 변수로 부상하고 있다.








