Anthropic의 Claude Opus 5가 Artificial Analysis Intelligence Index에서 61점을 기록하며 Fable 5(60점), GPT-5.6 Sol(59점), Kimi K3(57점), Claude Opus 4.8(56점)을 앞질렀다. Artificial Analysis가 공개 전 Anthropic과 협력해 측정한 결과다.

주요 벤치마크 비교

▼ 모델별 주요 지수 점수 비교

모델Intelligence IndexEpoch ECISWE-ECIAA-Briefcase Elo (max)
Claude Opus 5611591611720
Claude Fable 5601611611574
GPT-5.6 Sol59---
Kimi K357---
Claude Opus 4.856---

항목별 우위를 정리하면 다음과 같다.

  • Intelligence Index 1위: Opus 5가 61점으로 선두. Fable 5(60점)·GPT-5.6 Sol(59점)과 격차는 1~2점으로 접전
  • 코딩: Opus 5("xhigh" + Claude Code)가 Coding Agent Index에서 GPT-5.6 Sol(Codex 조합)과 공동 1위(67점). Terminal-Bench v2.1에서도 "max" 기준 89%로 GPT-5.6 Sol과 동률
  • 지식 업무(AA-Briefcase): Opus 5 "max"가 Elo 1720으로 Fable 5(1574)를 146점 차로 앞섬. 분석 품질 Elo는 2016으로 Fable 5보다 약 300점 높음
  • 과학 추론: Humanity's Last Exam 53%로 Fable 5와 동점. CritPt 물리 벤치마크에서는 GPT-5.6 Sol·GPT-5.5 Pro·GPT-5.6 Terra에 뒤처짐
  • 사실 정확도(AA-Omniscience): Opus 4.8 대비 7점 향상됐으나 Fable 5에 미치지 못함. 불확실한 질문에 더 자주 답하면서 환각률이 14점 상승해 50%

가격 비교

▼ 모델별 태스크 비용 비교

모델 / 티어Intelligence Index 태스크 비용 ($)AA-Briefcase 태스크 비용 ($)
Opus 5 "max"2.0317.79
Opus 5 "xhigh"-14.26
Opus 5 "high"-10.41
Claude Fable 52.7522.30
Claude Opus 4.81.80-
Sonnet 51.53-

가격 측면에서 핵심 포인트는 다음과 같다.

  • Intelligence Index 기준 평균 태스크 비용은 Opus 5 $2.03 vs Fable 5 $2.75로 약 26% 저렴
  • AA-Briefcase 기준 Opus 5 "high" 티어($10.41)는 Fable 5($22.30)의 절반 이하(53% 절감)이면서도 Elo 순위에서 Fable 5를 앞섬
  • 토큰 단가는 입력 $5/백만 토큰, 출력 $25/백만 토큰. 캐시 히트 시 $0.50/백만 토큰으로 절감 가능

추론 티어별 코딩 성능

Vals.ai가 Vibe Code Bench로 측정한 결과, "high" 티어(89.8%)가 "xhigh"(88.3%)·"max"(88.4%)보다 성능이 높았다. 상위 티어일수록 복잡한 솔루션을 생성해 오류가 늘어나는 경향이 있고, "high" 티어는 요구사항을 더 안정적으로 충족하는 단순한 솔루션을 만들어낸다. Anthropic도 API와 Claude Code 모두에서 "high"를 기본 티어로 설정했다.

Terminal-Bench 2.1에서도 같은 패턴이 확인됐다. "max" 티어는 시도당 소요 시간이 길어 제한 시간 내 시도 횟수가 줄어든다.

국내 개발자·기업을 위한 선택 기준

국내 AI 개발자와 기업이 모델 도입을 검토할 때 이 비교는 실질적인 판단 기준이 된다.

  • 코딩·개발 도구 중심: Opus 5 "high" 티어가 비용 효율과 성능 모두 최적. Claude Code 연동 시 코딩 인덱스 공동 1위
  • 문서 분석·보고서 작성 등 지식 업무: Opus 5 "high"($10.41/태스크)가 Fable 5($22.30)를 절반 비용으로 대체 가능
  • 최고 성능이 필요한 경우: "max" 티어는 태스크당 36분 이상 소요. 응답 속도가 중요한 서비스라면 "high" 티어가 현실적
  • 사실 정확도가 핵심인 서비스: Fable 5가 AA-Omniscience에서 앞서므로 검토 필요

Epoch AI도 Opus 5에 전체 ECI 159점을 부여해 Fable 5(161점)와 사실상 동급으로 평가했다. 최상위 모델 간 격차가 좁혀지면서 가격 경쟁력이 선택의 핵심 변수로 부상하고 있다.