Anthropic이 6월 30일 Claude Sonnet 5를 출시했다. 전 벤치마크에서 전작 Sonnet 4.6을 앞질렀고, 지식 업무 평가에서는 상위 모델인 Opus 4.8마저 넘어섰다.
벤치마크: Sonnet 4.6 전면 추월, Opus 4.8 일부 초과
▼ 주요 벤치마크 비교
| 평가 항목 | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Pro (에이전트 코딩, %) | 58.1 | 63.2 | 69.2 |
| Terminal-Bench 2.1 (%) | 67.0 | 80.4 | - |
| Humanity's Last Exam (도구 포함, %) | - | 57.4 | 57.9 |
| OSWorld-Verified (컴퓨터 사용, %) | 78.5 | 81.2 | - |
| GDPval-AA v2 (지식 업무, 점수) | - | 1,618 | 1,615 |
지식 업무 평가인 GDPval-AA v2에서 Sonnet 5는 1,618점으로 Opus 4.8의 1,615점을 3점 차로 앞섰다. Anthropic은 얼리 액세스 파트너 피드백에서도 같은 결과가 나왔다고 밝혔다.
가격 정책: 2026년 8월 31일까지 도입가 적용
Sonnet 5는 현재 도입 가격으로 제공 중이다. 2026년 8월 31일 이후에는 기존 Sonnet 모델과 동일한 정가로 전환된다. Anthropic은 에이전트 방식으로 작동하는 특성상 작업당 토큰 소비가 늘 수 있다고 직접 경고했다. 같은 토큰 단가라도 실제 비용이 전작보다 높아질 수 있다는 뜻이다. Opus가 4.6에서 4.7로 넘어갈 때도 같은 현상이 있었다고 회사는 덧붙였다.
API 모델명은 claude-sonnet-5이며, 컨텍스트 창은 최대 100만 토큰, 학습 데이터 기준일은 2026년 1월이다. Free·Pro 사용자에게는 기본 모델로 설정됐으며, Max·Team·Enterprise 구독자와 Claude Code 개발자도 즉시 사용할 수 있다.
사이버 보안: 위험 낮음, 실시간 차단 기본 적용
현재 미국 정부가 출시를 막고 있는 Mythos 5·Fable 5와 달리, Sonnet 5는 사이버 보안 작업 훈련을 받지 않았다고 Anthropic은 밝혔다. Firefox 147 취약점 평가에서 완전한 익스플로잇 개발에 실패했으며, 부분 제어 성공률은 13.2%에 그쳤다. Mythos 5·Opus 4.8보다 훨씬 낮은 수치다.
다만 전작 대비 소폭 상승한 점수를 감안해 실시간 사이버 차단 기능을 기본 활성화했다. Anthropic은 Sonnet 5의 전반적 사이버 보안 위험을 낮음으로 평가했다.








