OpenAI GPT-6 Astra의 텍스트 처리 단가는 전작 GPT-5.6 Sol 대비 2.5배다. 작업당 비용으로 환산하면 Sol보다 약 75% 더 든다.
반면 Anthropic 모델과 비교하면 구도가 뒤집힌다. 코딩 작업 기준으로 Astra는 Claude Fable 5와 동일한 점수를 내면서 작업당 비용은 절반 이하다. Astra가 Sol의 3분의 1, Opus 5의 5분의 1 수준의 연산 단계만 사용하기 때문이다.
▼ 주요 벤치마크 비교
| 벤치마크 | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| Epoch ECI 종합 | 169 | 162 | 163 | 162 |
| AA Intelligence Index | 61 | 61 | 66 | 63 |
| ARC-AGI-3 (미지 게임 환경) | 62.7% | 7.8% | 데이터 없음 | 30.2% |
| ARC-AGI-2 (추상 시각 퍼즐) | 95.0% | 92.5% | 90.0% | 90.4% |
| ARC-AGI-1 (구버전) | 98.5%* | 97.5% | 97.5% | 97.5% |
| FrontierMath Erdős (개방형 수학) | 3% | 0% | 0% | 데이터 없음 |
*xhigh 추론 수준 기준. max 설정에서는 97.5%. ARC-AGI-1은 현재 포화 상태로 평가됨.
ARC-AGI-3는 규칙과 목표를 알려주지 않은 미지의 게임 환경에 AI를 투입하는 방식이다. 모델은 시행착오로 직접 파악해야 한다. Astra는 ARC Prize 표준 하네스 기준 약 26,000달러 비용으로 62.7%를 기록했다. Sol은 7.78%, Claude Opus 5는 30.16%였다. Fable 5와 Fable 5.1은 아직 이 벤치마크에 등재되지 않았다.
OpenAI가 발표한 99.9%는 자체 하네스를 사용한 수치다. 이 하네스는 요청 간 추론 체인을 유지하고 긴 실행을 자동 요약한다. ARC Prize 측정에 따르면 OpenAI 하네스 실행은 표준 하네스 대비 약 3.66배 빠르고 토큰 사용량은 49% 적었다. ARC Prize는 벤더 간 공정 비교가 가능한 수치는 62.7%라고 밝혔다.
Astra에서는 추론 수준을 높일수록 비용이 줄어드는 역관계가 나타났다. 추론 없음 조건에서 49,791달러였던 비용이 최대 추론 조건에서 26,098달러로 낮아지는 동시에 점수는 35.2%에서 62.7%로 올랐다. 다만 '낮음' 수준에서는 17.5%로 추론 없음보다 오히려 낮은 이상값이 나타났다. Astra가 적은 이동 횟수로 게임을 해결해 모델 호출 수와 토큰이 줄기 때문이다.
Coding Agent Index에서는 Sol 토큰 사용량의 약 3분의 1로 67점을 기록했다. Fable 5.1은 70점으로 선두다. AA-Omniscience 환각률은 92%에서 51%로 낮아졌다. GDPval-AA v2에서는 약 80 Elo 포인트 하락했고, 뱅킹 지원·SciCode·장문 맥락 추론에서도 점수가 떨어졌다.
FrontierMath Erdős에서 Astra는 68개 개방형 Erdős 문제 중 2개를 회당 300달러 예산으로 Lean 검증 증명을 통해 풀었다. 추가 3개는 22만 달러 이상의 비표준 실행에서 나왔으나 Epoch AI는 공식 점수로 인정하지 않았다.
국내 AI 서비스 개발사 입장에서 Astra는 단가 기준점이 달라지는 모델이다. Sol 대비 작업당 비용이 75% 오르는 만큼 API 연동 비용 구조를 재산정해야 한다. 다만 코딩 작업 기준으로는 Fable 5.1과 동급 성능을 절반 이하 비용에 쓸 수 있어 용도별 선택지가 된다.








