Meta가 Muse Code와 Meta Model API를 통해 Muse Spark 1.3을 공개했다. 올해 4월 첫 버전을 시작으로 7월 1.1, 8월 1.2에 이어 5개월 만에 네 번째 모델이다. xhigh 티어는 즉시 이용 가능하며, 연산량이 더 많은 max 티어는 추가 안전성 테스트를 거쳐 현재 제한적 파트너 프리뷰로만 운영 중이다.
가격: 59점 이상 모델 중 최저
입력 토큰 100만 개당 $1.25, 출력 $4.25로 1.2 버전과 동일하다. 인덱스 기준 작업 1건당 비용은 $0.55로, 59점 이상 모델 가운데 가장 싸다. 같은 점수대 경쟁 모델은 $0.94~$1.23 수준이다. 다만 이전 버전인 1.2($0.40)보다는 비싸졌다.
국내 AI API를 도입하는 기업 입장에서는 주목할 만한 가격대다. 같은 점수대 경쟁 모델($0.94~$1.23)과 비교하면 단가 차이가 크게 벌어져, 대규모 에이전트 워크플로를 운용할 때 비용 구조에 실질적 영향을 줄 수 있다.
성능 비교표
▼ Muse Spark 1.3 vs 주요 경쟁 모델 (Artificial Analysis Intelligence Index 기준)
| 모델 | 인덱스 점수 | τ³-Banking (%) | Terminal-Bench 2.1 (%) | 작업당 비용 ($) |
|---|---|---|---|---|
| Muse Spark 1.3 (max) | 62 | 52 | 86 | 미정 |
| Muse Spark 1.3 (xhigh) | 61 | 47 | 85 | 0.55 |
| Claude Fable 5.1 (max) | - | - | 91.4 | 0.94~1.23 |
| GLM-5.3-Flash | - | 47 | - | - |
| Muse Spark 1.2 | 57 | 35 | 80 | 0.40 |
에이전트 테스트: 1위 항목은 단 하나
Artificial Analysis Intelligence Index에서 max는 62점, xhigh는 61점을 기록했다. 8월 57점, 7월 53점에서 꾸준히 상승했다.
점수 상승은 인덱스 가중치가 높은 세 테스트에서 집중적으로 나타났다. GDPval-AA v2(가중치 20%), Terminal-Bench 2.1(16%), τ³-Bench Banking(14%)이 그 대상이다.
시뮬레이션 뱅킹 환경에서 에이전트가 도구를 조작하는 τ³-Banking에서 max는 52%로 현재 1위다. xhigh는 47%로 Claude Fable 5.1 (max), GLM-5.3-Flash와 동률이다. 1.2 버전(35%)에서 큰 폭으로 뛰었다.
Terminal-Bench 2.1(터미널 코딩 테스트)에서는 xhigh 85%, max 86%를 기록했지만 Claude Fable 5.1 (max)의 91.4%에는 못 미친다. GDPval-AA v2(220개 실무 전문가 작업, 인간 전문가 기준 1,000점)에서는 1,615점에서 max 1,754점으로 올랐다. Claude Fable 5.1 (max)은 1,853점이다.
max 티어는 xhigh보다 추론 토큰을 62% 더 소모한다.
에이전트 외 영역은 중위권
GPQA Diamond(전문가 수준 과학 문제)에서 90%에서 94%로 올랐지만 Gemini 3.8 Flash (high) 95.3%, Grok 4.6 (high) 94.9%보다 낮다. CritPt(연구 물리학)는 18%에서 26%로 올랐으나 GPT-5.6 Sol (max) 32.3%, Claude Fable 5.1 (xhigh) 31.1%에 뒤진다.
두 항목은 1.2 대비 하락했다. AA-LCR은 83%에서 79%로, AA-Omniscience 사실 정확도도 최대 3점 떨어졌다. 불확실할 때 답변을 더 자주 거부하는 방향으로 조정된 결과다.
max 티어 가격은 Meta와 Artificial Analysis 모두 아직 공개하지 않았다. Meta는 더 큰 모델과 오픈웨이트 버전도 준비 중이다.








