Meta가 Muse Code와 Meta Model API를 통해 Muse Spark 1.3을 공개했다. 올해 4월 첫 버전을 시작으로 7월 1.1, 8월 1.2에 이어 5개월 만에 네 번째 모델이다. xhigh 티어는 즉시 이용 가능하며, 연산량이 더 많은 max 티어는 추가 안전성 테스트를 거쳐 현재 제한적 파트너 프리뷰로만 운영 중이다.

가격: 59점 이상 모델 중 최저

입력 토큰 100만 개당 $1.25, 출력 $4.25로 1.2 버전과 동일하다. 인덱스 기준 작업 1건당 비용은 $0.55로, 59점 이상 모델 가운데 가장 싸다. 같은 점수대 경쟁 모델은 $0.94~$1.23 수준이다. 다만 이전 버전인 1.2($0.40)보다는 비싸졌다.

국내 AI API를 도입하는 기업 입장에서는 주목할 만한 가격대다. 같은 점수대 경쟁 모델($0.94~$1.23)과 비교하면 단가 차이가 크게 벌어져, 대규모 에이전트 워크플로를 운용할 때 비용 구조에 실질적 영향을 줄 수 있다.

성능 비교표

▼ Muse Spark 1.3 vs 주요 경쟁 모델 (Artificial Analysis Intelligence Index 기준)

모델인덱스 점수τ³-Banking (%)Terminal-Bench 2.1 (%)작업당 비용 ($)
Muse Spark 1.3 (max)625286미정
Muse Spark 1.3 (xhigh)6147850.55
Claude Fable 5.1 (max)--91.40.94~1.23
GLM-5.3-Flash-47--
Muse Spark 1.25735800.40

에이전트 테스트: 1위 항목은 단 하나

Artificial Analysis Intelligence Index에서 max는 62점, xhigh는 61점을 기록했다. 8월 57점, 7월 53점에서 꾸준히 상승했다.

점수 상승은 인덱스 가중치가 높은 세 테스트에서 집중적으로 나타났다. GDPval-AA v2(가중치 20%), Terminal-Bench 2.1(16%), τ³-Bench Banking(14%)이 그 대상이다.

시뮬레이션 뱅킹 환경에서 에이전트가 도구를 조작하는 τ³-Banking에서 max는 52%로 현재 1위다. xhigh는 47%로 Claude Fable 5.1 (max), GLM-5.3-Flash와 동률이다. 1.2 버전(35%)에서 큰 폭으로 뛰었다.

Terminal-Bench 2.1(터미널 코딩 테스트)에서는 xhigh 85%, max 86%를 기록했지만 Claude Fable 5.1 (max)의 91.4%에는 못 미친다. GDPval-AA v2(220개 실무 전문가 작업, 인간 전문가 기준 1,000점)에서는 1,615점에서 max 1,754점으로 올랐다. Claude Fable 5.1 (max)은 1,853점이다.

max 티어는 xhigh보다 추론 토큰을 62% 더 소모한다.

에이전트 외 영역은 중위권

GPQA Diamond(전문가 수준 과학 문제)에서 90%에서 94%로 올랐지만 Gemini 3.8 Flash (high) 95.3%, Grok 4.6 (high) 94.9%보다 낮다. CritPt(연구 물리학)는 18%에서 26%로 올랐으나 GPT-5.6 Sol (max) 32.3%, Claude Fable 5.1 (xhigh) 31.1%에 뒤진다.

두 항목은 1.2 대비 하락했다. AA-LCR은 83%에서 79%로, AA-Omniscience 사실 정확도도 최대 3점 떨어졌다. 불확실할 때 답변을 더 자주 거부하는 방향으로 조정된 결과다.

max 티어 가격은 Meta와 Artificial Analysis 모두 아직 공개하지 않았다. Meta는 더 큰 모델과 오픈웨이트 버전도 준비 중이다.