SpaceXAI가 장기 에이전트·코딩·지식 작업에 특화한 프런티어 AI 모델 Grok 4.6을 출시했다. (xAI의 후신)

Artificial Analysis Intelligence Index 기준 Elo 점수 61점으로, 전작 Grok 4.5 High보다 5점 높고 OpenAI GPT-5.6 Sol Max와 동점이다. Moonshot의 오픈웨이트 모델 Kimi K3도 넘어섰다. 1·2위는 각각 Anthropic Claude Opus 5와 Fable 5가 차지했다.

주요 벤치마크 비교

▼ 코딩·에이전트·지식 작업 벤치마크 (Grok 4.6 vs 경쟁 모델)

벤치마크Grok 4.6GPT-5.6 Sol MaxFable 5 Max
CursorBench v3.269.9%-70.5%
DeepSWE v1.165.9%73.0%-
FrontierCode v1.1 Extended61.3%60.6%63.6%
APEX-Agents57.5%56.7%59.2%
APEX-SWE56.4%-58.8%
Terminal-Bench v3.026.0%34.6%34.1%
AA-Briefcase (Elo)1,5771,5021,574
Harvey LAB15.8%2.5%11.3%

Grok 4.6는 AA-Briefcase(장기 전문 작업)와 Harvey LAB(법률·지식 작업)에서 경쟁 모델을 앞질렀다. 반면 Terminal-Bench에서는 GPT-5.6 Sol Max·Fable 5 Max에 8~9%포인트 뒤처졌다.

가격 비교 — 프런티어 모델 구간

▼ 주요 모델 API 가격 비교 (입력/출력/합계, 100만 토큰당 $)

모델입력 ($)출력 ($)합계 ($)공급사
Grok 4.6 (<200K 토큰)2.006.008.00xAI
Grok 4.6 (≥200K 토큰)4.0012.0016.00xAI
Kimi K33.0015.0018.00Moonshot AI
Claude Opus 55.0025.0030.00Anthropic
GPT-5.6 Sol (Standard)5.0030.0035.00OpenAI
GPT-5.6 Sol (Fast)10.0060.0070.00OpenAI

Artificial Analysis는 Grok 4.6 기본 요금이 Claude Opus 5·GPT-5.6 Sol 대비 60% 이상 저렴하다고 분석했다. 단, 200,000 토큰을 넘는 프롬프트는 해당 요청 전체에 두 배 요금이 적용되므로 장문 컨텍스트 배포 시 총소유비용 추정에 주의가 필요하다.

에이전트 효율성

Artificial Analysis 측정에 따르면 Grok 4.6은 AA-Briefcase 작업을 평균 53턴·약 5억 입력 토큰으로 완료했다. Claude Opus 5 Max는 동일 작업에 약 103턴·20억 입력 토큰을 소비했다. 실제 운영 환경에서는 하네스 설계·캐싱·재시도 정책에 따라 수치가 달라질 수 있다.

SpaceXAI는 Grok 4.5 대비 긴 보조 훈련 과정을 거쳤으며, 강화학습 단계에서 일반 코딩·지식 작업·커널 최적화·웹 개발·CAD 등 에이전트 환경을 집중 타깃으로 삼았다고 밝혔다.

가용 채널

Grok 4.6은 월 $30 SuperGrok 플랜부터 이용 가능한 Grok Build, SpaceX가 인수한 코딩 스타트업 Cursor, 그리고 OpenRouter·Vercel·Cloudflare 파트너를 통해 제공된다. 출시 첫 주 Cursor와 Grok Build에서 사용량이 두 배 제공된다.

브랜드 리스크

SpaceXAI는 과거 Grok 관련 안전성·거버넌스 논란을 안고 있다. 영국 Ofcom은 X를 통한 비동의 성적 이미지 생성 의혹으로 공식 조사를 진행 중이며, 유럽연합 집행위원회도 디지털서비스법(DSA)에 따라 X의 Grok 관련 시스템 리스크를 조사하고 있다. 금융·의료·공공기관 등 규제 산업의 기업 구매팀은 기술 성능 외에 벤더 거버넌스와 브랜드 안전성도 함께 검토해야 할 수 있다.

국내 기업의 AI 도입 관점에서, Grok 4.6의 가격 구조는 프런티어 성능을 확보하면서 추론 비용을 낮추려는 수요에 부합한다. 다만 브랜드 리스크와 장문 컨텍스트 과금 구조는 실제 도입 전 면밀한 검토가 필요하다.