숫자 하나가 AI 업계를 뒤흔들었다. 30.2%. Anthropic이 7월 24일 공개한 Claude Opus 5가 ARC-AGI-3 벤치마크에서 받아든 점수다. 직전 기록 보유자였던 OpenAI의 GPT-5.6 Sol(Max)은 7.8%에 머물렀다. 같은 척도로 비교하면 거의 4배 차이다. Anthropic의 'Fable급' 모델도 약 20%에 그쳤다.

ARC-AGI-3는 단순 암기 능력을 걸러내도록 설계된 벤치마크다. 모델은 훈련 중 본 적 없는 환경에서 규칙을 스스로 추론하고, 행동을 계획하며, 단계별로 실행해야 한다. 저장된 지식이 아니라 실시간 일반 추론을 측정한다는 뜻이다. 공개된 25개 환경 가운데 6개가 이번에 처음 풀렸고, 그 중 4개는 인간 수준 이상에서 해결됐다. Opus 5는 이 중 5개 환경을 새로 풀었다.

Claude Opus 5, ARC-AGI-3 기록 4배 경신… '추론 벤치마크' 전쟁의 새 국면 (summary)

ARC Prize는 Opus 5의 약진 배경으로 "더 강력한 논리 추론 능력"을 꼽았다. 이 능력이 낯선 환경에서 자율 탐색, 계획, 실행을 가능하게 한다는 설명이다. 특히 연구진이 주목한 장면이 있었다. 테스트 도중 Opus 5는 과제를 대수 표기로 변환하고, 반사 방정식을 독자적으로 수립했다. ARC Prize는 이 행동을 "전례 없는" 것으로 기록했다.

이 결과를 어떻게 받아들여야 할까. ARC-AGI-3 공동 개발자 Greg Kamradt는 "결과가 더 넓은 추론 향상을 배제하지 않는다"고 했다. 다만 독립 연구자 Guanghan Ning이 운영하는 사설 벤치마크 Witness에서는 다른 그림이 나왔다. Opus 5는 Witness에서 43.4점을 기록해 Kimi K3, Fable 5와 통계적으로 동률을 이뤘고, ARC-AGI-3에서만큼의 압도적 상승은 없었다. 더 눈길을 끈 건 규칙 조합 방식이 낯선 퍼즐에서 Opus 5가 전작 Opus 4.8보다 낮은 점수를 받은 대목이다. Ning은 이 패턴이 장르 특화 데이터 훈련과 맞아떨어진다고 봤다.

Kamradt는 이 해석에 선을 그었다. 익숙한 역학을 쓰는 퍼즐은 새로움 자체를 테스트하지 못하고, 특정 게임에서의 약세는 고립된 회귀일 수 있다는 것이다. 실제로 Opus 4.8도 일부 ARC-AGI-3 게임에서 Opus 5를 앞섰지만 전체 격차는 컸다. Ning 역시 나중에 입장을 보완했다. Witness 전체로 보면 Opus 5가 더 넓은 향상을 보였으나 ARC-AGI-3보다 폭이 훨씬 작다는 것이다.

Claude Opus 5, ARC-AGI-3 기록 4배 경신… '추론 벤치마크' 전쟁의 새 국면 (summary)

Ning은 이 구도를 코딩 벤치마크의 진화 경로와 겹쳐 읽었다. HumanEval처럼 포화된 벤치마크에서 출발해 계속 갱신되는 경쟁 과제로, 다시 오늘날의 코딩 에이전트로 이어진 길이다. ARC-AGI-3가 상호작용 추론의 핵심 표적이 된 만큼, 지금은 이 벤치마크에 훈련 노력이 집중될 것이고 엣지 케이스가 추가될수록 모델이 더 넓은 추상 추론을 다루게 된다는 논리다.

한 가지는 분명하다. Anthropic이 ARC-AGI-3 형식이 공개된 이후 Opus 5를 개발했다는 점이다. 벤치마크 특화 기술과 퍼즐 형식을 겨냥했을 가능성은 열려 있다. 다만 정확한 과제를 훈련 데이터로 썼다는 증거는 없다. 강화학습으로 탐색·계획·규칙 발견·자기 교정을 보상하는 방식도 충분한 설명이 된다. ARC Prize 공식 채점은 외부 소프트웨어 도움 없이 언어 모델 자체 성능만 인정한다. Opus 5를 Claude Code 안에서 쓴다면 점수는 더 높아질 수 있다.

Claude Opus 5, ARC-AGI-3 기록 4배 경신… '추론 벤치마크' 전쟁의 새 국면 (keyword_summary)

이 경쟁 구도는 한국 AI 개발 생태계에도 시사점을 던진다. 국내 파운데이션 모델 연구는 지식 암기형 벤치마크에서 글로벌 선두 모델과 격차를 좁히기 어렵다. 그러나 ARC-AGI-3처럼 새로운 환경 적응력과 추론 경로 설계 능력을 측정하는 영역은 아직 경쟁 구도가 유동적이다. 추론 최적화 전략을 중심에 놓는다면, 자원 대비 차별화 가능성이 상대적으로 크다.

ARC-AGI-2에서 Opus 5는 90.4%, ARC-AGI-1에서는 97.5%를 기록했다. 두 수치 모두 이전 최고 점수와 동등하다. 전체 결과, 재현 영상, 벤치마킹 코드는 ARC Prize 사이트에 공개돼 있다.