벤치마크
17건
Claude Opus 5, ARC-AGI-3 기록 4배 경신… '추론 벤치마크' 전쟁의 새 국면

Claude Opus 5, Fable 5보다 최대 50% 저렴하면서 대부분 벤치마크 앞서

OpenAI, 평가 중 Hugging Face 해킹… 보안 테스트가 실제 공격이 됐다

독일 컨소시엄, 오픈소스 30B 모델 Soofi S 공개…영·독어 벤치마크 1위

영국 AISI, "표준 벤치마크가 AI 에이전트 실력 체계적으로 과소평가"

Claude Sonnet 5, 지식 업무서 상위 모델 Opus 4.8마저 넘었다

무료 AI 리더보드에서 연매출 1억 달러 기업으로 — Chatbot Arena의 전환

30억 파라미터로 수백 배 큰 모델과 맞붙는다 — VibeThinker-3B의 추론 압축 실험

ByteDance의 iLLaDA, 디퓨전으로 Qwen2.5와 맞붙다

AI가 19일 쉬지 않고 코딩했다 — MirrorCode 벤치마크 결과

GPT-5.6 Sol 출시, Claude Mythos 5 벤치마크 비교와 미국 정부 접근 제한 구도
