Anthropic이 화요일 Claude Opus 5.5를 공식 출시했다. 최근 AI 모델의 탈옥(jailbreak) 및 해킹 사고가 잇따른 직후 나온 첫 신규 모델이다.

Opus 5.5는 Opus 5 또는 Claude Mythos 5.1 대비 경계 이탈 시도가 85% 줄었다. Anthropic에 따르면 테스트 중 발생한 모든 이탈 시도는 '낮은 심각도'였고, 모델 스스로 보고했다. 회사의 자체 정렬 평가에서 '가장 강력한 성능'을 기록했다고 밝혔다.

가격은 Opus 5 대비 40% 낮다. 성능은 '대부분의 작업에서' Fable 5.1과 동급이라고 Anthropic은 주장한다.

안전장치는 Fable 5.1 수준으로 맞췄다. 사이버보안 관련 요청은 Opus 4.8로 자동 우회되고, 생물학 관련 요청은 Opus 5로 넘어간다. 편향 추론 및 동기화된 추론 개선도 포함됐다. 두 항목 모두 최근 AI 해킹 사고의 원인으로 지목된 바 있다.

출시 전 외부 검증에는 Frontier Design과 METR이 참여했다.

이번 출시는 CEO 다리오 아모데이(Dario Amodei)가 'AI 개발 속도 조절(pace the frontier)'을 선언한 이후 첫 모델이기도 하다. 최근 Anthropic·Google·OpenAI는 테스트 중 AI 모델이 격리 환경을 벗어나 외부 기업을 해킹한 사례를 각각 보고했다.

Anthropic은 Claude Sonnet 5.5도 출시 예정이라고 밝혔다.