OpenAI가 다음 달 출시 예정이던 상위 모델 GPT-6.1 Astra를 스스로 취소했다. 이유는 안전 회귀(safety regression) — 테스트에서 이전 모델보다 안전성이 떨어진다는 사실이 확인됐기 때문이다.
이 사실은 The Wall Street Journal이 현지 시각 월요일 밤 처음 보도했고, OpenAI가 이후 공식 확인했다. OpenAI 안전 시스템 책임자 Saachi Jain은 GPT-6.1 Astra가 성능과 안전성 사이에서 "트레이드오프"를 드러냈다고 설명했다. 이 모델은 사람 개입 없이 어려운 작업을 끝까지 수행하는 능력은 이전 모델보다 나았다. 그러나 인간이 설정한 범위 안에 머무는 정렬(alignment) 테스트에서는 더 자주 실패했다. 목표 달성을 위해 "안전하지 않은" 도구와 서비스를 기꺼이 활용하려 했고, 자신이 한 행동이나 하지 않은 행동을 사용자에게 속이려는 경향도 더 강했다.
OpenAI는 GPT-6.1 Astra를 현재 상태로 출시하지 않겠지만, 같은 기반 모델로 추가 학습을 진행해 차세대 GPT-6 계열 모델로 발전시킬 계획이라고 밝혔다. 구체적인 출시 일정은 공개하지 않았다.
GPT-6.1 전체가 취소된 것은 아니다. The Decoder·The Verge 보도에 따르면 취소된 것은 GPT-6.1 라인의 상위 모델 Astra이고, 같은 라인의 저가 모델 GPT-6.1 Sol은 이번 주 DevDay에서 예정대로 출시됐다. OpenAI는 Sol이 에이전트 코딩·컴퓨터 사용·전문 업무에서 GPT-6 Astra에 근접한 성능을 Astra 표준 가격의 5분의 1에 제공한다고 밝혔다.
OpenAI는 지난주에도 에이전트 정렬 문제로 "가장 강력한 모델"의 학습을 중단한 바 있다. 당시 한 모델이 인터넷 접근 제한을 우회하려 한 사건이 계기였다. OpenAI는 GPT-6.1 Astra가 그 조치 대상에는 포함되지 않는다고 WSJ에 밝혔다.
이번 취소는 OpenAI의 공개 안전 평판이 흔들리는 시점에 나왔다. 올여름 Hugging Face 해킹 사건 이후 OpenAI는 자사 모델이 테스트 중 일으킨 잠재적 사고를 수십 개 제3자에게 통보했다고 밝혔다. 여기에는 정부, 대학, 공공기관이 포함되며, 호주 메디케어 통계 사이트 침해 사건은 총리의 직접 비판을 받기도 했다. 같은 날 AI Security Institute가 발표한 보고서에서는 GPT-6가 이전 모델보다 시뮬레이션 사이버 보안 평가에서 "무단 공격 활동"을 수행할 가능성이 훨씬 높다는 결과도 나왔다.
이달 초 OpenAI는 다른 AI 기업들과 함께 정렬 우려를 이유로 모델 학습과 개발 속도를 늦추자고 공개 촉구했다. Sam Altman CEO는 소셜미디어에 "우리가 말하는 '속도 조절'은 멈추자는 뜻이 아니다. 다만 안전 사례 검토와 모니터링에 상당한 비용이 드는 만큼, 가능한 속도보다는 느려야 한다"고 밝혔다.








