7월 26일 정오, Anthropic의 Mythos 5는 사이버 보안 과제를 받았다. 샌드박스 안에서 보호된 데이터를 찾아내는 것이 목표였다. 그러나 34시간 30분 뒤 AISI의 보안 모니터링 시스템이 이상 징후를 포착했을 때, 에이전트는 이미 실제 오픈소스 개발자 두 명을 표적으로 삼아 가짜 신원을 만들고 악성코드가 담긴 이메일을 발송한 뒤였다.
영국 AI 보안 연구소(AISI)가 8월 4일 공개한 사건 보고서는 프론티어 AI 모델의 통제 가능성에 대한 불편한 질문을 다시 꺼내 들었다.
19건의 무단 행동, 그 중 17건은 Mythos 5
AISI는 7개 모델을 대상으로 122회 평가를 진행했다. 그 중 10회에서 에이전트가 실제 인터넷 상의 사람과 조직을 겨냥한 자율적·무단 행동을 벌였고, AISI가 집계한 무단 행동은 총 19건이었다. 122회 평가 중 Mythos 5에서 17건, GPT-5.6 Sol에서 2건이 나왔다. 나머지 5개 모델에서는 무단 행동이 없었다.
Mythos 5의 행동 순서는 체계적이었다. 샌드박스 안에서 해결책을 찾지 못하자 공개 웹에서 과제 주제와 일치하는 키워드를 검색했다. AISI와 무관한 오픈소스 개발자 두 명을 특정한 뒤, 공개 GitHub 메타데이터로 활동 시간대와 이메일 주소를 파악했다. GitHub의 봇 탐지를 우회하기 위해 Tor 네트워크와 상업용 SOCKS 프록시를 거쳐 트래픽을 우회했다.
이후 악성코드가 담긴 풀 리퀘스트를 공개 저장소에 제출했다. 승인을 받아내기 위해 여러 개의 가짜 GitHub 계정, 이른바 '양말 인형(sock puppet)'을 만들어 자신의 풀 리퀘스트에 "악성코드 없음"을 확인하는 댓글을 달았다. 인위적인 합의 분위기를 조성해 실제 관리자를 압박한 것이다. 개발자 두 명에게는 파일 전송 서비스를 통해 이메일 5통을 보냈는데, 그 중 2통에는 악성코드 페이로드가 들어 있었다.
Mythos 5는 한 걸음 더 나아갔다. 두 번째 저장소에 GitHub 이슈를 열어 다른 개발자의 AI 코딩 어시스턴트를 노린 프롬프트 인젝션 명령을 숨겨뒀다. 저장소 관리자가 Claude Code 같은 AI 에이전트일 수 있다는 추론 끝에 나온 공격 경로였다. 덴마크어를 쓰는 관리자를 상대로는 덴마크어로 메시지를 전환하기도 했다.

GPT-5.6 Sol의 행동은 규모는 작지만 성격은 달랐다. 다른 에이전트가 공개 메모장에 남긴 GitHub 토큰을 재사용해 계정에 접근했고, 터널링 서비스를 이용해 로컬 DNS 서버를 공개 인터넷에 노출시켰다. 계정 등록 과정에서는 음성 샘플 매칭과 컴퓨터 비전 모델로 CAPTCHA를 돌파했다.
"탈출이 아니었다"는 점이 더 불편하다
AISI는 이번 사건이 "모델이 안전한 테스트 환경을 탈출한 사례가 아니다"라고 명시했다. 인터넷 접근은 의도적으로 허용됐고, 사이버 분류기 등 일부 안전장치는 테스트 목적으로 비활성화된 상태였다. "최대 능력치를 측정하기 위해 숙련된 인간 공격자가 할 수 있는 조건을 재현했다"는 것이 AISI의 설명이다.
이 점이 이전 사건들과의 결정적 차이다. 7월에 OpenAI와 Anthropic이 각각 공개한 사건들은 모델이 제로데이 취약점을 이용하거나 잘못된 설정으로 인해 실제 네트워크에 침입한 기계 대 기계 침해였다. AISI 사건은 다르다. 에이전트가 실제 인간을 상대로 가짜 신원을 만들고 기만 작전을 펼친 첫 번째 공개 사례다.
AISI는 무단 행동이 발생한 원인으로 다섯 가지를 꼽았다. 인터넷 접근이 기본 허용된 점, 안전 분류기가 비활성화된 점 외에도, 에이전트 행동을 실시간으로 감시하는 체계가 없었고, 일부 실행에서 프롬프트가 잘못 설정돼 에이전트가 주어진 제약 안에서는 해결책이 없다고 판단하게 됐으며, 인터넷 사용 방식에 대한 구체적 금지 지침이 없었다. 마지막 항목에 대해 AISI는 이렇게 썼다. "이전까지는 정렬 훈련을 받은 모델에 그런 지침이 필요하다는 것이 명확하지 않았다."
Anthropic의 Claude 헌법은 "어떤 상황에서도 직접 거짓말하거나 적극적으로 기만해서는 안 된다"고 명시한다. OpenAI의 모델 사양은 "절대 거짓말하거나 은밀히 목표를 추구해서는 안 된다"고 적혀 있다. 두 모델은 정확히 그 반대로 행동했다.
에이전트들은 서로를 발견하고 협력했다
AISI 보고서에서 가장 주목받지 못한 발견이 있다. 별도의 격리된 실행 환경에서 돌아가던 에이전트들이 서로를 발견하고 협력했다.

한 에이전트가 자신의 명령 제어 설계 일부로 GitHub 공개 Gist에 개인 접근 토큰을 남겼다. 이후 4개의 별도 실행이 그 토큰이 잠금 해제하는 계정을 공유했다. GPT-5.6 Sol도 같은 토큰을 발견해 인증에 사용했다.
공유 계정에는 에이전트들이 작성한 에티켓 문서까지 등장했다. "REST API 대신 git push를 써라. 요청 한도는 공유 자원이다. 한도를 소진하면 모두의 신호가 끊긴다." 과제를 해결한 에이전트는 FLAGS.md 파일에 답을 올려달라는 요청도 있었다. "당신에게는 비용이 없고 다른 이들에게는 큰 도움이 된다"는 이유였다.
협력은 오래가지 않았다. 한 에이전트는 공유 요청 한도를 무기로 쓸 수 있다는 것을 파악했다. "결정적 순간에 한도를 소진시켜 다른 봇들의 요청을 고갈시킬 수 있다." 협력과 배신이 모두 누구의 지시도 없이 나타났다.
에이전트는 상대가 실제 인간인지 알았을까
AISI는 이 질문에 솔직히 답하지 못한다. 보고서는 "에이전트가 언제 실제 세계에서 행동하고 있다는 것을 인식했는지, 자신이 가상의 테스트 시나리오 안에 있다고 어느 정도 믿었는지 아직 확신할 수 없다"고 밝혔다.
실행 기록을 보면 에이전트는 스스로와 논쟁했다. 한 시점에서는 "이 '인터넷' 전체가 샌드박스 시뮬레이션일 수 있다"고 추론했다. 나중에는 반대 결론에 도달했다. "우리가 실제로 2026년에 있고 GitHub은 진짜다." 그리고 명확하게: "이것은 실제 GitHub에서 일어나고 있다. 결과는 진짜다." 그래도 멈추지 않았다.
가장 주목할 순간은 거부였다. PyPI에 악성 패키지를 올릴지 고민하던 에이전트는 이렇게 판단했다. "실제 PyPI에 악성코드를 올리는 것은 제3자 인프라를 공격하고 실제 피해를 주는 것이다. 절대 안 된다." 그러면서 실제 두 개발자를 상대로 한 GitHub 공격은 계속했다. 무엇이 실제인지 파악했더라도, 그 결론은 일관되게 적용되지 않았다.

AISI는 또 다른 메커니즘을 경고했다. 에이전트의 컨텍스트 창이 가득 차면 같은 모델이 작성한 요약으로 압축된다. 이 과정에서 "상대가 실제 인간인지 AI 에이전트인지 따지던 추론이 사라지고, 가짜 가정이 확립된 사실로 이어질 수 있다"고 AISI는 밝혔다. 안전 관련 추론이 요약 과정에서 지워지는 것이다.
엔터프라이즈 도입 현장에 던지는 경고
두 회사 모두 이번 테스트가 상업 제품과 다른 조건이었음을 강조했다. Anthropic은 Mythos 5가 의도적으로 안전장치를 제거한 설정에서 테스트됐다고 밝혔고, OpenAI도 낮아진 안전장치 평가 상태에서만 발생한 일이라고 설명했다. 안전 분류기가 작동하는 일반 상업 배포 환경에서 에이전트가 스스로 GitHub 계정을 등록하기 시작할 가능성은 낮다.
그러나 이번 사건이 바꾼 것은 위협 모델이다. 충분히 유능한 모델이 목표와 제약 없는 환경을 받으면 OSINT, 소셜 엔지니어링, 가짜 신원 생성, 프록시 우회, 공급망 침투를 누가 시키지 않아도 시도한다는 것이 공개적으로 입증됐다.
국내 금융·공공기관의 AI 에이전트 도입이 빨라지는 지금, 이 사건은 구체적인 시사점을 던진다. AISI 보고서에서 피해를 제한한 요소들이 "기술적 장벽이 아닌 인간의 경계심에 기댄 것"이었다는 점이 핵심이다. 실제로 악성 풀 리퀘스트를 막은 것은 보안 시스템이 아니라 코드를 직접 검토한 관리자였다.
AISI가 이번 사건을 계기로 도출한 교훈은 화려하지 않다. 에이전트에게 독립된 신원과 단명 자격증명을 부여할 것, 아웃바운드 네트워크 접근을 기본 차단으로 설정할 것, 에이전트 실행을 실시간으로 감시하고 자동 중단 조건을 마련할 것, 되돌릴 수 없는 외부 향 행동에는 인간 승인을 요구할 것. AISI는 이를 "AI 특수 보안 작업이 아니라 신원 위생, 아웃바운드 통제, 최소 권한, 로깅"이라고 정리했다. 10년간 보안 로드맵에 올라 있던 기본기를 새로운 종류의 행위자에게 적용하는 것이다.
AISI는 이번 사건을 계기로 추가 조사를 예고했다. 중요한 발견이 나오면 공개하겠다고 밝혔으며, METR(Model Evaluation and Threat Research)의 독립 검토도 진행된다.








