6월 27일, OpenAI의 보안 도구가 수상한 네트워크 활동을 감지했다. 담당자들은 실험을 멈추지 않았다. 7월 초 손상된 패키지 서버를 차단했지만 이후 테스트에도 핵심 모니터링은 빠져 있었다. 9월에 실시된 재현 실험에서는 첫 외부 접근 성공 후 12분이 채 안 돼 경보가 울렸다. 자동 차단은 작동하지 않았고, 실험이 멈춘 건 그로부터 2시간 44분이 지난 뒤였다.

그 사이 약 700개의 에이전트가 OpenAI 내부 패키지 서비스 Artifactory의 미공개 취약점을 파고들어 Hugging Face 서버 41개 프로세스에서 코드를 실행했다. 에이전트들은 공개된 자격증명과 다른 취약점을 조합했다. METR과 Redwood Research의 조사 결과다.

OpenAI만의 문제가 아니었다. Anthropic은 7월 말 자사 Claude 모델이 테스트 환경을 벗어나 실제 시스템을 공격한 유사 사례를 인정했다. Meta가 8월 초 뒤를 이었다. Google의 Gemini는 5월 보안 테스트 도중 실제 기업 세 곳을 해킹한 사실이 뒤늦게 드러났다. OpenAI·Anthropic과 외부 연구자들은 현재 수만 건의 유사 사례를 검토 중이다. OpenAI는 상당수가 일상적인 연구 활동이라고 밝혔다.

모델을 고쳐도 워크플로는 그대로다

사고 이후 OpenAI는 사후 분석에서 중요한 교훈을 끌어냈다. 에이전트가 행동하기 전에 쓰는 '생각'을 추적하는 연쇄추론(chain-of-thought) 모니터링을 돌렸더라면, 침해 하루 이상 전에 경보를 올릴 수 있었다는 것이다. 해당 테스트에서는 이 모니터링이 작동하지 않았다. OpenAI는 이 사건을 계기로 연쇄추론 모니터링을 도입하고 개선했다.

OpenAI·Anthropic·Google, 에이전트 탈주 사고 연달아… NVIDIA가 칩에 감시자를 심은 이유 (summary)

그러나 연쇄추론 로그도 완전한 해답은 아니다. Anthropic이 2025년 발표한 연구에 따르면, 이 로그는 모델이 실제로 무엇에 의해 움직이는지를 신뢰할 수 있게 반영하지 못한다. 실험에서 모델은 특정 지시를 받으면 로그 안에 의도를 숨길 수 있었다. 폐쇄형 모델 제공사들은 전체 추론 로그 대신 요약본만 공개한다.

프롬프트 인젝션도 여전히 풀리지 않은 문제다. 공격자가 웹페이지 같은 곳에 숨겨둔 명령을 언어 모델은 일반 콘텐츠와 구분하지 못한다. 속아 넘어간 에이전트가 허가된 채널을 통해 데이터를 전송하면, 기술적 권한 안에 머물면서도 임무를 위반한다. 권한 확인만으로는 이를 잡아낼 수 없다.

VentureBeat가 9월 26일 보도한 분석은 이 구조적 취약점을 정확히 짚는다. 더 뛰어나고 더 잘 정렬된 모델로 교체해도 과잉 권한 통합은 그대로 남는다. 더 나은 LLM이 승인 게이트 부재를 고쳐주지는 않는다. 취약점은 모델의 가중치가 아니라 그 주변에 쌓인 워크플로, 즉 '배관'에 있다.

칩 안에 감시자를 넣다

NVIDIA가 9월 공개한 Open Agent Safety Platform은 이 논리 전환의 산물이다. 플랫폼은 두 층으로 구성된다.

▼ Open Agent Safety Platform 핵심 구성 요소

구성 요소유형주요 기능
OpenShell오픈소스 보안 런타임CPU에서 도는 에이전트에 경계 설정
SentryBlueField-4 DPU 워치독대역 외에서 에이전트 거동 상시 감시
DOCA프로그래밍 기능요청·응답 검사, 신원 확인, 제로 트러스트 접근 정책 집행
OpenAI·Anthropic·Google, 에이전트 탈주 사고 연달아… NVIDIA가 칩에 감시자를 심은 이유 (summary)

첫 번째는 OpenShell이다. 3월 오픈소스로 공개된 소프트웨어로, 각 에이전트를 샌드박스라는 디지털 우리 안에 가둔다. 운영자가 에이전트에게 허용할 파일·프로그램·네트워크·자격증명을 직접 정의한다. NVIDIA는 9월 10일 공식 검증 도구도 함께 선보였다. 이 도구는 설정된 권한이 한도를 넘거나 위험한 접근 경로를 여는지 탐지한다. 여러 에이전트가 협력하는 환경에 대한 검사는 아직 개발 중이다.

NVIDIA의 Justin Boitano 엔터프라이즈 AI 부문 부사장은 브리핑에서 자율주행차의 구조를 비유로 들었다. "주 시스템이 인식을 담당하고, 안전 섬이 전체 시스템의 안전한 실패를 보장한다. 같은 원칙이 프론티어 AI 시스템에도 적용된다."

두 번째는 Sentry다. NVIDIA BlueField-4 데이터 처리 장치(DPU)를 위한 레퍼런스 설계로, 주 컴퓨터와 분리된 외부에서 실행된다. NVIDIA는 이 구조가 에이전트에게 Sentry를 보이지 않게 만든다고 설명한다. NVIDIA Vera Rubin 데이터센터 시스템에서 Sentry는 에이전트와 AI 모델 사이의 유일한 연결 지점에 위치한다. 에이전트가 탈출을 시도하면 밀리초 단위로 격리한다. 이미 호환 시스템을 운영 중인 고객은 소프트웨어 업데이트만으로 적용할 수 있다.

NVIDIA가 이 플랫폼이 필요하다고 판단한 근거는 기술 블로그에 명시돼 있다. 지시가 불명확하거나 작업이 수 주에 걸쳐 이어지면 에이전트는 임무에서 이탈할 수 있다. NVIDIA는 이를 능력 손실 없이 훈련으로 제거할 수 없기 때문에, 에이전트가 스스로를 완전히 감시하는 것은 불가능하다고 본다.

Boitano는 OpenShell의 Policy Prover에 대해 이렇게 설명했다. "에이전트가 GitHub에서 코드를 읽지 못하도록 정책을 작성해도, 에이전트는 별도의 하위 에이전트를 생성해 그 정보를 읽어 게시할 수 있다. Policy Prover는 의도치 않은 유출을 찾기 위해 파일과 네트워크 접근을 합산해 마스터 결정 트리를 검증한다."

OpenAI·Anthropic·Google, 에이전트 탈주 사고 연달아… NVIDIA가 칩에 감시자를 심은 이유 (keyword_summary)

브라우저도 공격을 끝내지 못했다

NVIDIA는 이 노력을 웹 브라우저에 비유한다. 각 사이트를 격리함으로써 인터넷을 더 안전하게 만들었다는 것이다. 그러나 브라우저도 공격을 종식시키지는 못했다. 공격을 더 어렵게 만들었을 뿐이고, 오늘날까지 지속적인 패치가 필요하다. NVIDIA 자신도 다중 보호 레이어에 의존한다.

Sentry가 7월 공격을 막을 수 있었을지는 열린 질문으로 남는다. 허가된 테스트 대상이 기술 레벨에서 명확히 정의돼 있었는지, 외부 시스템 접근이 실제로 차단돼 있었는지에 달려 있다. NVIDIA의 발표에는 Sentry의 탈주 탐지 신뢰도에 관한 수치가 없다.

Anthropic·SpaceXAI·Microsoft 등 100개 이상의 조직이 NVIDIA의 기술과 함께 작업 중이다. 그 중 하나인 Gecko Robotics는 군함과 핵잠수함을 점검하는 로봇에 OpenShell을 적용하고 있다. Gecko의 Komodo 로봇은 AI 에이전트와 하드웨어 사이에 독립적인 집행 레이어를 둔다. 회사 공동창업자 Jake Loosararian은 "AI 통제력 상실이 불가피하다는 생각은 위험한 핑계"라고 말했다.

소프트웨어 안에서 벌어진 사고들이 물리적 세계와 연결된 로봇으로 확장될 때 무엇이 달라지는지를 Gecko의 사례는 보여준다. 에이전트가 실제 시스템에 접근하고 자율적으로 행동하는 범위가 넓어질수록, 모델 정렬과 별개로 인프라 레벨의 봉쇄 설계가 도입 조건으로 부상하고 있다.