중국 빅테크 기업 Alibaba의 사이버보안 특화 거대언어모델 XekRung이 UC Berkeley 연구팀이 관리하는 취약점 재현 벤치마크 CyberGym 모델 트랙에서 88.9%를 기록하며 1위를 차지했다. 9월 13일 제출된 결과로, 중국 테크 매체들은 9월 28일 이를 중국 개발사 모델이 해당 리더보드 정상에 오른 첫 사례라고 보도했다.
CyberGym은 Google의 OSS-Fuzz 프로그램이 발굴한 취약점을 기반으로 188개 오픈소스 프로젝트의 실제 취약점 1,507개를 담고 있다. Level 1 평가에서 모델은 취약점 설명과 패치 전 코드베이스를 받아, 취약한 버전에서는 버그를 유발하되 패치된 버전에서는 그러지 않는 개념 증명(PoC) 입력값을 작성해야 한다. 리더보드는 단일 모델 트랙과 여러 모델·도구·메모리를 조합한 에이전트 시스템 트랙을 분리 운영하며, XekRung의 결과는 단일 모델 트랙 기준이다.
▼ CyberGym 모델 트랙 상위 5개 모델 비교
| 모델 | 개발사 | 성공률 (%) |
|---|---|---|
| XekRung-1.5-27B-Preview | Alibaba | 88.9 |
| Gemini 3.8 Flash Cyber | 86.3 | |
| GPT-5.5-Cyber | OpenAI | 85.6 |
| GLM-5.3 | Zhipu AI | 84.5 |
| DeepSeek-V4-Pro | DeepSeek | 83.3 |
벤치마크 운영팀은 점수가 각 팀 자체 제출 방식이며 실행 결과가 확률적이어서 소폭 격차는 실질적 성능 차이를 반영하지 않을 수 있다고 밝히고 있다.
XekRung-1.5-27B-Preview는 Alibaba의 오픈웨이트 모델 Qwen3.8-27B를 기반으로 미세조정됐다. Alibaba Security AGI Lab(황룽타오 총괄)에 따르면 기반 모델인 Qwen3.8-27B의 동일 설정 점수는 54.51%였으며, 사후 학습을 통해 34.39%p를 추가했다. 학습에는 Alibaba 자체 보안 운영에서 수집한 비식별화 궤적 데이터를 활용한 지도 미세조정(SFT), 범용 도구 프레임워크 내 에이전틱 강화학습, 빌드·크래시·PoC 검증 기반 보상 설계, 실패 시도의 교정 학습 데이터 재활용 등이 적용됐다. 팀 측은 CyberGym 태스크·패치·참조 PoC는 학습에 사용하지 않았다고 밝혔다.
평가는 256K 컨텍스트 윈도우, FP8 자체 호스팅 추론 환경에서 진행됐으며 퍼징 프레임워크는 사전 설치하지 않았고 네트워크 접근은 벤치마크 허용 목록으로 제한했다.
Alibaba는 효율성도 강조한다. 27B 모델이 비교 가능한 사이버 모델 대비 1/27에서 1/370 수준의 크기라고 밝혔으며, 이는 자동화 취약점 분류의 연산 비용을 낮출 수 있다는 의미다. XekRung 가중치는 아직 공개되지 않았고 외부 접근 일정도 정해지지 않았다. 황룽타오는 향후 보안 기술을 더 넓게 제공할 예정이며 차기 버전은 적대적 인텔리전스·자기진화·에이전틱 태스크를 목표로 한다고 밝혔다.
한국 보안 기업과 AI 개발팀 입장에서는, 사이버보안 특화 모델의 성능이 공개 벤치마크 순위로 가시화되는 흐름 자체가 자체 모델 개발 또는 도입 검토 시 참조 기준으로 활용될 수 있다.








