Zhipu AI가 8월 26일, 중국 개발자 커뮤니티에서 '뉴라이(牛来)'로 불리던 익명 모델 Ox Alpha의 정체를 GLM-5.3-Flash로 공식 확인했다.
이 모델은 정식 출시 전 OpenRouter와 OpenCode에서 무료 익명 테스트로 공개됐다. 5일 만에 50조 토큰 이상의 트래픽을 끌어모으며 두 플랫폼 모두에서 성장 기록을 세웠고, 이후 사용량은 DeepSeek의 두 배를 넘어섰다.
시장의 이목을 끈 건 Zhipu가 공개한 인프라 세부 사항이었다. 이 트래픽 전체가 Nvidia GPU가 아닌 중국산 칩으로 처리됐다는 것이다.
▼ GLM-5.3-Flash 핵심 스펙
| 항목 | GLM-5.3-Flash | 비고 |
|---|---|---|
| 전체 파라미터 | 3,200억 | MoE 구조 |
| 활성 파라미터 | 180억 | 전체의 약 5.6% |
| Intelligence Index | 57점 | Artificial Analysis 기준 |
| 비교 모델 점수 | Claude Opus 4.8 동급 | DeepSeek V4 Pro 상회 |
| 가격 | GLM-5.3의 약 10분의 1 | Claude Opus 4.8 대비 40분의 1 |
▼ 인프라 및 추론 엔진 전략
| 항목 | 내용 |
|---|---|
| 서빙 칩 | 중국산 칩 10만 기 이상 |
| 추론 프레임워크 | SGLang 기반 자체 엔진 |
| 양자화 방식 | W8A8, INT8/FP8/BF16 혼합 캐시 |
| 병렬화 | 노드 수준 텐서 병렬 |
| 아키텍처 | Encode-Prefill-Decode 분리 구조 |
| 성능 개선 | 동일 하드웨어 대비 초기 기준선의 3배 |
Zhipu는 기술 문서에서 "하드웨어 효율과 토큰당 비용이 주류 Nvidia GPU와 비교 가능한 수준에 도달했다"고 밝혔다. 반도체 리서치 기업 SemiAnalysis는 X(구 트위터)에서 "모든 요청이 중국산 칩으로 Nvidia 수준의 효율로 처리됐다는 것은 CUDA 해자가 다시 한번 시험받고 있다는 의미"라고 평했다. OpenAI의 자체 추론 칩 Jalapeño 발표에 이어 나온 발언이다.
칩 공급사는 공개되지 않았다. LatePost는 Huawei, Moore Threads, Hygon 등이 포함됐을 가능성을 보도했지만 Zhipu는 공급업체와 모델명 확인을 거부했다.
추론 엔진은 멀티모달 인코딩, 프롬프트 프리필, 토큰 단위 디코딩을 독립적으로 스케줄링 가능한 풀로 분리하는 프로덕션 아키텍처를 채택했다. 100만 토큰 컨텍스트 확장을 목표로 설계됐다.
GPU 수출 규제가 지속되는 상황에서 중국산 칩 기반 대규모 서빙 사례가 공개된 것은 한국 AI 업계에도 시사점이 크다. GLM-5.3-Flash는 중국 모델 가격 인상 흐름 속에서도 저비용 선택지로 포지셔닝하며, 국내 개발자들의 비용 효율적 모델 선택지를 넓히는 사례로 주목된다.








