알리바바가 270억 파라미터 모델 Qwen3.8-27B를 Hugging Face에 공개했다. Apache 2.0 오픈소스 라이선스로 배포되며, 개발자는 가중치를 직접 내려받아 로컬 환경에 배포할 수 있다.
모델은 이미지·영상 이해, 262,144토큰 컨텍스트 윈도우, 코딩 및 에이전틱 워크플로를 지원한다. 알리바바는 이를 Qwen3.8 세대의 "소형·배포 친화적" 버전으로 규정했다.
하드웨어 요구사항
전체 16비트 정밀도 실행에는 GPU 메모리 약 56GB가 필요하다. FP8 버전은 약 28GB로 줄어든다. 4비트 양자화 시 모델 크기는 약 17GB로 압축돼 고사양 게이밍 데스크톱이나 노트북에서도 구동 가능한 수준이 된다.
국내에서 로컬 AI 서버를 구축할 경우, 4비트 양자화 기준 17GB VRAM 이상 GPU 1장으로 운용 가능해 도입 비용 산출의 기준선이 된다. 개발자 Simon Willison은 약 17GB 용량의 Q4_K_M 양자화 버전을 M5 Max MacBook Pro와 Nvidia DGX Spark에서 테스트했다. 코드 작성, 이미지 해석, Pi 에이전트 프레임워크를 통한 코딩 에이전트 루프 구동을 확인했다.
벤치마크 점수
알리바바 자체 발표 기준 SWE-bench Pro 61.7점, LiveCodeBench v6 90.3점, CoWorkBench 70.7점, OSWorld-Verified 84.3점이다. 제3자 벤치마크 기관 Artificial Analysis는 코딩·과학·추론·전문 과제 9개 항목을 종합한 Intelligence Index에서 52점을 부여했다. 이는 Artificial Analysis가 OpenAI의 클라우드 전용 모델 GPT-5.6 Luna(최고 추론 설정 기준)에 매긴 점수와 동일하다. Agentic Index에서는 51점으로 Anthropic이 3개월 전 출시한 Claude Opus 4.8을 앞섰다(최대 추론 설정 기준).
다만 알리바바의 일부 평가는 내부 기준이며, 비교 항목별 테스트 환경이 동일하지 않아 단순 비교에는 한계가 있다.
추론 비용 주의
Qwen3.8-27B는 기본적으로 xhigh 추론 설정으로 동작한다. Artificial Analysis 테스트에서 이 모델이 생성한 출력 토큰은 1억 6,000만 개로, 동급 오픈웨이트 모델 중앙값(4,300만 개)의 약 3.7배에 달했다. 추론 품질을 높이는 대신 토큰 소비가 크게 늘어나는 구조다. Willison의 테스트에서는 SVG 한 장 생성에 21분, 2만 2,000개 이상의 추론 토큰이 소비됐다. 일반 로컬 사용에는 추론 설정을 낮추거나 끄는 것이 권장된다.
Multi-Token Prediction(MTP) 활성화 시 llama.cpp 기준 약 72% 성능 향상이 보고됐다.
다운로드 현황
Cybernews에 따르면 공개 3일 만에 Hugging Face 다운로드 수가 300만 회를 돌파했다. Hugging Face 트렌딩 1위를 기록했으며, 양자화 버전 다수가 빠르게 배포됐다. Apache 2.0 라이선스로 vLLM, SGLang, TokenSpeed 등 주요 서빙 프레임워크와 호환된다. 알리바바는 100만 토큰 기본 컨텍스트와 내장 도구를 갖춘 관리형 Qwen Cloud 버전을 추후 출시할 예정이다.








