중국 AI 기업 StepFun이 Step 5 Preview를 공개했다. 총 파라미터 약 6,000억 개 규모의 희소 MoE(Mixture-of-Experts) 베이스 모델로, 토큰당 활성화 파라미터는 약 270억 개다.
API 접근은 즉시 가능하며, 모델 가중치는 10월 15일 오픈웨이트로 공개할 예정이다.
컨텍스트 윈도우는 100만 토큰이다. AI 코딩·소프트웨어 엔지니어링·금융 분석·전문 지식 업무 등 장기 에이전트 워크로드를 주요 타깃으로 설정했다. 텍스트와 이미지 입력을 모두 지원한다.
아키텍처는 네트워크를 넓히는 대신 92개 레이어의 좁고 깊은(narrow-deep) 트랜스포머 구조를 택했다. StepFun은 깊은 스택이 긴 프리필(prefill) 구간에서 암묵적 멀티홉 추론에 유리한 긴 정보 경로를 제공한다고 설명한다.
100만 토큰 세션의 실용성을 위해 블록 단위 토큰 병합을 결합한 Sparse Grouped-Query Attention을 도입했다. StepFun에 따르면 이 방식은 인덱서와 top-k 선택 비용을 밀집 기준 대비 약 8분의 1로 줄이면서 인접 선택 중복도 병합한다.
학습에는 온폴리시(on-policy) 장기 강화학습, MoE 라우팅 전반의 비트 단위 학습-추론 정합, 부하 인식 스케줄링, MTP-3 추측 디코딩, FP8 MoE, KV 캐시 오프로드 등을 적용했다. 장기 RL 엔드투엔드 가속은 3배 이상, 샘플 원장 손실은 1% 미만이라고 StepFun은 밝혔다.
Artificial Analysis 인텔리전스 인덱스 기준 Step 5 Preview의 점수는 약 44점이다. StepFun은 오픈웨이트 모델 상위권으로 분류한다.
API 가격은 입력 토큰 100만 개당 약 1달러(약 1,390원), 출력 토큰 100만 개당 약 2.7달러(약 3,740원)이며, 출력 속도는 초당 약 100토큰이다.
MoE 아키텍처와 장문 컨텍스트 처리 기술을 연구하는 국내 AI 기업에는 92레이어 깊이 설계, Sparse GQA의 비용 절감 수치, 온폴리시 RL 학습 방식이 설계 참고 지표가 될 수 있다.








