중국 AI 연구팀 AllSpark가 오픈웨이트 검색 에이전트 Iris-mini(35B)와 Iris-pro(397B)를 공개했다. 두 모델은 각각 Alibaba의 Qwen 시리즈를 파인튜닝한 것으로, 같은 파라미터 규모 오픈웨이트 검색 에이전트 가운데 최고 성능을 기록했다고 팀은 밝혔다.
▼ Iris-mini vs Iris-pro 핵심 스펙
| 항목 | Iris-mini | Iris-pro |
|---|---|---|
| 파라미터 | 35B | 397B |
| 기반 모델 | Qwen3.6-35B-A3B | Qwen3.5-397B-A17B |
| 컨텍스트 창 | 256,000 토큰 | 256,000 토큰 |
| 가중치 공개 | ⭕ | ⭕ |
▼ 벤치마크 점수 비교 (컨텍스트 관리 적용)
| 벤치마크 | Iris-mini | Iris-pro | 비고 |
|---|---|---|---|
| BrowseComp | 82.2 | 88.6 | mini, 동급 2위 대비 +3.4점 |
| BrowseComp-ZH | 84.8 | 85.1 | - |
| DeepSearchQA | 86.9 | 92.9 | mini, 동급 최고 아님 |
| Humanity's Last Exam | 52.3 | 56.4 | 학문적 추론 비중 높음 |
Iris-mini는 4개 벤치마크 중 3개에서 동급 1위를 차지했다. DeepSearchQA에서만 XYZ-Aquila-mini에 뒤처졌다. Iris-pro는 대형 모델 클래스에서 선두 또는 공동 1위를 기록했으며, 훨씬 많은 컴퓨팅을 요구하는 시스템에 근접한 점수를 냈다.
학습 방식: 웹 링크 구조에서 역설계
훈련 데이터는 웹 페이지의 링크 구조를 역방향으로 분석해 만든다. 시드 페이지와 외부 링크로 용어·관계 그래프를 구성하고, 여러 단계를 거쳐야 답을 찾을 수 있는 다단계 질문을 생성한다. 최종 답을 제외한 모든 용어는 다른 표현으로 바꿔 단순 텍스트 검색으로는 풀 수 없게 만든다.
학습은 "SFT-RL 클라이밍" 방식으로 진행된다. 지도 학습(SFT)과 강화학습(RL)을 교대로 적용하며, 각 라운드에서 가장 어렵게 풀린 문제와 가장 효율적인 풀이 경로를 다음 사이클에 재투입한다. 강화학습 단계는 실시간 웹 검색을 대상으로 이뤄지며, 외부 서비스에 의존하지 않도록 팀 자체 Qwen 모델을 학습 클러스터 안에서 실행한다.
컨텍스트 관리가 모델 차이보다 클 수 있다
AllSpark 팀은 벤치마크에서 컨텍스트 관리 기법이 모델 간 성능 차이보다 더 큰 영향을 미칠 수 있다고 주장한다. 팀은 도구·컨텍스트 한도·판정 모델을 고정한 채 컨텍스트 관리 적용 여부만 바꿔 모든 벤치마크를 측정했다.
Iris-mini는 같은 작업에 더 많은 단계가 필요해 컨텍스트 한도에 더 자주 도달한다. 컨텍스트 관리를 켰을 때 BrowseComp 점수가 최대 21.2점 오른 것도 이 때문이다. Iris-pro는 상대적으로 컨텍스트 소비 속도가 느려 관리 효과가 작다.
공개 범위와 향후 계획
Iris-mini·Iris-pro의 가중치는 Hugging Face 컬렉션에, 코드는 GitHub에 공개됐다. 현재 공개된 Iris Harness에는 에이전트 루프·도구·컨텍스트 관리 전략·4개 벤치마크 평가 코드가 포함된다. 이 하네스는 OpenAI 호환 엔드포인트라면 어디에나 연결할 수 있다. 데이터 구성 및 학습 파이프라인은 추후 공개 예정이다.
국내에서 오픈웨이트 검색 에이전트 도입을 검토하는 팀이라면 파라미터 규모별 성능·리소스 요구사항 참고 자료로 활용할 수 있다. 35B급은 단일 고성능 GPU 서버에서도 운용 가능한 반면, 397B급은 멀티노드 환경이 필요하다.








