중국 AI 연구팀 AllSpark가 오픈웨이트 검색 에이전트 Iris-mini(35B)와 Iris-pro(397B)를 공개했다. 두 모델은 각각 Alibaba의 Qwen 시리즈를 파인튜닝한 것으로, 같은 파라미터 규모 오픈웨이트 검색 에이전트 가운데 최고 성능을 기록했다고 팀은 밝혔다.

▼ Iris-mini vs Iris-pro 핵심 스펙

항목Iris-miniIris-pro
파라미터35B397B
기반 모델Qwen3.6-35B-A3BQwen3.5-397B-A17B
컨텍스트 창256,000 토큰256,000 토큰
가중치 공개

▼ 벤치마크 점수 비교 (컨텍스트 관리 적용)

벤치마크Iris-miniIris-pro비고
BrowseComp82.288.6mini, 동급 2위 대비 +3.4점
BrowseComp-ZH84.885.1-
DeepSearchQA86.992.9mini, 동급 최고 아님
Humanity's Last Exam52.356.4학문적 추론 비중 높음

Iris-mini는 4개 벤치마크 중 3개에서 동급 1위를 차지했다. DeepSearchQA에서만 XYZ-Aquila-mini에 뒤처졌다. Iris-pro는 대형 모델 클래스에서 선두 또는 공동 1위를 기록했으며, 훨씬 많은 컴퓨팅을 요구하는 시스템에 근접한 점수를 냈다.

학습 방식: 웹 링크 구조에서 역설계

훈련 데이터는 웹 페이지의 링크 구조를 역방향으로 분석해 만든다. 시드 페이지와 외부 링크로 용어·관계 그래프를 구성하고, 여러 단계를 거쳐야 답을 찾을 수 있는 다단계 질문을 생성한다. 최종 답을 제외한 모든 용어는 다른 표현으로 바꿔 단순 텍스트 검색으로는 풀 수 없게 만든다.

학습은 "SFT-RL 클라이밍" 방식으로 진행된다. 지도 학습(SFT)과 강화학습(RL)을 교대로 적용하며, 각 라운드에서 가장 어렵게 풀린 문제와 가장 효율적인 풀이 경로를 다음 사이클에 재투입한다. 강화학습 단계는 실시간 웹 검색을 대상으로 이뤄지며, 외부 서비스에 의존하지 않도록 팀 자체 Qwen 모델을 학습 클러스터 안에서 실행한다.

컨텍스트 관리가 모델 차이보다 클 수 있다

AllSpark 팀은 벤치마크에서 컨텍스트 관리 기법이 모델 간 성능 차이보다 더 큰 영향을 미칠 수 있다고 주장한다. 팀은 도구·컨텍스트 한도·판정 모델을 고정한 채 컨텍스트 관리 적용 여부만 바꿔 모든 벤치마크를 측정했다.

Iris-mini는 같은 작업에 더 많은 단계가 필요해 컨텍스트 한도에 더 자주 도달한다. 컨텍스트 관리를 켰을 때 BrowseComp 점수가 최대 21.2점 오른 것도 이 때문이다. Iris-pro는 상대적으로 컨텍스트 소비 속도가 느려 관리 효과가 작다.

공개 범위와 향후 계획

Iris-mini·Iris-pro의 가중치는 Hugging Face 컬렉션에, 코드는 GitHub에 공개됐다. 현재 공개된 Iris Harness에는 에이전트 루프·도구·컨텍스트 관리 전략·4개 벤치마크 평가 코드가 포함된다. 이 하네스는 OpenAI 호환 엔드포인트라면 어디에나 연결할 수 있다. 데이터 구성 및 학습 파이프라인은 추후 공개 예정이다.

국내에서 오픈웨이트 검색 에이전트 도입을 검토하는 팀이라면 파라미터 규모별 성능·리소스 요구사항 참고 자료로 활용할 수 있다. 35B급은 단일 고성능 GPU 서버에서도 운용 가능한 반면, 397B급은 멀티노드 환경이 필요하다.