독일 KI 연방협회(KI Bundesverband)가 주도하는 연구 컨소시엄이 7월 13일 오픈소스 언어모델 Soofi S 30B-A3B를 공개했다. 완전 공개 모델 가운데 영어·독일어 벤치마크 종합 점수 모두 1위다. Allen Institute의 OLMo 3 32B, ETH 취리히·EPFL의 Apertus 70B를 앞질렀다.

모델 전체 파라미터는 31.6B이지만, 토큰 생성 시 활성화되는 파라미터는 약 3.2B에 불과하다. 혼합전문가(MoE) 구조다. NVIDIA Nemotron 3 Nano 아키텍처를 그대로 채택했으며, Mamba-2 레이어와 표준 어텐션 레이어를 결합한 하이브리드 설계다. 52개 레이어 중 KV 캐시를 유지하는 레이어는 6개뿐이다.

이 구조 덕분에 컨텍스트가 길어져도 처리 속도가 거의 유지된다. 40,000 토큰 컨텍스트에 병렬 요청 32개 기준으로, 14B~24B 파라미터 범위의 밀집 모델 대비 GPU당 초당 토큰 생성량이 약 8배 높다. 4,000~256,000 토큰 구간에서 처리량이 거의 평탄하게 유지된다. 유사한 거동을 보이는 모델은 Alibaba의 Qwen3.5 35B-A3B뿐이다.

학습 데이터는 총 약 27조 토큰, 3단계로 구성된다. 1단계 약 20조 토큰(웹·코드·수학·전문 텍스트), 2단계 약 6조 토큰(고품질 소스), 3단계 최대 100만 토큰 길이의 장문 문서다. 독일어 비중은 1단계 7.2%에서 2단계 15.3%로 높아진다. NVIDIA Nemotron 기준 레시피에서 비영어권 전체가 약 5%인 것과 대비된다. 독일어 데이터 추가로 언어 능력이 Nemotron 기준 대비 15.1점, 과학 테스트 GPQA-Diamond에서 9.6점 향상됐다.

벤치마크에서 Soofi S는 16개 오픈 모델 비교에서 영어 종합 70.1점, 독일어 종합 79.1점으로 완전 공개 모델 중 전 항목 1위다. 코드 벤치마크에서는 HumanEval 73.8%, MBPP 70.2%, 독일어 MBPP 84.2%를 기록했다. 독일 지역 지식 테스트 INCLUDE-DE에서는 Qwen3.5 35B-A3B와 공동 1위(61.2점)다.

약점도 있다. 독일어 수학 경시 Minerva MATH-DE에서 56점으로 Qwen3.5 35B-A3B(76.5점)·Gemma 3 27B(65.6점)에 뒤처진다. 32,000 토큰 초과 구간에서 긴 텍스트 내 반복 단어 추출 적중률이 약 3%로 급락하는 것도 확인됐다. 연구팀은 장문 학습 데이터에 추출 과제용 합성 데이터가 부족한 탓으로 분석했다.

학습은 3월부터 5월까지 뮌헨 도이체텔레콤 산업용 AI 클라우드에서 최대 512개 NVIDIA B200 GPU를 사용해 진행됐다. 총 약 25만 3,000 GPU 시간이 투입됐다. 해당 시설은 전력 100% 재생에너지, Eisbach 운하 수냉 방식으로 운영되며 폐열을 인근 Tucherpark 지역에 공급한다. Soofi S는 이 인프라에서 진행된 첫 대규모 학습 사례 중 하나다.

컨소시엄에는 프라운호퍼 IAIS·IIS, 독일 인공지능연구센터(DFKI), TU 다름슈타트, 뷔르츠부르크대학교, L3S 연구센터, 베를린 응용과학대학교, Ellamind, Merantix Momentum이 참여한다. 독일 연방경제에너지부가 유럽 IPCEI-CIS 프로그램 일환으로 지원한다.

모델 가중치와 중간 체크포인트, 학습·평가 코드, 데이터 목록을 Hugging Face에 공개했다. 학습 데이터 중 Genios 코퍼스(독일어 신문 기사 1억 9,300만 건, 916개 매체)는 상업 라이선스 데이터로 전체의 약 1.3%를 차지한다. 이 때문에 모든 학습 토큰의 자유 배포를 요구하는 유럽 오픈데이터 정의 강화 제안은 충족하지 못한다. 약 99%는 독립 재현 가능하다고 밝혔다. 모델 라이선스는 아직 확정되지 않았다.

컨소시엄은 기술 문서·코드 생성·에이전트 시스템 응용을 위한 다음 단계 산업 파트너를 모집 중이다.