중국 AI 기업 DeepCybo가 피지컬 AI 기초 모델 PhysBrain 1.5를 공개했다. 구현 이해, 행동 생성, 미래 상태 예측을 하나의 자기회귀 백본에 통합한 모델로, 오픈웨이트와 코드를 함께 배포했다. 제목의 '오픈소스'는 가중치·코드 공개 기준이며, 학습 데이터는 비공개다.
28개 벤치마크 성적표
Qwen3-VL을 기반으로 액션 토큰과 시각 상태 토큰을 추가한 8B 체크포인트는 28개 공개 임베디드 벤치마크에서 종합 72.5점을 기록했다. DeepCybo가 공개한 점수표 기준으로 오픈소스 모델 중 1위를 주장하며, 독점 모델인 GPT-6 Astra(73.3점), Gemini 3.6 Flash(73.0점)와 약 1점 차 안에 든다고 밝혔다.
28개 벤치마크 중 14개에서 오픈소스 1위, 10개에서 2위를 기록했다. 측정 범위는 시각·공간 지각, 다중 시점 추론, 임베디드 플래닝, 어포던스 그라운딩, 시각 추적 과제에 걸쳐 있다.
▼ PhysBrain 1.5 주요 모델 비교
| 모델 | 유형 | 종합 점수 | 파라미터 |
|---|---|---|---|
| GPT-6 Astra | 독점 | 73.3 | - |
| Gemini 3.6 Flash | 독점 | 73.0 | - |
| PhysBrain 1.5-8B | 오픈웨이트 | 72.5 | 8B |
| PhysBrain 1.5-2B | 오픈웨이트 | 66.6 | 2B |
경량 버전인 PhysBrain 1.5-2B는 같은 평가 스위트에서 66.6점으로, 순위 경쟁보다는 현장 배포용 모델로 포지셔닝했다.
아키텍처: 단일 목표, 닫힌 루프
PhysBrain 1.5의 학습 구조는 '관찰→추론·그라운딩→행동→세계 변화 예측'의 닫힌 피지컬 루프다. 언어 답변, 공간 구조, ActionPiece 토큰 기반 엔드이펙터 궤적, RGB·깊이·로봇 마스크 프레임을 별도 태스크 헤드 없이 단일 다음 토큰 예측 목표로 처리한다.
사전학습 데이터는 1인칭, 1인칭-3인칭 혼합, 파노라마 등 인간 상호작용 영상이다. 지도 미세조정 단계에서는 인간 시연 데이터, 실제 로봇 궤적, 시뮬레이션 데이터를 DeepCybo의 Human-as-Humanoid 액션 브리지로 혼합했다.
경쟁 오픈소스 모델과의 위치
Intern W0, Motus2, Cog-WM 등 이미 유통 중인 중국 오픈 임베디드 모델과 비교해, PhysBrain 1.5는 단일 로봇 정책 시연이 아닌 다중 벤치마크 기초 모델로 포지셔닝한다.
가중치, 기술 보고서, 평가 키트는 Hugging Face와 GitHub의 DeepCybo / PhysBrain 1.5 프로젝트 페이지에서 내려받을 수 있다.
국내 임베디드 AI 개발자 관점
국내 임베디드 AI·로봇 제어 모델 개발팀이라면 오픈웨이트와 평가 키트를 직접 받아 자체 로봇팔에서 ActionPiece 전이 성능을 검증하는 것이 먼저다. 72.5 종합 점수는 리더보드상 독점 모델과의 근접성이 곧 플러그앤플레이 조작 성능을 의미하지 않으므로, 출발점 벤치마크로 다뤄야 한다.








