Google DeepMind가 실시간 음성 AI 모델 Gemini 3.8 Live와 3.8 Live Extended Thinking을 Gemini API와 Google AI Studio를 통해 개발자에게 공개했다.
Gemini 3.8 Live는 백그라운드에서 API를 호출하면서 시각 입력을 처리하고 동시에 음성 응답을 이어갈 수 있다. 97개 이상 언어를 지원하며, 샘플 앱은 GitHub에 공개됐다.
Extended Thinking 변형 모델은 Artificial Analysis Speech-to-Speech 리더보드에서 82.6%를 기록해 1위에 올랐다. OpenAI의 최신 GPT-Live-1 모델을 제치고 선두를 차지한 것이다.
▼ Gemini 3.8 Live vs GPT-Live-1 비용 비교
| 항목 | Gemini 3.8 Live | GPT-Live-1 |
|---|---|---|
| 오디오 입력 ($/분) | $0.005 | $0.05 |
| 오디오 출력 ($/분) | $0.018 | $0.05 |
| 1시간 대화 비용 ($) | 약 $1.38 | 최소 $3.00 |
| S2S 리더보드 순위 | 1위 (82.6%) | 2위 이하 |
입력 단가 기준으로 Gemini 3.8 Live는 GPT-Live-1 대비 90% 저렴하고, 1시간 대화 비용은 약 54% 낮다. 국내 개발자도 Gemini API를 통해 동일 조건으로 접근할 수 있다.
다만 GPT-Live-1은 동시에 듣고 말하는 완전 이중 통신(full duplex) 방식을 지원해 대화 자연스러움 면에서 여전히 앞선다는 평가다. 데모 영상 기준으로 음질도 GPT-Live-1이 우세한 것으로 전해진다.








