Microsoft AI가 실시간 전사 모델 MAI-Transcribe-2-Streaming을 공개했다. 음성 에이전트용으로 내놓은 모델이다. 텍스트 음성 변환(TTS) 모델 2종도 함께 나왔다.
전사 모델: 60개 언어, 첫 결과 100ms 남짓
▼ MAI-Transcribe-2-Streaming 핵심 정보 (출처: Microsoft 발표, The Decoder 보도)
| 항목 | 내용 |
|---|---|
| 지원 언어 | 60개 |
| 첫 부분 결과 지연 | 100ms 남짓 |
| 정확도 | Artificial Analysis 1위(Microsoft 주장) |
| 도입가(1시간 오디오, $) | 0.54 (연말까지) |
Microsoft는 이 모델이 Artificial Analysis의 정확도 순위에서 1위라고 밝혔다. 회사 측 주장이다.
첫 부분 결과가 나오기까지 100ms를 조금 넘는다. Microsoft는 덕분에 음성 에이전트가 상대방이 말을 끝내기 전에 반응을 시작할 수 있다고 설명했다. 오디오 1시간당 요금은 연말까지 도입가 0.54달러다.
음성 합성 모델 2종: 23개 언어, 목소리 복제
▼ 신규 TTS 모델 정보 (출처: Microsoft 발표, The Decoder 보도)
| 항목 | MAI-Voice-2.1 | MAI-Voice-2.1-Flash |
|---|---|---|
| 지원 언어 | 23개 | - |
| 지연(ms) | - | 150 |
| 가격(100만 자당, $) | 22 | 15 |
MAI-Voice-2.1은 23개 언어를 같은 목소리로 말하도록 설계했다. 언어마다 원어민 억양을 구현한다는 설명이다. Flash 변형은 지연이 150ms이고, 가격은 100만 자당 15달러로, 기본 모델의 22달러보다 낮다.
두 음성 모델 모두 몇 초 분량의 참고 음성만으로 목소리를 복제할 수 있다. 오용을 막는 안전장치도 내장했다. 4,000명이 참여한 한 테스트에서는 약 절반이 합성 음성을 실제 사람 목소리로 판단했다.
이용 경로와 한국어 확인 사항
모델은 Microsoft Foundry와 MAI Playground 등에서 쓸 수 있다. 두 음성 모델은 OpenRouter에서도 제공한다.
한국어 음성 서비스를 만드는 개발자가 확인할 대목이 있다. 소스에는 전사 모델이 60개 언어를 지원한다는 설명만 있고, 지원 언어 목록은 없다. 음성 합성 모델의 23개 언어도 마찬가지다. 한국어 포함 여부는 확인되지 않았으므로 Microsoft 공식 문서에서 직접 확인해야 한다.








