마이크로소프트 AI, 음성 인식 및 음성 출력 모델 출시
2026년 10월 5일 · 읽는 시간 1분
마이크로소프트 AI가 MAI-Transcribe-2-Streaming이라는 새로운 실시간 음성 인식 모델을 발표하였다. 마이크로소프트에 따르면, 이 모델은 인공지능 분석에서 정확도 1위를 차지하고 있다. 이 모델은 60개 언어를 인식하며, 약 100밀리초 후에 첫 번째 임시 결과를 제공한다. 따라서 음성 에이전트는 문장 도중에도 반응할 수 있다. 연말까지 오디오 1시간의 도입 가격은 0.54 달러이다.
새롭게 출시된 두 개의 음성 출력 모델인 MAI-Voice-2.1은 23개 언어를 동일한 목소리로, 각 언어의 원어민 억양으로 말할 수 있다. MAI-Voice-2.1-Flash 변형은 마이크로소프트에 따르면 150밀리초의 지연 시간을 달성하며, 백만 자당 15 달러의 가격에 제공된다.
두 모델은 몇 초의 참조 오디오로부터 목소리를 복제할 수 있으며, 내장된 보호 메커니즘이 악용을 방지한다. 이 모델들은 마이크로소프트 파운드리 및 MAI 플레이그라운드를 통해 제공되며, 두 음성 모델은 OpenRouter를 통해서도 이용 가능하다. 한 테스트에서 약 4,000명의 참가자 중 절반 정도가 이 목소리를 사람의 목소리로 인식하였다.