Microsoft AI meluncurkan model baru untuk transkripsi dan sprachausgabe untuk agen suara
5 Oktober 2026 · Baca 1 menit
Microsoft AI telah merilis model baru bernama MAI-Transcribe-2-Streaming untuk transkripsi waktu nyata. Menurut Microsoft, model ini menempati peringkat pertama dalam analisis buatan dalam hal akurasi. Model ini dapat mentranskripsikan 60 bahasa dan memberikan hasil sementara pertama setelah sekitar 100 milidetik, sehingga agen suara dapat merespons bahkan saat kalimat masih berlangsung. Hingga akhir tahun, biaya untuk satu jam audio adalah 0,54 dolar.
Dua model sprachausgabe baru juga diperkenalkan, yaitu MAI-Voice-2.1 yang dapat berbicara dalam 23 bahasa dengan suara yang sama dan aksen asli. Varian MAI-Voice-2.1-Flash dilaporkan mencapai latensi 150 milidetik dan harganya adalah 15 dolar untuk satu juta karakter, turun dari 22 dolar.
Kedua model ini dapat mengkloning suara dari beberapa detik audio referensi, dengan mekanisme perlindungan yang terintegrasi untuk mencegah penyalahgunaan. Model ini tersedia melalui Microsoft Foundry dan MAI Playground, serta model suara juga dapat diakses melalui OpenRouter. Dalam sebuah uji coba, sekitar setengah dari 4.000 peserta menganggap suara tersebut berasal dari manusia.