मॉडल

Microsoft ने नई मॉडल्स के साथ रीयल‑टाइम ट्रांसक्रिप्शन और स्पीच आउटपुट जारी किया

5 अक्टूबर 2026 · 1 मिनट पठन

इन भाषाओं में भी प्रकाशित עברית, 한국어, Norsk

a star filled sky
Aedrian Salazar / Unsplash

Microsoft ने MAI‑Transcribe‑2‑Streaming नामक एक नया मॉडल जारी किया है जो रीयल‑टाइम ट्रांसक्रिप्शन करता है। यह मॉडल 60 भाषाओं को ट्रांसक्राइब करता है और लगभग 100 मिलीसेकंड के बाद प्रारंभिक परिणाम देता है, जिससे वॉयस एजेंट एक वाक्य के दौरान ही प्रतिक्रिया दे सकते हैं।

इसके अलावा, दो नए स्पीच आउटपुट मॉडल भी उपलब्ध हैं: MAI‑Voice‑2.1 23 भाषाओं में एक ही आवाज़ और मूलभूत उच्चारण के साथ बोलता है, जबकि MAI‑Voice‑2.1‑Flash 150 मिलीसेकंड की विलंबता के साथ काम करता है। दोनों मॉडल कुछ सेकंड के संदर्भ ऑडियो से आवाज़ क्लोन कर सकते हैं और दुरुपयोग रोकने के लिए सुरक्षा तंत्र शामिल हैं।

ये मॉडल Microsoft Foundry, MAI Playground और OpenRouter के माध्यम से उपलब्ध हैं। एक परीक्षण में लगभग आधे 4,000 प्रतिभागियों ने क्लोन की गई आवाज़ों को मानव आवाज़ के रूप में पहचाना।