מודלים

מיקרוסופט AI משיקה מודלים חדשים להמרה טקסטואלית ודיבור עבור סוכני שפה

4 באוקטובר 2026 · קריאה של 1 דק׳

a close up of a red and black graphics card
Rohan / Unsplash

מיקרוסופט AI השיקה את MAI-Transcribe-2-Streaming, מודל חדש להמרה טקסטואלית בזמן אמת. לפי מיקרוסופט, המודל תופס את המקום הראשון ב-Artificial Analysis מבחינת דיוק. המודל מבצע המרה עבור 60 שפות ומספק תוצאות ראשוניות לאחר כ-100 מילישניות. כך יכולים סוכני שפה להגיב כבר במהלך המשפט.

בנוסף, הושקו שני מודלים חדשים להוצאת דיבור: MAI-Voice-2.1 מדבר ב-23 שפות באותה קול עם מבטא ילידי. הגרסה MAI-Voice-2.1-Flash משיגה ליקוי של 150 מילישניות ומחירה 15 דולר עבור מיליון תווים, במקום 22 דולר.

שני המודלים יכולים לשכפל קולות מכמה שניות של אודיו ייחודי, כאשר מנגנוני הגנה מובנים מונעים שימוש לרעה. המודלים זמינים בין היתר דרך Microsoft Foundry ו-MAI Playground, והמודלים המדוברים גם דרך OpenRouter. בניסוי, כ-50% מתוך 4,000 המשתתפים חשבו שהקולות שייכים לאדם.