---
title: Microsoft AI presenta nuovi modelli per trascrizione e sintesi vocale
url: https://www.elseif.net/it/microsoft-ai-presenta-nuovi-modelli-per-trascrizione-e-sintesi-vocale
published: 2026-10-05T10:12:04+00:00
language: it
section: Modelli
source: https://the-decoder.de/microsoft-ai-bringt-neue-modelle-fuer-transkription-und-sprachausgabe-fuer-sprachagenten/
organizations: Microsoft
publisher: elseif
---

# Microsoft AI presenta nuovi modelli per trascrizione e sintesi vocale

Microsoft AI ha lanciato MAI-Transcribe-2-Streaming, un nuovo modello per la trascrizione in tempo reale. Secondo Microsoft, questo modello occupa il primo posto nell'analisi artificiale per quanto riguarda la precisione. Il modello è in grado di trascrivere 60 lingue e fornisce risultati preliminari dopo circa 100 millisecondi. Questo consente ai agenti vocali di rispondere già durante la pronuncia di una frase.

In aggiunta, sono stati introdotti due modelli di sintesi vocale: MAI-Voice-2.1, che parla in 23 lingue utilizzando la stessa voce e un accento nativo, e MAI-Voice-2.1-Flash, che secondo Microsoft raggiunge una latenza di 150 millisecondi e ha un costo di 15 dollari invece di 22 dollari per milione di caratteri.

Entrambi i modelli hanno la capacità di clonare voci da pochi secondi di audio di riferimento e sono dotati di meccanismi di protezione per prevenire abusi. I modelli sono disponibili attraverso Microsoft Foundry e il MAI Playground, con i due modelli vocali accessibili anche tramite OpenRouter. In un test, circa la metà dei 4.000 partecipanti ha ritenuto che le voci fossero umane.
