Microsoft a élargi sa gamme de modèles d’IA domestiques en lançant MAI-Transcribe-2-Streaming, son premier modèle de transcription en continu. Ce modèle transcrit la parole en temps réel, commençant à produire du texte environ 100 millisecondes après avoir reçu un signal audio. Il prend en charge 60 langues et détecte automatiquement la langue parlée, même si celle-ci change en cours de conversation. Le modèle analyse en continu le discours, révisant sa transcription au fur et à mesure que la phrase progresse. Cette fonctionnalité est adaptée aux applications ne tolérant aucun délai, comme la dictée, le sous-titrage en direct ou les assistants vocaux. La transcription débute avant la fin de la phrase, avec des hypothèses initiales générées peu après la réception de l’audio, puis affinées au fil de l’énoncé. Le modèle traite le flux audio au fur et à mesure qu’il arrive, sans attendre l’enregistrement complet, ce qui permet une transcription quasi immédiate tout en conservant une flexibilité pour évoluer au gré de la clarification du sens. Parallèlement à MAI-Transcribe-2-Streaming, Microsoft a dévoilé MAI-Voice-2.1 et MAI-Voice-2.1-Flash, deux modèles capables de transformer du texte en parole. MAI-Voice-2.1 peut s’exprimer dans 23 langues, en conservant la même voix avec des accents locaux selon les langues. La variante Flash privilégie la rapidité et peut générer 45 secondes d’audio avec une latence globale d’environ 150 ms. Ces modèles de synthèse vocale servent à créer des agents vocaux capables d’écouter, de réfléchir et de répondre à voix haute, comme dans le service client. Microsoft cherche à réduire les lacunes des assistants vocaux en intégrant MAI-Transcribe-2-Streaming avec ses modèles vocaux, permettant aux assistants de commencer à traiter les requêtes avant même que l’utilisateur n’ait terminé sa phrase. Cela pourrait favoriser des échanges plus naturels et des applications telles que des assistants multilingues, le service client ou la traduction vocale. Microsoft affirme que MAI-Transcribe-2-Streaming domine le classement AA-WER Streaming d’Artificial Analysis, aussi bien pour les transcriptions provisoires que finales. Ce classement repose sur le taux d’erreur de mots (WER), qui mesure la proportion de mots mal reconnus par rapport à une transcription de référence. Cependant, le benchmark s’appuie sur environ huit heures d’audio issues de trois ensembles de données et ne permet pas de comparer les performances du modèle dans chacune des 60 langues prises en charge. L’affirmation concernant la précision provient de tests internes, et Microsoft ne cite pas son concurrent le plus proche. Selon un rapport, Microsoft indique que sa transcription est deux fois plus rapide que celle de son concurrent le plus proche, bien que ce chiffre provienne de tests internes. Les trois modèles — MAI-Transcribe-2-Streaming, MAI-Voice-2.1 et MAI-Voice-2.1-Flash — sont désormais disponibles via Microsoft Foundry, MAI Playground, Vercel et Azure Voice Live. MAI-Transcribe-2-Streaming est proposé à un prix de lancement de 0,54 dollar par heure d’audio jusqu’à la fin 2026. Concernant la synthèse vocale, MAI-Voice-2.1 coûte 22 dollars par million de caractères, contre 15 dollars pour la variante Flash. Les deux modèles vocaux sont également accessibles via OpenRouter, avec une intégration avec LiveKit annoncée prochainement.