マイクロソフトは現地時間10月1日、リアルタイム音声認識モデル「MAI-Transcribe-2-Streaming」と、テキスト読み上げモデル「MAI-Voice-2.1」および「MAI-Voice-2.1-Flash」の3つの新しい音声AIモデルを発表しました。このうち、MAI-Transcribe-2-Streamingは、AIベンチマークプラットフォームArtificial Analysisのストリーミング音声認識テストにおいて、単語誤り率(WER)2.5%、遅延約0.13秒を記録し、SpaceXAI Grok Voice Transcribe 2.0を上回り、精度で1位を獲得しました。このモデルは60言語に対応しており、年末までは1時間あたり0.54ドルの割引価格で提供されます。MAI-Voice-2.1は23言語に対応し、言語を跨いで音声の一貫性を保つことができ、100万文字あたり22ドルで販売されます。MAI-Voice-2.1-Flashは、より低遅延で、100万文字あたり15ドルの価格でコスト重視のアプリケーション向けに提供され、推論速度は55%向上しています。