微軟於當地時間10月1日發佈三款新的語音AI模型,包括實時語音轉文字模型MAI-Transcribe-2-Streaming,以及文本轉語音模型MAI-Voice-2.1和MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming在AI基準測試平台Artificial Analysis的流式語音識別測試中,以2.5%的詞錯誤率(WER)和約0.13秒的延遲,超越SpaceXAI Grok Voice Transcribe 2.0,拿下準確率第一。該模型支持60種語言,年末前優惠價為每小時0.54美元。MAI-Voice-2.1支持23種語言,可跨語言保持聲音一致,售價為每100萬字符22美元;MAI-Voice-2.1-Flash則以更低延遲和15美元的每100萬字符價格面向成本敏感型應用,推理速度提升55%。