微软于当地时间10月1日发布三款新的语音AI模型,包括实时语音转文字模型MAI-Transcribe-2-Streaming,以及文本转语音模型MAI-Voice-2.1和MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming在AI基准测试平台Artificial Analysis的流式语音识别测试中,以2.5%的词错误率(WER)和约0.13秒的延迟,超越SpaceXAI Grok Voice Transcribe 2.0,拿下准确率第一。该模型支持60种语言,年末前优惠价为每小时0.54美元。MAI-Voice-2.1支持23种语言,可跨语言保持声音一致,售价为每100万字符22美元;MAI-Voice-2.1-Flash则以更低延迟和15美元的每100万字符价格面向成本敏感型应用,推理速度提升55%。