微软发布三款语音AI模型,实时转文字准确率登顶测评榜首
微软于当地时间10月1日发布三款新的语音AI模型,包括实时语音转文字模型MAI-Transcribe-2-Streaming,以及文本转语音模型MAI-Voice-2.1和MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming在AI基准测试平台Artificial Analysis的流式语音识别测试中,以2.5%的词错误率(WER)和约0.13秒的延迟,超越SpaceXAI Grok Voice Transcribe 2.0,拿下准确率第一。该模型支持60种语言,年末前优惠价为每小时0.54美元。MAI-Voice-2.1支持23种语言,可跨语言保持声音一致,售价为每100万字符22美元;MAI-Voice-2.1-Flash则以更低延迟和15美元的每100万字符价格面向成本敏感型应用,推理速度提升55%。
暂无AI深度解读,点击上方「AI解读」按钮,即刻生成一份全新解读
免责声明:本内容仅代表作者个人观点,不构成任何投资理财建议。
24小时热榜
-
1
特朗普宣布与六大AI巨头达成自愿性AI协议,英伟达黄仁勋与扎克伯格推动自监管
-
2
彭博市场:投资者推高政府债券收益率有十大原因
-
3
NVIDIA GB300量产与AI算力流:电力缺口成2026年产业布局关键
-
4
日本央行《主要意见》暗示加息,通胀目标渐近
-
5
澳大利亚莱纳斯稀土将以约9.68亿澳元(6.72亿美元)全股票交易收购Meteoric资源,以获取巴西关键矿产矿床
-
6
日本第3季度日银短观大型制造业指数 24,预期 25,前值 22,低于预期
-
7
独立分析师MBI称体验Meta AI后清仓Airbnb,认为AI将颠覆互联网平台商业模式
-
8
FNF币:FunFi项目现状与投资风险解析
-
9
HER币多重身份解析:HeroVerse、HeroNode与HerityNetwork代币辨析及交易渠道
-
10
Flare首席执行官称XRP在巴西整合背景下价格下跌是“荒谬”
今日行情
推荐阅读





