마이크로소프트는 현지 시간 10월 1일 실시간 음성-텍스트 변환 모델 MAI-Transcribe-2-Streaming과 텍스트-음성 변환 모델 MAI-Voice-2.1 및 MAI-Voice-2.1-Flash 등 3가지 새로운 음성 AI 모델을 출시했습니다. 이 중 MAI-Transcribe-2-Streaming은 AI 벤치마크 플랫폼 Artificial Analysis의 스트리밍 음성 인식 테스트에서 2.5%의 단어 오류율(WER)과 약 0.13초의 지연 시간으로 SpaceXAI Grok Voice Transcribe 2.0을 능가하며 정확도 1위를 차지했습니다. 이 모델은 60개 언어를 지원하며, 연말까지 시간당 0.54달러의 할인 가격으로 제공됩니다. MAI-Voice-2.1은 23개 언어를 지원하며, 언어 간 음성 일관성을 유지할 수 있으며, 100만 자당 22달러에 판매됩니다. MAI-Voice-2.1-Flash는 더 낮은 지연 시간과 100만 자당 15달러의 가격으로 비용에 민감한 애플리케이션을 대상으로 하며, 추론 속도가 55% 향상되었습니다.