현지 시간 8월 26일, 구글은 최신 음성-텍스트 변환 모델인 Gemini 3.5 Transcribe를 출시했습니다. 이 모델은 인식 정확도를 높일 뿐만 아니라 화자의 의도를 이해하는 능력을 갖추고 있어, 자기 수정, 말버릇 삭제를 자동으로 인식하고 비정형적인 구어를 형식화된 텍스트로 변환할 수 있습니다. 구글은 이를 "가장 정확한" 모델이라고 칭하며, 이미 Android용 Gboard 및 Mac용 Gemini 앱에 도입되었고, Gemini API를 통해 개발자들에게 미리 보기를 제공하고 있습니다. 이번 출시는 Gemini 3.5 Live 및 Gemini 3.5 Live Experimental과 같은 날 출시되어 구글의 새로운 Gemini Audio 시리즈를 구성합니다. 분석가들은 음성 입력이 구글 제품에 빠르게 침투함에 따라, 음성 상호작용이 키보드 입력을 점차 대체하여 사용자와 AI 시스템을 연결하는 주요 방식이 될 것으로 보고 있습니다.