現地時間8月26日、Googleは最新の音声認識モデルGemini 3.5 Transcribeを発表しました。このモデルは、認識精度を向上させるだけでなく、話者の意図を理解する能力も備えており、自己修正や口癖を自動的に認識して削除し、非構造化された話し言葉をフォーマットされたテキストに変換することができます。Googleはこれを「これまでで最も正確な」モデルと称しており、すでにAndroid版GboardおよびMac版Geminiアプリに導入され、Gemini APIを通じて開発者向けにプレビューが公開されています。この発表は、Gemini 3.5 LiveおよびGemini 3.5 Live Experimentalと同時に行われ、これらがGoogleの新しいGemini Audioシリーズを構成します。アナリストは、音声入力がGoogle製品に急速に浸透するにつれて、音声インタラクションがキーボード入力を徐々に置き換え、ユーザーとAIシステム間の主要な接続方法になる可能性があると見ています。