Google が2026年8月26日、音声認識モデル Gemini 3.5 Transcribe を発表した1。提供は Gemini API(Google AI Studio)と Gemini Enterprise Agent Platform での公開プレビューで、APIは用途別に2系統に分かれる。対話型アプリ向けにサブ秒の遅延で双方向にやり取りする Live API の gemini-3.5-transcribe-live と、録音音声を話者の割り当てと単語単位のタイムスタンプ付きで書き起こす Interactions API の gemini-3.5-transcribe である1。
精度は Artificial Analysis の計測として、平均の単語誤り率(WER)がストリーミングで4.0%、非ストリーミングで2.6%だとしている1。85言語以上を自動検出し、言い直しの処理とフィラーの除去も行う。話者の割り当ては録音音声で最大3話者まで対応し、3話者以上のサポートは実験的だと Google は記載している1。Android の Gboard「Rambler」と macOS 版 Gemini アプリでは既に使われており、Chrome への展開は近日、価格の記載はない1。
Sources
- Intelligent transcription with Gemini 3.5 Transcribe - Google公式ブログ(2026年8月26日)