Google、音声対話モデル「Gemini 3.8 Live」と推論版をAPIで一般提供 - 単価は2モデル共通

画像: Google公式ブログより

Google、音声対話モデル「Gemini 3.8 Live」と推論版をAPIで一般提供 - 単価は2モデル共通

Googleが2026年9月15日、音声対話モデルGemini 3.8 Liveと推論を強めた3.8 Live Extended Thinkingを発表し、Gemini APIで一般提供を始めた。料金表では2モデルが同じ単価で、会話を続けながらツールをバックグラウンドで実行できる。

Googleは2026年9月15日、音声で対話するモデル「Gemini 3.8 Live」と、推論を強めた「Gemini 3.8 Live Extended Thinking」の2モデルを発表した1。Gemini APIのリリースノートでは、両モデルとも同日付で一般提供(GA)になっている2。どちらもLive APIで使う、音声を入力して音声で返す(audio-to-audio)モデルである。

Googleは両モデルを「これまでで最も高度なライブ対話モデル」と位置づけ、開発者と企業に対しては本番運用に耐える音声エージェントの構成要素になるとしている1。

2つのモデルの分担

3.8 Liveはスケールとコスト効率を重視したモデルで、滑らかな対話と視覚情報の理解を組み合わせる。3.8 Live Extended Thinkingは複雑なタスク向けで、多段の推論を強めている1。Googleはリリースノートで、低遅延の音声エージェントの大半では3.8 Liveを既定の選択肢とし、会話の裏でより深い推論が必要な場合にExtended Thinkingを勧めている2。モデルIDはそれぞれ gemini-3.8-live と gemini-3.8-live-extended-thinking である。

3.8 Liveは視覚入力をほぼリアルタイムで処理し、対応する97言語を会話の途中で自動的に判別して切り替える。音声エージェントを組む側にとって大きいのは、ツールやAPIの呼び出しを会話と並行してバックグラウンドで実行できる点である。依頼を受けた時点で応答を返し、処理が終わるまで会話を続けられる1。リリースノートでも、関数呼び出しが既定で非同期になることを3.8 Liveの特徴に挙げている2。

Extended Thinkingは、推論と発話を同時に進める。「確認しますね」のような短い応答を先に返し、複数の手順からなるバックグラウンド処理の進み具合を話しながら伝えることで、会話の流れを途切れさせない設計だと説明されている1。

モデルカードによると、2モデルはGemini 3 Proをベースにしており、入力は音声・画像・動画・テキスト(コンテキストウィンドウは最大128K)、出力は音声とテキスト(最大64K)である。知識のカットオフは2025年1月で、既知の制限としてハルシネーションのほか、ときおりの遅延やタイムアウトが挙げられている3。

ベンチマークの数値はいずれもGoogleの発表による。3.8 Live Extended Thinkingは、Artificial AnalysisのSpeech to Speech Quality Indexで82.6を記録して総合1位、エージェント的なタスク完了では τ-Voice で68.6%、Sierraの τ-Voice-banking で35.1%、Big Bench Audioで97.7%とされる。3.8 LiveはSpeech Agent Arenaで2位だという1。

使える場所と料金

提供は同日から順次始まっている。開発者向けにはGemini APIとGoogle AI Studioで両モデルが使える。企業向けにはGemini Enterpriseでプライベートプレビューとして提供され、Gemini Enterprise for Customer Experienceへの提供は近日とされる1。

一般の利用者向けの入り口は2モデルで異なる。3.8 LiveはGoogle検索のSearch Liveに入る。Extended ThinkingはGeminiアプリのGemini Liveに加え、Google WorkspaceのDocsではGoogle AI ProとUltraの加入者、GmailとKeepではすべてのGoogle AI加入者が対象になる。Workspaceのビジネス顧客への提供は近日とされている1。

Gemini APIの料金ページでは、3.8 Live、3.8 Live Extended Thinking、3.1 Flash Live Previewの3モデルが1つの料金表にまとめて記載されており、モデル別の差は示されていない4。有料ティアの単価(100万トークンあたり)は次のとおりである。

項目有料ティアの単価
入力(テキスト)0.75ドル
入力(音声)3.00ドル、または1分0.005ドル
入力(画像・動画)1.00ドル、または1分0.002ドル
出力(テキスト、思考トークンを含む)4.50ドル
出力(音声、思考トークンを含む)12.00ドル、または1分0.018ドル

無料ティアでは入出力とも無料だが、無料ティアのデータは製品改善に使われ、有料ティアでは使われない。Google検索によるグラウンディングは、Gemini 3.x全体で共有する月5,000リクエストまで無料で、それを超えると1,000リクエストあたり14ドルかかる4。

出力の単価は思考トークンを含む形で示されている。推論を強めたExtended Thinkingを同じ単価で選べる一方、推論の分だけ出力トークンが増えれば、請求額は3.8 Liveより大きくなる可能性がある。どちらを既定にするかは、自分の会話シナリオで実際の消費量を測って決めることになるだろう。

GPT-Live 1との違い

音声エージェント向けモデルのAPI一般提供としては、OpenAIが9月10日に音声モデルGPT-Live 1をAPIで一般提供にしたばかりである。GPT-Live 1は推論とツール実行をバックエンドのモデルやエージェントに委譲して会話を続ける設計で、音声セッションに1分0.05ドルの秒課金がかかり、バックエンドのモデル利用とツール利用は別に課金される5。

Gemini 3.8 Liveは、モデル自身がツール呼び出しをバックグラウンドで実行しながら話す作りで、料金はトークン単価と、音声・映像の分単価で示されている14。課金の単位も、単価に含まれる範囲も違うため、2社の価格を分単価だけで並べて比べることはできない。

Google側では、9月2日にGemini 3.8 FlashとFlash Cyberが公開されてから2週間足らずで、音声対話向けの3.8が加わった。3.8 Liveは音声・映像・テキストを同時に扱うマルチモーダルな対話モデルで、Googleは開発者プラットフォームのAgora、LangChain、LiveKit、Pipecat、Vercelなどを通じてGemini Live APIで音声インターフェースを構築できると紹介している1。

なお、GoogleはAI製品が生成する音声にはすべてSynthIDの電子透かしを入れているとしている1。

Sources

  1. Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking - Google公式ブログ(2026年9月15日)
  2. Gemini API release notes - Gemini API公式リリースノート(2026年9月15日エントリ)
  3. Gemini 3.8 Audio (Live, Live Extended Thinking) - Model Card - Google DeepMind公式モデルカード
  4. Gemini Developer API pricing - Gemini API公式料金ページ
  5. GPT-Live 1 - OpenAI公式のモデルページ(比較対象)

最新のAIニュースをほぼ毎日更新しています。

RSSで購読する 更新をいち早くチェックできます。

他のキーワードで探す →