Google、Gemini 3.8 Liveに映像で応答する「Live Avatar」を追加 - Gemini Enterprise向け

Google、Gemini 3.8 Liveに映像で応答する「Live Avatar」を追加 - Gemini Enterprise向け

Googleが2026年9月24日、Gemini 3.8 Liveに低遅延の映像生成を組み合わせたLive Avatarを発表。Gemini Enterpriseで提供され、Google CloudのブログはUSとEUのエンドポイントでGAとしている。カスタムアバターの作成は許可リスト制。

Googleは2026年9月24日、音声対話モデルGemini 3.8 Liveに映像で応答する「Live Avatar」を組み合わせた構成を発表した。ライブ対話の機能と低遅延のストリーミング映像をネイティブに結びつけるもので、企業とその利用者に向けた提供だと説明されている1。提供先はGemini Enterpriseで、Google Cloudのブログは、これがUSとEUのエンドポイントで一般提供(GA)になり、provisioned throughputやエンタープライズ向けのコンプライアンス、データガバナンスを伴うとしている2。

発表はGemini Audioチームの研究者とエンジニアの連名で出ており、前週のGemini 3.8 Liveの公開を受けたものだと位置づけられている1。本サイトでも9月15日発表のGemini 3.8 Liveと推論版を伝えたが、そこで報じた97言語の自動切り替えや、会話を続けたままツール呼び出しをバックグラウンドで走らせる非同期の仕組みは、今回の発表でもモデル側の能力として改めて挙げられている。今回付け加わったのは映像のほうだ。

言語を切り替えても口の動きが崩れない、という主張

Live Avatarについて、Googleは口の動きの正確な同期、自然な表情、滑らかなターンテイキングを挙げ、企業が仮想的な窓口をより対話的に広げられるようにするものだとしている1。会話の途中で言語を切り替えても、口の動きと表情がそれに合わせて変化し、97言語をまたいでも映像の忠実度が落ちたりずれが生じたりしないと説明されている。

Google Cloudのブログは、提供先をウェブ・モバイル・対話型キオスクと具体的に挙げ、割り込みが入っても会話の文脈やバックエンドの処理を落とさずに復帰できること、カメラ映像や画面共有を音声と同時に処理できることを特徴として並べている2。

技術仕様としては、Live APIはステートフルなWebSocket接続を使う。入力は16kHzのPCM音声、JPEG 1FPSの画像・動画、テキストで、出力は24kHzのPCM音声とテキスト、そしてアバターの場合はmp4の映像になる。モデルIDは gemini-3.8-live で、対応機能の一覧にLive avatarが入っている3。

カスタムアバターは許可リスト制で、出力にはSynthIDが入る

多様なプリセットのアバターが用意されているほか、組織が自前のアバターを持つこともできる。高品質な参照画像から、見た目やブランドの雰囲気、キャラクターの同一性を保ったまま、アニメーションして応答するアバターを生成する仕組みで、Google Cloudのデモの説明によれば、システム指示に加えて参照写真1枚と音声サンプルを与える手順になる2。

ただしカスタムアバターの作成は、現時点ではエンタープライズの許可リストを通った組織に限られる1。Google Cloudのブログはこれを、なりすましを防ぎ本人性を守るための措置として、厳格な許可リストと検証のプロセスの後ろに置いていると説明している。provisioned throughputやカスタムアバターの許可は、Google Cloudの営業担当に連絡して有効化する形になる2。

出力される音声と映像には、いずれも知覚できないSynthIDの透かしが入る。AIが生成したコンテンツを検出可能な状態に保ち、誤情報や誤った帰属を減らす助けにするためだと説明されている1。Googleは8月にも、Geminiの可視ウォーターマークをオフにできる設定を告知した際に、不可視のSynthIDは常に埋め込まれたままだとしていた。人の顔に見える映像を生成する機能で、透かしが選択制ではなく前提として置かれている点は、生成物を二次利用する運用を考えるときに効いてくる。

触れるのは当面Gemini Enterpriseの側だけ

今回の発表で分かるのは、Live Avatarが使えるのがGemini Enterpriseだということと、USとEUのエンドポイントがあるということまでで、3つの資料はいずれもLive Avatarの金額を示していない。プリセットのアバターが何種類あるかも示されていない。個人の開発者がすぐ触って試せる類のものではなく、導入は営業経由の手続きを含む。

Google Cloudのブログは、Gemini 3.8 Live Extended Thinkingについては private preview のままだとしている2。本サイトが9月16日の記事で伝えたGemini APIのリリースノートでは両モデルとも同日付でGAとされており、プラットフォームによって提供状態の表記が分かれている形になる。Extended Thinkingを前提に設計するなら、どの経路で使うつもりなのかを先に確かめておいたほうがよい。

導入例として、Google Cloudのブログには数社のコメントが載っている。たとえばEqual AIのCEOであるAkhilesh Damaraju氏は、同社のAIがインドの9言語で1日あたり100万件を超える通話を扱っており、Gemini 3.8 Liveによって割り込みの処理、多言語の会話、ツール呼び出しの信頼性が改善したと述べている2。いずれも各社自身の評価で、第三者による測定ではない。

映像の生成がエージェント型の動画理解やGemini 3.8 Flash系の展開と並んで積み上がってきたなかで、音声エージェントに顔を付ける選択肢が企業向けに開いた。カメラ映像を見ながら話す窓口を作ろうとしているなら、まず自社がGemini Enterpriseの枠に入っているかどうかが最初の分岐点になる。

Sources

  1. Introducing Gemini 3.8 Live with Live Avatar - Google公式ブログ(2026年9月24日)
  2. Power your agents: Gemini 3.8 Live with Live Avatar is now generally available - Google Cloud公式ブログ
  3. Live API overview - Gemini Enterprise Agent Platform公式ドキュメント(確認日: 2026年9月25日)

最新のAIニュースをほぼ毎日更新しています。

RSSで購読する 更新をいち早くチェックできます。

他のキーワードで探す →