OpenAI、新音声モデル「GPT-Live」を発表 - 聞きながら話すfull-duplexでChatGPT Voiceを刷新

OpenAIが2026年7月8日、新世代音声モデルGPT-Liveを発表。聞くことと話すことを同時に行うfull-duplex構造で、相槌や自然な割り込みが可能に。深い処理はGPT-5.5に委譲しながら会話を継続する。週1.5億人超が使うChatGPT Voiceの既定モデルとしてグローバル展開を開始。

OpenAI、新音声モデル「GPT-Live」を発表 - 聞きながら話すfull-duplexでChatGPT Voiceを刷新

OpenAIは2026年7月8日、新世代の音声モデル「GPT-Live」を発表しました1。AIとの会話を「本物の会話」に近づけることを狙ったモデルで、GPT-Live-1とGPT-Live-1 miniの2バージョンが同日からChatGPTユーザーに向けてグローバルに展開されています1。週に1.5億人以上が利用するChatGPTの音声機能(Voice・Dictation)の基盤が入れ替わる、影響範囲の大きいアップデートです1

最大の特徴は、聞くことと話すことを同時に行える「full-duplex(全二重)」アーキテクチャです1。従来のように発話の順番を待つのではなく、会話中に「うんうん」と相槌を打ち、ユーザーが考え込んでいるときは静かに待ち、必要なら途中で割り込む——といった、人間同士の会話に近いやり取りができます1

音声AIの3世代 - なぜ今までは不自然だったのか

OpenAIは今回の発表で、音声AIの進化を3つの世代に整理しています。初代のChatGPT Voiceは、音声認識(STT)→大規模言語モデル→音声合成(TTS)という3つのモデルを直列につなぐ「cascaded方式」でした。フロンティアモデルと初めて音声で話せるようになった一方、モデル間で情報が失われ、応答は遅くぎこちないものでした1

続くAdvanced Voice Modeは音声の処理と生成を単一モデルに統合し、遅延を大幅に減らしました。しかし発話の区切り(ターン)を沈黙で検出する方式のため、少し考え込んだだけで「発話終了」と誤認され、不自然なタイミングで割り込まれる問題が残っていました1

GPT-Liveはこれを、入力を処理しながら出力を生成し続ける連続的な構造に変えました。話す・聞き続ける・間を置く・割り込む・ツールを呼ぶといった判断を毎秒何度も行うため、テンポの速いやり取りや、その場で進むライブ翻訳も可能になっています1

会話しながら、裏でGPT-5.5が働く

もう1つの設計上の特徴が、会話と「深い処理」の分離です。Web検索や複雑な推論、エージェント的な作業が必要な質問では、GPT-Liveがタスクを背後のフロンティアモデルに委譲し、結果が出るまで会話を続けながら待ちます1。ローンチ時点で背後を担うのはGPT-5.5で、新しいモデルが出れば順次入れ替わる設計です1

推論の深さはInstant・Medium・Highの3段階から選べ、Medium/HighではGPT-5.5 Thinkingが使われます1。OpenAIの評価では、5〜10分の会話を比較する人間評価でGPT-Live-1がAdvanced Voice Modeより強く好まれたほか、科学的推論のGPQA、エージェント的Web検索のBrowseComp、電話サポート業務を模したτ³-Voice Telecomでも上回ったとしています1。会話の自然さだけでなく、AIエージェント的な実務能力を音声で引き出す方向性が明確です。

ChatGPT Voiceはどう変わるか

ユーザーから見える変化としては、Voiceボタンを押したときの体験がGPT-Live搭載版に置き換わります。相槌による傾聴、考え込んだときに待ってくれる挙動、周囲の雑音への耐性向上、9種類の音声のリマスターなどが挙げられています1。会話中に天気・株価・スポーツなどの情報をビジュアルカードで表示する機能も加わりました1

提供プランは、有料のGo/Plus/ProユーザーにはGPT-Live-1が、無料ユーザーにはGPT-Live-1 miniが既定モデルになります12。iOS・Android・ChatGPT.comでの展開が始まっており、APIへの提供も近日中に予定されています1

制限もあります。ローンチ時点では映像や画面共有との併用に対応せず(対応予定)、一部の言語ではアクセントや流暢さに課題が残るとしています1。従来のStandard/Advanced Voice Modeも当面は利用可能です1

音声ならではの安全対策

リアルタイムに進む音声会話は、テキストと違い「出力してから対処する」ことができません。OpenAIはGPT-Liveに、発話中に動作する安全機構を組み込みました。危険な出力の兆候を検知すると、安全な応答へ誘導したり、支援リソースを表示したり、リスクが高い場合は会話自体を終了します1。自傷に関する会話では、専門家監修の相談窓口への案内を音声向けに適応させています1

10代のユーザー向けには年齢に応じた挙動をモデルに直接学習させたほか、保護者がペアレンタルコントロールで音声機能の利用可否を設定でき、自傷の兆候など高リスクの状況では連携済みの保護者に通知が届く場合があります1。声の模倣によるなりすましを防ぐため、音声はChatGPT内の事前定義された声のみに限定されています1

音声はAIへの感情的な依存が起きやすい領域でもあり、OpenAIはローンチ後も感情的依存に焦点を当てた長期的なモニタリングを続けるとしています1。自然になればなるほど「人と話している感覚」に近づくだけに、体験の進化と安全対策のバランスが今後も問われることになりそうです。

Sources

  1. Introducing GPT-Live - OpenAI公式ブログ(2026年7月8日)
  2. OpenAI releases new voice models for more natural live conversations - TechCrunch

最新のAIニュースを毎日お届けしています。

RSSで購読する 更新をいち早くチェックできます。

他のキーワードで探す →