2026年7月8日、OpenAIが ChatGPT の音声を刷新する新モデル 「GPT-Live」 を全世界にリリースした(OpenAI公式発表)。翌9日の GPT-5.6 一般提供に先立つ発表で、最大の特徴は「聞きながら、同時に話せる」全二重(フルデュプレックス)アーキテクチャだ。

これまでのAI音声は「あなたが話し終わるのを待ってから応答する」ターン制だった。GPT-Liveは人間の会話のように、相づちを打ち、割り込みを受け止め、あなたが考える沈黙を遮らない。本記事では、GPT-Liveが何者で、従来のAdvanced Voice Modeと何が違い、どう動き、どのプランで使え、何がまだできないのかまでを、公式発表に基づいて解説する。

2026年9月25日時点の追記:公開後に、裏で使うモデルと音声の利用上限の変更(9月9日)、APIの一般提供(9月10日)、ChatGPT Workでの音声対応(9月23日)があった。本文は発表時の説明を残し、いまと違う箇所には日付を付けて書き直した(出典はOpenAIリリースノート・ChatGPT Voiceのヘルプ・APIの変更履歴)。

FULL-DUPLEX VOICE · 2026

ターン制の終わり

— 聞きながら話す、人間のような会話へ

全二重
聞く+話すを同時に
相づち・割り込みOK
人間評価
Advanced Voice Modeより明確に好まれた
5〜10分の会話で比較
2モデル
Live-1 / Live-1 mini
無料でもminiが使える
裏で委譲
検索・深い推論は別のモデルへ
裏のモデルは新型に合わせて更新

1. GPT-Liveとは——「聞きながら話す」全二重音声

GPT-Liveは、ChatGPTの音声会話を担う新しい音声モデルシリーズだ。従来の音声機能(Advanced Voice Mode)を置き換える形で、2026年7月8日からChatGPTのiOS・Android・Webに全世界展開された。

核心は「全二重(フルデュプレックス)」という設計にある。電話のように入力(あなたの声)を処理しながら、同時に出力(AIの声)を生成し続ける。だから——

  • あなたが話している最中に、「うんうん」「なるほど」といった相づちを返せる
  • AIが話している途中で割り込んでも、ちゃんと聞いて方向転換する
  • あなたが考えて黙り込んでも、それを「話し終わり」と誤解して遮らない

要するに、「順番待ち」のないリアルタイム会話を実現するのがGPT-Liveだ。

2. 従来のAdvanced Voice Modeと何が違うのか

これまでのAI音声(Advanced Voice Mode)はターン制(半二重)だった。仕組み上、こんな弱点があった。

観点従来:Advanced Voice Mode新:GPT-Live
基本方式ターン制(半二重)——話し終わりを待つ全二重——聞きながら同時に話す
話し終わりの判定無音(沈黙)ベース区切りを待たない——聞きながら、間・割り込み・話す速さの変化を追ってその場で判断
考える沈黙「終わった」と誤解して割り込みがち遮らずに待てる
相づち基本なし「mhmm」「yeah」等を返す
割り込み不自然に切れることがある受け止めて調整
判断頻度ターン単位毎秒複数回(話す/聞く/間を置く/割り込む/ツール呼び出し)

OpenAIによれば、5〜10分の同条件の会話を人間が評価した比較で、GPT-Live-1・GPT-Live-1 mini はいずれもAdvanced Voice Modeより明確に好まれたという。さらにGPQA(専門科学推論)・BrowseComp(エージェント的Web検索)・カスタマーサポート系タスクでも改善が報告されている。

3. 仕組み——毎秒の判断と裏のモデルへの委譲

GPT-Liveは音声入力を連続的に処理しながら音声出力を生成し、毎秒何度も「今どうするか」を判断する——話すか、聞き続けるか、間を置くか、割り込むか、ツールを呼ぶか。この高頻度の意思決定が、人間らしいテンポを生む。

もう一つの重要な設計が「深い処理は裏のモデルに委譲する」点だ。会話の即応性はGPT-Liveが担い、Web検索・深い推論・複雑な作業が必要になると、裏でより大きなモデル(ローンチ時点ではGPT-5.5)に処理を渡し、結果が出たら会話に戻す。会話を途切れさせずに「考える」を両立させる仕組みだ。

OpenAIは発表で「新しいフロンティアモデルを出すたびに、GPT-Liveが使うモデルも更新する」と書いており、実際に2026年9月9日からは、音声でもGPT-5.6かGPT-6 Astraを使うようになった(OpenAIリリースノート)。つまり裏のモデル名は変わり続ける。押さえておくべきは名前ではなく、「会話を回す役」と「考える役」が分かれているという構造のほうだ。答えの賢さは裏のモデルで決まり、話しやすさはGPT-Liveで決まる。

発表時は、推論の深さをInstant(GPT-5.5 Instant)/ Medium / High(GPT-5.5 Thinking)の3段階から選ぶ方式だった。この音声専用の3段階は2026年9月9日に廃止され、いまはテキストのチャットと同じ操作でモデルと推論の深さを選ぶ(選べる範囲はプランによる。OpenAIリリースノート)。軽い雑談は速さ重視、込み入った相談は深く考える設定に、という使い分けそのものは変わらない。

4. 2つのモデルとプラン別提供

プラン発表時(2026年7月8日)2026年9月25日時点(Chatの音声・24時間あたり)
Free(無料)GPT-Live-1 miniGPT-Live-1 mini(回数限定、上限は変わりうる)
GoGPT-Live-1GPT-Live-1 miniで3時間
PlusGPT-Live-1GPT-Live-1で3時間
ProGPT-Live-1$100のプランは15時間、$200のプランは無制限(GPT-Live-1)
Business / Enterprise / Edu対象外ワークスペースの設定しだいで利用可(Business Standardは3時間・Premiumは15時間、超えた分は1分あたり1.25クレジット)

ポイントは、無料プランでも mini 版のGPT-Liveが使えること。全二重の自然な会話は、有料に限定されない。発表時は Go/Plus/Pro で GPT-Live-1 が既定だったが、2026年9月9日からGoはGPT-Live-1 miniに変わり、PlusとProは上限に達してもminiに切り替わらなくなった(OpenAIリリースノート)。発表時は対象外だったBusiness・Enterprise・Eduのワークスペースでも、いまは設定しだいで使える(OpenAIヘルプ)。提供はChatGPTのiOS・Android・ChatGPT.comで、全世界に段階展開された。上限の数字は改定されるので、使う前にヘルプの表で確かめたい。

5. 主な進化点

🗣️ 相づち(バックチャネル)

あなたが話している間に「うんうん」と反応。聞いてくれている感覚が生まれる。

⏱️ 素早い掛け合い

毎秒何度も「話すか・聞き続けるか」を判断し、テンポよく返す。遅延の数値は、OpenAIの発表にもモデルページにも載っていない。

✋ 割り込みに追従

話の途中で遮っても、聞いて内容を軌道修正する。

🤫 沈黙を遮らない

考える間を「話し終わり」と誤判定せず、待ってくれる。

6. 現時点の制限——正直に押さえておく

期待が先行しやすいので、できないことも正直に押さえておきたい。発表時の制限のうち、いまも残っているものと解消したものを分けて示す(2026年9月25日時点)。

  • 🟡 動画・画面共有は未対応:発表時から変わらず、Liveは映像入力や画面共有を扱わない(OpenAIヘルプ)。必要なときは、iOS・Androidアプリで従来のAdvancedに切り替えれば使える。
  • 🟡 多言語の完全対応はこれから:発表時点で、OpenAIは「よく使われる言語に最適化した。言語によっては訛りや流暢さの欠けがある」と書いている。
  • 🟡 1対1の会話向け:複数人が同時に話す場面には最適化されていない。人どうしの会話に反応してしまうことがある(OpenAIヘルプ)。
  • 🟢 APIは提供済み:発表時は「近日提供予定」だったが、2026年9月10日に一般提供された(詳細は第8章)。
  • 🟡 段階ロールアウト:プラン・地域・ワークスペースの設定・アプリの版によって、使える機能に時間差がある。

これらは今後のアップデートで拡張される見込みだが、「動画も画面も今すぐ」ではない点は理解しておくとよい。

7. 使いどころ

  • ハンズフリーの相談・壁打ち:歩きながら・作業しながら、考えを声に出して整理する。沈黙を遮られないので思考が途切れにくい。
  • 語学の会話練習:相づちや自然な割り込みがあることで、実際の会話に近い練習ができる。
  • 音声での下調べ・要約:深い検索は裏のモデルに委譲されるため、会話しながら調べ物を進められる。
  • 話しかけて仕事を頼む:2026年9月23日から、web・スマホのChatGPT Workでも音声で話しかけ、資料・スライド・表の作成を頼めるようになった。通話を切っても、終わっていない作業は文字のやり取りで続く(VoiceとWorkの両方の利用権が必要。OpenAIリリースノート)。
  • アクセシビリティ:タイピングが難しい場面で、テンポの良い音声インターフェースが役立つ。

うまく使うためのコツも、公式ヘルプに具体的に書かれている。

  • 考えながら話したいときは先に頼む:会話の最初に「こちらが頼むまで返事をしないで」と伝えると待ってくれる。ただし長い沈黙や周りの音で反応してしまうことはある。
  • 勝手に割り込まれるなら環境を変える:ヘッドホンを使う、静かな場所に移る、端末の音量を上げる。iPhoneならコントロールセンターの「マイクモード」で「声を分離」をオンにする。
  • 口述の文章が欲しいなら音声入力を使う:会話の文字起こしは逐語の記録ではなく、実際の発言と一致しないことがある。話した内容を編集してから送りたいときは、会話(Voice)ではなく音声入力(Dictation)のほうが向いている。
  • 録音の扱いを知っておく:音声のクリップは会話の記録と一緒に保存され、保持期間は30日。クリップが学習に使われるのは、自分で共有をオンにしたときだけ(Business・Enterprise・Eduでは共有できない)。文字起こしのほうは「すべての人のためにモデルを改善する」設定しだいで使われうる。

8. API提供状況とGPT-Realtimeとの違い

発表時のGPT-LiveのAPIは「近日提供予定」で、開発者・企業は通知登録で待つ形だった。その後2026年9月10日に、APIで一般提供された(OpenAI APIの変更履歴)。2026年9月25日時点のモデルページによれば、モデルIDは gpt-live-1、専用のLiveエンドポイント(v1/live/sessions)で使い、音声セッションは1分あたり$0.05(秒単位の課金)。裏で考えるモデルやツールの料金は別にかかる。

APIでもChatGPTと同じく、会話を回すGPT-Liveと、考える仕事をするバックエンドを分けて組む。バックエンドはOpenAIのモデルに任せる方式と、自社のエージェントやサービスをつなぐ方式から選べる(公式ガイド)。権限の確認や自社システムを触る処理は、アプリ側が受け持つ。

紛らわしいので整理: APIの音声モデルには、GPT-Liveとは別の GPT-Realtime-2.1 / GPT-Realtime-2.1 mini(2026年7月6日提供)もある。こちらはRealtime APIで使う、推論とツール呼び出しに対応した音声モデルだ。GPT-Live=聞きながら話し、考える仕事は裏へ回す全二重の会話役、GPT-Realtime=Realtime API上の音声エージェント基盤、と作りが違う。どちらを選ぶかは、OpenAIの音声エージェントのガイドが比較している。

まとめ

  • GPT-Liveは、ChatGPTの音声を「ターン制」から全二重(聞きながら話す)に変える新モデル(2026年7月8日、全世界)。
  • 相づち・割り込み・沈黙の許容で、人間に近い会話テンポを実現。Advanced Voice Modeより明確に好まれた。
  • 会話の即応はGPT-Liveが担い、深い推論・検索は裏のモデルに委譲(発表時はGPT-5.5。2026年9月9日からはGPT-5.6かGPT-6 Astra)。
  • 無料とGoはGPT-Live-1 mini、PlusとProはGPT-Live-1(2026年9月25日時点)。Business・Enterprise・Eduも設定しだいで使える。ChatGPTのiOS/Android/Webで利用可。
  • 現状の制限:動画・画面共有は未対応、多言語の完全対応は未達。APIは2026年9月10日に一般提供(1分$0.05)。GPT-Realtime-2.1は別系統のAPI音声モデル。

FAQ

Q1. GPT-Liveは無料でも使えますか?

使えます。無料プランでは GPT-Live-1 mini を回数限定で使えます。2026年9月25日時点では、Goも GPT-Live-1 mini(1日3時間まで)、PlusとProは上位の GPT-Live-1 です。ChatGPTのiOS・Android・Webで利用できます(段階展開)。

Q2. 「全二重」とは具体的に何ですか?

電話のように聞くと話すを同時に行える方式です。従来のターン制(あなたの話し終わりを待って応答)と違い、話している最中に相づちを返したり、割り込みを受け止めたり、あなたの考える沈黙を遮らずに待てます。

Q3. 従来のAdvanced Voice Modeと何が一番違いますか?

話し終わりの判定方法です。従来は無音(沈黙)ベースで、考える間を「終わった」と誤解して割り込みがちでした。GPT-Liveは区切りを待たず、聞きながら間や割り込み、話す速さの変化を追って、応答するか聞き続けるかを毎秒何度も判断するため(OpenAIのシステムカード)、遮られにくく自然です。人間評価でも明確に好まれています。

Q4. 難しい質問にも答えられますか?

答えられます。会話の即応はGPT-Liveが担当し、Web検索や深い推論が必要な場面では裏のモデルに処理を委譲して、結果を会話に戻します。発表時の裏のモデルはGPT-5.5でしたが、2026年9月9日からはGPT-5.6かGPT-6 Astraを使い、モデルと推論の深さはテキストのチャットと同じ操作で選びます。

Q5. 動画や画面共有はできますか?

2026年9月25日時点でもできません。Liveは動画・画面共有に対応していないので、必要なときはiOS・Androidアプリで従来のAdvancedに切り替えてください(OpenAIヘルプ)。OpenAIは発表時に「対応に取り組んでいる」と書いています。

Q6. 自分のアプリにAPIで組み込めますか?

組み込めます。GPT-LiveのAPIは2026年9月10日に一般提供され、モデルIDは gpt-live-1、料金は音声セッション1分あたり$0.05(裏のモデルとツールは別料金)です。別系統の GPT-Realtime-2.1 / mini もあるので、会話の自然さを重視するか、Realtime APIの既存の仕組みに乗るかで選んでください。

Q7. GoogleのGemini Liveと比べてどうですか?

GoogleのGemini Liveは、話しながらカメラの映像やスマホの画面を共有できます(Gemini Liveのヘルプ)。GPT-Liveは2026年9月25日時点で動画・画面共有に未対応なので、見ているものを映しながら話したいならGemini Liveに分があります。OpenAIがGPT-Liveの強みとして挙げているのは全二重の会話の自然さで、聞きながら相づちを打ち、話の途中の割り込みを受け止め、考える沈黙を遮らずに待てます。遅延の数値はOpenAIが公表していないので、応答の速さでは比べられません。詳しくはGPT-5.6 vs Gemini比較も参照してください。

音声で会話するのではなく、既存のMP3やM4Aから文字起こしや議事録を作る場合は、ChatGPTへ音声ファイルをアップロードする方法を参照してください。Voice・Dictation・Recordとの違いと、添付音声の制限を整理しています。

関連記事