目次
2026年7月8日、OpenAIが ChatGPT の音声を刷新する新モデル 「GPT-Live」 を全世界にリリースした(OpenAI公式発表)。翌9日の GPT-5.6 一般提供に先立つ発表で、最大の特徴は「聞きながら、同時に話せる」全二重(フルデュプレックス)アーキテクチャだ。
これまでのAI音声は「あなたが話し終わるのを待ってから応答する」ターン制だった。GPT-Liveは人間の会話のように、相づちを打ち、割り込みを受け止め、あなたが考える沈黙を遮らない。本記事では、GPT-Liveが何者で、従来のAdvanced Voice Modeと何が違い、どう動き、どのプランで使え、何がまだできないのかまでを、公式発表に基づいて解説する。
2026年9月25日時点の追記:公開後に、裏で使うモデルと音声の利用上限の変更(9月9日)、APIの一般提供(9月10日)、ChatGPT Workでの音声対応(9月23日)があった。本文は発表時の説明を残し、いまと違う箇所には日付を付けて書き直した(出典はOpenAIリリースノート・ChatGPT Voiceのヘルプ・APIの変更履歴)。
ターン制の終わり
— 聞きながら話す、人間のような会話へ
1. GPT-Liveとは——「聞きながら話す」全二重音声
GPT-Liveは、ChatGPTの音声会話を担う新しい音声モデルシリーズだ。従来の音声機能(Advanced Voice Mode)を置き換える形で、2026年7月8日からChatGPTのiOS・Android・Webに全世界展開された。
核心は「全二重(フルデュプレックス)」という設計にある。電話のように入力(あなたの声)を処理しながら、同時に出力(AIの声)を生成し続ける。だから——
- あなたが話している最中に、「うんうん」「なるほど」といった相づちを返せる
- AIが話している途中で割り込んでも、ちゃんと聞いて方向転換する
- あなたが考えて黙り込んでも、それを「話し終わり」と誤解して遮らない
要するに、「順番待ち」のないリアルタイム会話を実現するのがGPT-Liveだ。
2. 従来のAdvanced Voice Modeと何が違うのか
これまでのAI音声(Advanced Voice Mode)はターン制(半二重)だった。仕組み上、こんな弱点があった。
| 観点 | 従来:Advanced Voice Mode | 新:GPT-Live |
|---|---|---|
| 基本方式 | ターン制(半二重)——話し終わりを待つ | 全二重——聞きながら同時に話す |
| 話し終わりの判定 | 無音(沈黙)ベース | 区切りを待たない——聞きながら、間・割り込み・話す速さの変化を追ってその場で判断 |
| 考える沈黙 | 「終わった」と誤解して割り込みがち | 遮らずに待てる |
| 相づち | 基本なし | 「mhmm」「yeah」等を返す |
| 割り込み | 不自然に切れることがある | 受け止めて調整 |
| 判断頻度 | ターン単位 | 毎秒複数回(話す/聞く/間を置く/割り込む/ツール呼び出し) |
OpenAIによれば、5〜10分の同条件の会話を人間が評価した比較で、GPT-Live-1・GPT-Live-1 mini はいずれもAdvanced Voice Modeより明確に好まれたという。さらにGPQA(専門科学推論)・BrowseComp(エージェント的Web検索)・カスタマーサポート系タスクでも改善が報告されている。
3. 仕組み——毎秒の判断と裏のモデルへの委譲
GPT-Liveは音声入力を連続的に処理しながら音声出力を生成し、毎秒何度も「今どうするか」を判断する——話すか、聞き続けるか、間を置くか、割り込むか、ツールを呼ぶか。この高頻度の意思決定が、人間らしいテンポを生む。
もう一つの重要な設計が「深い処理は裏のモデルに委譲する」点だ。会話の即応性はGPT-Liveが担い、Web検索・深い推論・複雑な作業が必要になると、裏でより大きなモデル(ローンチ時点ではGPT-5.5)に処理を渡し、結果が出たら会話に戻す。会話を途切れさせずに「考える」を両立させる仕組みだ。
OpenAIは発表で「新しいフロンティアモデルを出すたびに、GPT-Liveが使うモデルも更新する」と書いており、実際に2026年9月9日からは、音声でもGPT-5.6かGPT-6 Astraを使うようになった(OpenAIリリースノート)。つまり裏のモデル名は変わり続ける。押さえておくべきは名前ではなく、「会話を回す役」と「考える役」が分かれているという構造のほうだ。答えの賢さは裏のモデルで決まり、話しやすさはGPT-Liveで決まる。
4. 2つのモデルとプラン別提供
| プラン | 発表時(2026年7月8日) | 2026年9月25日時点(Chatの音声・24時間あたり) |
|---|---|---|
| Free(無料) | GPT-Live-1 mini | GPT-Live-1 mini(回数限定、上限は変わりうる) |
| Go | GPT-Live-1 | GPT-Live-1 miniで3時間 |
| Plus | GPT-Live-1 | GPT-Live-1で3時間 |
| Pro | GPT-Live-1 | $100のプランは15時間、$200のプランは無制限(GPT-Live-1) |
| Business / Enterprise / Edu | 対象外 | ワークスペースの設定しだいで利用可(Business Standardは3時間・Premiumは15時間、超えた分は1分あたり1.25クレジット) |
ポイントは、無料プランでも mini 版のGPT-Liveが使えること。全二重の自然な会話は、有料に限定されない。発表時は Go/Plus/Pro で GPT-Live-1 が既定だったが、2026年9月9日からGoはGPT-Live-1 miniに変わり、PlusとProは上限に達してもminiに切り替わらなくなった(OpenAIリリースノート)。発表時は対象外だったBusiness・Enterprise・Eduのワークスペースでも、いまは設定しだいで使える(OpenAIヘルプ)。提供はChatGPTのiOS・Android・ChatGPT.comで、全世界に段階展開された。上限の数字は改定されるので、使う前にヘルプの表で確かめたい。
5. 主な進化点
あなたが話している間に「うんうん」と反応。聞いてくれている感覚が生まれる。
毎秒何度も「話すか・聞き続けるか」を判断し、テンポよく返す。遅延の数値は、OpenAIの発表にもモデルページにも載っていない。
話の途中で遮っても、聞いて内容を軌道修正する。
考える間を「話し終わり」と誤判定せず、待ってくれる。
6. 現時点の制限——正直に押さえておく
期待が先行しやすいので、できないことも正直に押さえておきたい。発表時の制限のうち、いまも残っているものと解消したものを分けて示す(2026年9月25日時点)。
- 🟡 動画・画面共有は未対応:発表時から変わらず、Liveは映像入力や画面共有を扱わない(OpenAIヘルプ)。必要なときは、iOS・Androidアプリで従来のAdvancedに切り替えれば使える。
- 🟡 多言語の完全対応はこれから:発表時点で、OpenAIは「よく使われる言語に最適化した。言語によっては訛りや流暢さの欠けがある」と書いている。
- 🟡 1対1の会話向け:複数人が同時に話す場面には最適化されていない。人どうしの会話に反応してしまうことがある(OpenAIヘルプ)。
- 🟢 APIは提供済み:発表時は「近日提供予定」だったが、2026年9月10日に一般提供された(詳細は第8章)。
- 🟡 段階ロールアウト:プラン・地域・ワークスペースの設定・アプリの版によって、使える機能に時間差がある。
これらは今後のアップデートで拡張される見込みだが、「動画も画面も今すぐ」ではない点は理解しておくとよい。
7. 使いどころ
- ハンズフリーの相談・壁打ち:歩きながら・作業しながら、考えを声に出して整理する。沈黙を遮られないので思考が途切れにくい。
- 語学の会話練習:相づちや自然な割り込みがあることで、実際の会話に近い練習ができる。
- 音声での下調べ・要約:深い検索は裏のモデルに委譲されるため、会話しながら調べ物を進められる。
- 話しかけて仕事を頼む:2026年9月23日から、web・スマホのChatGPT Workでも音声で話しかけ、資料・スライド・表の作成を頼めるようになった。通話を切っても、終わっていない作業は文字のやり取りで続く(VoiceとWorkの両方の利用権が必要。OpenAIリリースノート)。
- アクセシビリティ:タイピングが難しい場面で、テンポの良い音声インターフェースが役立つ。
うまく使うためのコツも、公式ヘルプに具体的に書かれている。
- 考えながら話したいときは先に頼む:会話の最初に「こちらが頼むまで返事をしないで」と伝えると待ってくれる。ただし長い沈黙や周りの音で反応してしまうことはある。
- 勝手に割り込まれるなら環境を変える:ヘッドホンを使う、静かな場所に移る、端末の音量を上げる。iPhoneならコントロールセンターの「マイクモード」で「声を分離」をオンにする。
- 口述の文章が欲しいなら音声入力を使う:会話の文字起こしは逐語の記録ではなく、実際の発言と一致しないことがある。話した内容を編集してから送りたいときは、会話(Voice)ではなく音声入力(Dictation)のほうが向いている。
- 録音の扱いを知っておく:音声のクリップは会話の記録と一緒に保存され、保持期間は30日。クリップが学習に使われるのは、自分で共有をオンにしたときだけ(Business・Enterprise・Eduでは共有できない)。文字起こしのほうは「すべての人のためにモデルを改善する」設定しだいで使われうる。
8. API提供状況とGPT-Realtimeとの違い
発表時のGPT-LiveのAPIは「近日提供予定」で、開発者・企業は通知登録で待つ形だった。その後2026年9月10日に、APIで一般提供された(OpenAI APIの変更履歴)。2026年9月25日時点のモデルページによれば、モデルIDは gpt-live-1、専用のLiveエンドポイント(v1/live/sessions)で使い、音声セッションは1分あたり$0.05(秒単位の課金)。裏で考えるモデルやツールの料金は別にかかる。
APIでもChatGPTと同じく、会話を回すGPT-Liveと、考える仕事をするバックエンドを分けて組む。バックエンドはOpenAIのモデルに任せる方式と、自社のエージェントやサービスをつなぐ方式から選べる(公式ガイド)。権限の確認や自社システムを触る処理は、アプリ側が受け持つ。
まとめ
- GPT-Liveは、ChatGPTの音声を「ターン制」から全二重(聞きながら話す)に変える新モデル(2026年7月8日、全世界)。
- 相づち・割り込み・沈黙の許容で、人間に近い会話テンポを実現。Advanced Voice Modeより明確に好まれた。
- 会話の即応はGPT-Liveが担い、深い推論・検索は裏のモデルに委譲(発表時はGPT-5.5。2026年9月9日からはGPT-5.6かGPT-6 Astra)。
- 無料とGoはGPT-Live-1 mini、PlusとProはGPT-Live-1(2026年9月25日時点)。Business・Enterprise・Eduも設定しだいで使える。ChatGPTのiOS/Android/Webで利用可。
- 現状の制限:動画・画面共有は未対応、多言語の完全対応は未達。APIは2026年9月10日に一般提供(1分$0.05)。GPT-Realtime-2.1は別系統のAPI音声モデル。
FAQ
Q1. GPT-Liveは無料でも使えますか?
使えます。無料プランでは GPT-Live-1 mini を回数限定で使えます。2026年9月25日時点では、Goも GPT-Live-1 mini(1日3時間まで)、PlusとProは上位の GPT-Live-1 です。ChatGPTのiOS・Android・Webで利用できます(段階展開)。
Q2. 「全二重」とは具体的に何ですか?
電話のように聞くと話すを同時に行える方式です。従来のターン制(あなたの話し終わりを待って応答)と違い、話している最中に相づちを返したり、割り込みを受け止めたり、あなたの考える沈黙を遮らずに待てます。
Q3. 従来のAdvanced Voice Modeと何が一番違いますか?
話し終わりの判定方法です。従来は無音(沈黙)ベースで、考える間を「終わった」と誤解して割り込みがちでした。GPT-Liveは区切りを待たず、聞きながら間や割り込み、話す速さの変化を追って、応答するか聞き続けるかを毎秒何度も判断するため(OpenAIのシステムカード)、遮られにくく自然です。人間評価でも明確に好まれています。
Q4. 難しい質問にも答えられますか?
答えられます。会話の即応はGPT-Liveが担当し、Web検索や深い推論が必要な場面では裏のモデルに処理を委譲して、結果を会話に戻します。発表時の裏のモデルはGPT-5.5でしたが、2026年9月9日からはGPT-5.6かGPT-6 Astraを使い、モデルと推論の深さはテキストのチャットと同じ操作で選びます。
Q5. 動画や画面共有はできますか?
2026年9月25日時点でもできません。Liveは動画・画面共有に対応していないので、必要なときはiOS・Androidアプリで従来のAdvancedに切り替えてください(OpenAIヘルプ)。OpenAIは発表時に「対応に取り組んでいる」と書いています。
Q6. 自分のアプリにAPIで組み込めますか?
組み込めます。GPT-LiveのAPIは2026年9月10日に一般提供され、モデルIDは gpt-live-1、料金は音声セッション1分あたり$0.05(裏のモデルとツールは別料金)です。別系統の GPT-Realtime-2.1 / mini もあるので、会話の自然さを重視するか、Realtime APIの既存の仕組みに乗るかで選んでください。
Q7. GoogleのGemini Liveと比べてどうですか?
GoogleのGemini Liveは、話しながらカメラの映像やスマホの画面を共有できます(Gemini Liveのヘルプ)。GPT-Liveは2026年9月25日時点で動画・画面共有に未対応なので、見ているものを映しながら話したいならGemini Liveに分があります。OpenAIがGPT-Liveの強みとして挙げているのは全二重の会話の自然さで、聞きながら相づちを打ち、話の途中の割り込みを受け止め、考える沈黙を遮らずに待てます。遅延の数値はOpenAIが公表していないので、応答の速さでは比べられません。詳しくはGPT-5.6 vs Gemini比較も参照してください。
音声で会話するのではなく、既存のMP3やM4Aから文字起こしや議事録を作る場合は、ChatGPTへ音声ファイルをアップロードする方法を参照してください。Voice・Dictation・Recordとの違いと、添付音声の制限を整理しています。
関連記事
- GPT-5.6 リリース完全解説 — 同時期の主役モデル群
- GPT-5.6 Sol vs Gemini — マルチモーダル/音声の比較軸
- Google Geminiとは — 競合の基礎
- ChatGPT Workとは — 資料・表・スライドを作り、音声でも頼める"仕事エージェント"