Содержание
- 1. Что такое GPT-Live — полнодуплексный голос «слушать и говорить одновременно»
- 2. Чем он отличается от прежнего Advanced Voice Mode
- 3. Как это работает — решения каждую секунду и передача задач фоновой модели
- 4. Две модели и доступ по тарифам
- 5. Ключевые улучшения
- 6. Текущие ограничения — честно о том, что стоит учесть
- 7. Где это пригодится
- 8. Статус API и отличие от GPT-Realtime
- Итоги
- FAQ
8 июля 2026 г. OpenAI выпустила по всему миру новую модель «GPT-Live», которая обновляет голос ChatGPT (официальный анонс OpenAI). Это объявление вышло накануне общедоступного релиза GPT-5.6 9 июля, и главная его особенность — полнодуплексная (full-duplex) архитектура, позволяющая «слушать и одновременно говорить».
До сих пор ИИ-голос работал по принципу очереди: «дождаться, когда вы договорите, и только потом ответить». GPT-Live же ведёт себя как в живом разговоре: поддакивает, воспринимает перебивание и не обрывает паузу, когда вы задумались. В этой статье мы на основе официального анонса разберём, что представляет собой GPT-Live, чем он отличается от прежнего Advanced Voice Mode, как он работает, на каких тарифах доступен и чего пока ещё не умеет.
Дополнение на 25 сентября 2026 года: после публикации сменились фоновая модель и лимиты голоса (9 сентября), API стал общедоступным (10 сентября), а голос появился в ChatGPT Work (23 сентября). Мы сохранили объяснение на момент запуска и с указанием дат переписали места, которые сегодня выглядят иначе (источники: заметки о выпуске OpenAI, справка по ChatGPT Voice, журнал изменений API).
Конец очерёдности реплик
— слушать и говорить, к разговору как у людей
1. Что такое GPT-Live — полнодуплексный голос «слушать и говорить одновременно»
GPT-Live — это новая серия голосовых моделей, отвечающая за голосовое общение в ChatGPT. Она заменяет собой прежнюю голосовую функцию (Advanced Voice Mode) и с 8 июля 2026 г. развёрнута по всему миру в ChatGPT для iOS, Android и в вебе.
Суть — в архитектуре «полного дуплекса (full-duplex)». Как в телефонном разговоре, система обрабатывает входной сигнал (ваш голос) и одновременно продолжает генерировать выходной (голос ИИ). Поэтому —
- пока вы говорите, она может вставлять поддакивания вроде «угу», «понятно»;
- если вы перебиваете ИИ во время его реплики, он всё равно вас слушает и меняет направление;
- если вы задумались и замолчали, она не примет это за «конец фразы» и не оборвёт вас.
Короче говоря, GPT-Live реализует разговор в реальном времени без «ожидания своей очереди».
2. Чем он отличается от прежнего Advanced Voice Mode
Прежний ИИ-голос (Advanced Voice Mode) работал по очереди реплик (полудуплекс). В силу самого устройства у него были такие слабые места.
| Аспект | Раньше: Advanced Voice Mode | Теперь: GPT-Live |
|---|---|---|
| Базовый принцип | по очереди реплик (полудуплекс) — ждёт, когда вы договорите | полный дуплекс — слушает и одновременно говорит |
| Как определяется конец реплики | по тишине (молчанию) | не ждёт чёткой паузы: слушая, следит за паузами, перебиваниями и сменой темпа и решает на ходу |
| Пауза на раздумье | часто принимает за «конец» и перебивает | умеет ждать, не обрывая |
| Поддакивание | по сути отсутствует | вставляет «mhmm», «yeah» и т. п. |
| Перебивание | иногда обрывается неестественно | воспринимает и подстраивается |
| Частота решений | раз за реплику | несколько раз в секунду (говорить/слушать/выдержать паузу/перебить/вызвать инструмент) |
По данным OpenAI, в сравнении, где люди оценивали разговоры длиной 5–10 минут в одинаковых условиях, и GPT-Live-1, и GPT-Live-1 mini заметно предпочитались Advanced Voice Mode. Кроме того, улучшения отмечены в GPQA (экспертные научные рассуждения), BrowseComp (агентный веб-поиск) и в задачах клиентской поддержки.
3. Как это работает — решения каждую секунду и передача задач фоновой модели
GPT-Live непрерывно обрабатывает голосовой ввод и одновременно генерирует голосовой вывод, множество раз в секунду решая, «что делать сейчас» — говорить, продолжать слушать, выдержать паузу, перебить или вызвать инструмент. Именно это высокочастотное принятие решений и создаёт человеческий темп.
Ещё одна важная особенность конструкции — «глубокая обработка делегируется фоновой модели». За мгновенность разговора отвечает GPT-Live, а когда требуется веб-поиск, глубокое рассуждение или сложная работа, обработка передаётся в фоне более крупной модели (на момент запуска — GPT-5.5), и по готовности результат возвращается в разговор. Это механизм, который позволяет «думать», не прерывая беседу.
В анонсе OpenAI написала, что «по мере выхода новых передовых моделей мы будем постоянно обновлять модель, которую использует GPT-Live», — так и вышло: с 9 сентября 2026 года голосовой режим использует GPT-5.6 или GPT-6 Astra (заметки о выпуске OpenAI). То есть название фоновой модели будет меняться и дальше. Запоминать стоит не название, а устройство: одна часть ведёт разговор, другая думает. Насколько умны ответы, зависит от фоновой модели, а насколько легко разговаривать — от GPT-Live.
4. Две модели и доступ по тарифам
| Тариф | На старте (8 июля 2026 г.) | На 25 сентября 2026 г. (голос в Chat, за 24 часа) |
|---|---|---|
| Free | GPT-Live-1 mini | GPT-Live-1 mini (ограниченно; лимиты могут меняться) |
| Go | GPT-Live-1 | 3 часа с GPT-Live-1 mini |
| Plus | GPT-Live-1 | 3 часа с GPT-Live-1 |
| Pro | GPT-Live-1 | 15 часов на тарифе за $100, без ограничений на тарифе за $200 (GPT-Live-1) |
| Business / Enterprise / Edu | Недоступно | Доступно в зависимости от настроек рабочего пространства. У Business Standard — 3 часа, у Premium — 15; сверх этого — 1,25 кредита за минуту |
Главное — даже на бесплатном тарифе можно пользоваться mini-версией GPT-Live. Естественный полнодуплексный разговор не ограничен платными тарифами. На старте на Go/Plus/Pro по умолчанию был GPT-Live-1, но с 9 сентября 2026 года Go перешёл на GPT-Live-1 mini, а Plus и Pro больше не переключаются на mini после исчерпания лимита голоса (заметки о выпуске OpenAI). Рабочие пространства Business, Enterprise и Edu, не охваченные на старте, теперь могут им пользоваться в зависимости от настроек (OpenAI Help). Доступен в ChatGPT для iOS, Android и на ChatGPT.com, развёртывание шло поэтапно по всему миру. Лимиты пересматриваются, поэтому перед тем как на них рассчитывать, сверьтесь с таблицей в OpenAI Help.
5. Ключевые улучшения
Пока вы говорите, реагирует «угу». Возникает ощущение, что вас слушают.
Много раз в секунду решает, говорить или слушать дальше, и отвечает в темпе разговора. Числа задержки нет ни в анонсе OpenAI, ни на странице модели.
Даже если перебить в середине, он слушает и корректирует ход мысли.
Не принимает паузу на раздумье за «конец фразы» и ждёт.
6. Текущие ограничения — честно о том, что стоит учесть
Ожидания легко опережают реальность, поэтому стоит честно сказать, чего он не умеет. Ниже ограничения на момент запуска разделены на те, что остаются в силе, и те, что уже сняты (на 25 сентября 2026 года).
- 🟡 Нет видео и демонстрации экрана: как и на старте, Live не работает с видеовходом и демонстрацией экрана (OpenAI Help). Если они нужны, переключитесь на прежний голосовой режим Advanced в приложении для iOS или Android.
- 🟡 Полная поддержка всех языков ещё впереди: на старте OpenAI писала, что GPT-Live оптимизирован под самые популярные языки, а в некоторых возможны неродной акцент и пробелы в беглости.
- 🟡 Рассчитан на разговор один на один: пока не оптимизирован для нескольких говорящих одновременно и может реагировать, когда люди разговаривают друг с другом (OpenAI Help).
- 🟢 API уже доступен: на старте он был «скоро», а 10 сентября 2026 года стал общедоступным (см. главу 8).
- 🟡 Поэтапное развёртывание: какие функции у вас есть и когда они появятся, зависит от тарифа, региона, настроек рабочего пространства и версии приложения.
Ожидается, что в будущих обновлениях это будет расширено, но стоит понимать, что «и видео, и экран — прямо сейчас» это не про текущий момент.
7. Где это пригодится
- Консультация и «прокачка идей» без рук: на ходу или во время работы проговаривать мысли вслух и упорядочивать их. Паузу не обрывают, поэтому ход мысли реже прерывается.
- Разговорная практика языка: за счёт поддакиваний и естественного перебивания практика ближе к настоящему разговору.
- Поиск и конспекты голосом: глубокий поиск передаётся фоновой модели, так что можно разбираться в вопросе прямо во время разговора.
- Поручать работу голосом: с 23 сентября 2026 года с ChatGPT Work можно говорить в вебе и на телефоне и просить подготовить документы, слайды и таблицы. Если задача ещё выполняется, когда вы завершаете звонок, она продолжится в текстовом режиме (нужен доступ и к Voice, и к Work; заметки о выпуске OpenAI).
- Доступность: там, где печатать сложно, помогает голосовой интерфейс с хорошим темпом.
В OpenAI Help есть и конкретные советы, как пользоваться им удобнее.
- Хотите думать вслух — предупредите заранее: в начале скажите что-то вроде «подожди, пока я не попрошу ответить», и он будет сдерживаться. Долгие паузы и фоновые звуки всё же могут вызвать ответ.
- Если он часто перебивает, измените условия: наденьте наушники, перейдите в место потише или прибавьте громкость. На iPhone откройте Пункт управления, выберите «Режим микрофона» и включите «Изоляцию голоса».
- Для надиктованного текста используйте диктовку: расшифровка голосового разговора не дословна и может расходиться со сказанным. Если нужно проверить и отредактировать сказанное перед отправкой, диктовка (Dictation) подходит лучше, чем разговор (Voice).
- Знайте, как обращаются с записями: аудиофрагменты хранятся вместе с расшифровкой чата 30 дней. Для обучения их используют, только если вы сами включили передачу (в Business, Enterprise и Edu передавать их нельзя). Расшифровки могут использоваться в зависимости от настройки «Улучшать модель для всех».
8. Статус API и отличие от GPT-Realtime
На старте API GPT-Live был «скоро», и разработчики и компании могли лишь подписаться на уведомления. Затем, 10 сентября 2026 года, он стал общедоступным в API (журнал изменений API OpenAI). По данным страницы модели на 25 сентября 2026 года, ID модели — gpt-live-1, она работает через отдельный эндпоинт Live (v1/live/sessions), а голосовые сессии стоят $0.05 в минуту с посекундной тарификацией. Фоновая модель и инструменты оплачиваются отдельно.
В API, как и в ChatGPT, схема такая: GPT-Live ведёт разговор, а бэкенд думает. Бэкенд можно доверить OpenAI или подключить собственного агента или сервис (официальное руководство). Проверка прав и всё, что затрагивает ваши собственные системы, по-прежнему остаётся за вашим приложением.
Итоги
- GPT-Live — новая модель, переводящая голос ChatGPT с «очереди реплик» на полный дуплекс (слушать и говорить одновременно) (8 июля 2026 г., по всему миру).
- Поддакивание, перебивание и терпимость к паузам обеспечивают темп разговора, близкий к человеческому. Заметно предпочитается Advanced Voice Mode.
- GPT-Live отвечает за живость разговора, а глубокие рассуждения и поиск передаются фоновой модели (на старте — GPT-5.5; с 9 сентября 2026 года — GPT-5.6 или GPT-6 Astra).
- Free и Go используют GPT-Live-1 mini, Plus и Pro — GPT-Live-1 (на 25 сентября 2026 года). Business, Enterprise и Edu могут пользоваться им в зависимости от настроек. Доступен в ChatGPT для iOS/Android/веба.
- Текущие ограничения: нет видео и демонстрации экрана, полной поддержки всех языков пока нет. API стал общедоступным 10 сентября 2026 года ($0.05 в минуту). GPT-Realtime-2.1 — отдельная линейка голосовых моделей API.
FAQ
Q1. Можно ли пользоваться GPT-Live бесплатно?
Да. На бесплатном тарифе доступен GPT-Live-1 mini в ограниченном объёме. На 25 сентября 2026 года Go тоже использует GPT-Live-1 mini (до 3 часов в день), а Plus и Pro — старшую GPT-Live-1. Доступно в ChatGPT для iOS, Android и веба (поэтапное развёртывание).
Q2. Что конкретно означает «полный дуплекс»?
Это способ, при котором можно слушать и говорить одновременно, как по телефону. В отличие от прежней очереди реплик (ответ после того, как вы договорите), система может вставлять поддакивания, пока вы говорите, воспринимать перебивание и ждать, не обрывая вашу паузу на раздумье.
Q3. В чём главное отличие от прежнего Advanced Voice Mode?
В способе определения конца реплики. Раньше это делалось по тишине (молчанию), поэтому пауза на раздумье часто принималась за «конец» и следовало перебивание. GPT-Live не ждёт чёткой паузы: слушая, он следит за паузами, перебиваниями и сменой темпа и много раз в секунду решает, ответить или слушать дальше (системная карточка OpenAI), поэтому его сложнее оборвать и он звучит естественнее. В оценках людьми он тоже заметно предпочитается.
Q4. Справляется ли он со сложными вопросами?
Да. GPT-Live отвечает за живость разговора, а когда нужен веб-поиск или глубокие рассуждения, передаёт обработку фоновой модели и возвращает результат в разговор. На старте это была GPT-5.5; с 9 сентября 2026 года используется GPT-5.6 или GPT-6 Astra, а модель и глубину рассуждений выбирают теми же элементами управления, что и в текстовом чате.
Q5. Можно ли использовать видео или демонстрацию экрана?
Нет, на 25 сентября 2026 года — нет. Live не поддерживает видео и демонстрацию экрана, поэтому, когда они нужны, переключитесь на прежний режим Advanced в приложении для iOS или Android (OpenAI Help). На старте OpenAI говорила, что работает над добавлением этих возможностей.
Q6. Можно ли встроить его в своё приложение через API?
Да. API GPT-Live стал общедоступным 10 сентября 2026 года; ID модели — gpt-live-1, голосовые сессии стоят $0.05 в минуту (фоновая модель и инструменты оплачиваются отдельно). Есть и отдельная линейка GPT-Realtime-2.1 / mini, так что выбирайте в зависимости от того, что важнее: естественность разговора или опора на уже существующий Realtime API.
Q7. Как он выглядит на фоне Gemini Live от Google?
Gemini Live от Google позволяет во время разговора показывать изображение с камеры или экран телефона (справка Gemini Live). GPT-Live на 25 сентября 2026 года не поддерживает видео и демонстрацию экрана, поэтому, если нужно показать то, что вы видите, преимущество у Gemini Live. Сильная сторона GPT-Live, которую выделяет OpenAI, — естественность полнодуплексного разговора: он подаёт знаки, что слушает, пока вы говорите, принимает перебивания посреди фразы и ждёт, пока вы обдумываете мысль. Цифр задержки OpenAI не публиковала, поэтому сравнить скорость ответа нельзя. Подробнее см. также сравнение GPT-5.6 и Gemini.
Похожие статьи
- GPT-5.6: полный разбор релиза — ключевые модели того же периода
- GPT-5.6 Sol vs Gemini — оси сравнения мультимодальности и голоса
- Что такое Google Gemini — основы конкурента
- Что такое ChatGPT Work — рабочий агент, который создаёт документы, таблицы и слайды, — теперь ему можно давать задания и голосом
Для готового MP3 или M4A, который вы хотите прикрепить к разговору, прочитайте руководство по загрузке аудио в ChatGPT: поддерживаемые форматы, платные планы, проверка расшифровки, отдельная оплата API и ограничения хранения.