8 июля 2026 г. OpenAI выпустила по всему миру новую модель «GPT-Live», которая обновляет голос ChatGPT (официальный анонс OpenAI). Это объявление вышло накануне общедоступного релиза GPT-5.6 9 июля, и главная его особенность — полнодуплексная (full-duplex) архитектура, позволяющая «слушать и одновременно говорить».

До сих пор ИИ-голос работал по принципу очереди: «дождаться, когда вы договорите, и только потом ответить». GPT-Live же ведёт себя как в живом разговоре: поддакивает, воспринимает перебивание и не обрывает паузу, когда вы задумались. В этой статье мы на основе официального анонса разберём, что представляет собой GPT-Live, чем он отличается от прежнего Advanced Voice Mode, как он работает, на каких тарифах доступен и чего пока ещё не умеет.

Дополнение на 25 сентября 2026 года: после публикации сменились фоновая модель и лимиты голоса (9 сентября), API стал общедоступным (10 сентября), а голос появился в ChatGPT Work (23 сентября). Мы сохранили объяснение на момент запуска и с указанием дат переписали места, которые сегодня выглядят иначе (источники: заметки о выпуске OpenAI, справка по ChatGPT Voice, журнал изменений API).

FULL-DUPLEX VOICE · 2026

Конец очерёдности реплик

— слушать и говорить, к разговору как у людей

Полный дуплекс
слушать и говорить одновременно
поддакивание и перебивание — ОК
Выбор людей
Заметно предпочтён Advanced Voice Mode
Оценка людьми, беседы по 5–10 мин
2 модели
Live-1 / Live-1 mini
mini доступна даже бесплатно
Делегирование
Поиск и глубокие рассуждения — другой модели
Фоновую модель обновляют с выходом новых

1. Что такое GPT-Live — полнодуплексный голос «слушать и говорить одновременно»

GPT-Live — это новая серия голосовых моделей, отвечающая за голосовое общение в ChatGPT. Она заменяет собой прежнюю голосовую функцию (Advanced Voice Mode) и с 8 июля 2026 г. развёрнута по всему миру в ChatGPT для iOS, Android и в вебе.

Суть — в архитектуре «полного дуплекса (full-duplex)». Как в телефонном разговоре, система обрабатывает входной сигнал (ваш голос) и одновременно продолжает генерировать выходной (голос ИИ). Поэтому —

  • пока вы говорите, она может вставлять поддакивания вроде «угу», «понятно»;
  • если вы перебиваете ИИ во время его реплики, он всё равно вас слушает и меняет направление;
  • если вы задумались и замолчали, она не примет это за «конец фразы» и не оборвёт вас.

Короче говоря, GPT-Live реализует разговор в реальном времени без «ожидания своей очереди».

2. Чем он отличается от прежнего Advanced Voice Mode

Прежний ИИ-голос (Advanced Voice Mode) работал по очереди реплик (полудуплекс). В силу самого устройства у него были такие слабые места.

АспектРаньше: Advanced Voice ModeТеперь: GPT-Live
Базовый принциппо очереди реплик (полудуплекс) — ждёт, когда вы договоритеполный дуплекс — слушает и одновременно говорит
Как определяется конец репликипо тишине (молчанию)не ждёт чёткой паузы: слушая, следит за паузами, перебиваниями и сменой темпа и решает на ходу
Пауза на раздумьечасто принимает за «конец» и перебиваетумеет ждать, не обрывая
Поддакиваниепо сути отсутствуетвставляет «mhmm», «yeah» и т. п.
Перебиваниеиногда обрывается неестественновоспринимает и подстраивается
Частота решенийраз за репликунесколько раз в секунду (говорить/слушать/выдержать паузу/перебить/вызвать инструмент)

По данным OpenAI, в сравнении, где люди оценивали разговоры длиной 5–10 минут в одинаковых условиях, и GPT-Live-1, и GPT-Live-1 mini заметно предпочитались Advanced Voice Mode. Кроме того, улучшения отмечены в GPQA (экспертные научные рассуждения), BrowseComp (агентный веб-поиск) и в задачах клиентской поддержки.

3. Как это работает — решения каждую секунду и передача задач фоновой модели

GPT-Live непрерывно обрабатывает голосовой ввод и одновременно генерирует голосовой вывод, множество раз в секунду решая, «что делать сейчас» — говорить, продолжать слушать, выдержать паузу, перебить или вызвать инструмент. Именно это высокочастотное принятие решений и создаёт человеческий темп.

Ещё одна важная особенность конструкции — «глубокая обработка делегируется фоновой модели». За мгновенность разговора отвечает GPT-Live, а когда требуется веб-поиск, глубокое рассуждение или сложная работа, обработка передаётся в фоне более крупной модели (на момент запуска — GPT-5.5), и по готовности результат возвращается в разговор. Это механизм, который позволяет «думать», не прерывая беседу.

В анонсе OpenAI написала, что «по мере выхода новых передовых моделей мы будем постоянно обновлять модель, которую использует GPT-Live», — так и вышло: с 9 сентября 2026 года голосовой режим использует GPT-5.6 или GPT-6 Astra (заметки о выпуске OpenAI). То есть название фоновой модели будет меняться и дальше. Запоминать стоит не название, а устройство: одна часть ведёт разговор, другая думает. Насколько умны ответы, зависит от фоновой модели, а насколько легко разговаривать — от GPT-Live.

На старте глубину рассуждений выбирали из трёх уровней: Instant (GPT-5.5 Instant) / Medium / High (GPT-5.5 Thinking). Эти уровни, существовавшие только для голоса, упразднены 9 сентября 2026 года; теперь модель и глубину рассуждений выбирают теми же элементами управления, что и в текстовом чате (что доступно, зависит от тарифа; заметки о выпуске OpenAI). Сама логика не изменилась: для лёгкой беседы — скорость, для сложных консультаций — больше размышлений.

4. Две модели и доступ по тарифам

ТарифНа старте (8 июля 2026 г.)На 25 сентября 2026 г. (голос в Chat, за 24 часа)
FreeGPT-Live-1 miniGPT-Live-1 mini (ограниченно; лимиты могут меняться)
GoGPT-Live-13 часа с GPT-Live-1 mini
PlusGPT-Live-13 часа с GPT-Live-1
ProGPT-Live-115 часов на тарифе за $100, без ограничений на тарифе за $200 (GPT-Live-1)
Business / Enterprise / EduНедоступноДоступно в зависимости от настроек рабочего пространства. У Business Standard — 3 часа, у Premium — 15; сверх этого — 1,25 кредита за минуту

Главное — даже на бесплатном тарифе можно пользоваться mini-версией GPT-Live. Естественный полнодуплексный разговор не ограничен платными тарифами. На старте на Go/Plus/Pro по умолчанию был GPT-Live-1, но с 9 сентября 2026 года Go перешёл на GPT-Live-1 mini, а Plus и Pro больше не переключаются на mini после исчерпания лимита голоса (заметки о выпуске OpenAI). Рабочие пространства Business, Enterprise и Edu, не охваченные на старте, теперь могут им пользоваться в зависимости от настроек (OpenAI Help). Доступен в ChatGPT для iOS, Android и на ChatGPT.com, развёртывание шло поэтапно по всему миру. Лимиты пересматриваются, поэтому перед тем как на них рассчитывать, сверьтесь с таблицей в OpenAI Help.

5. Ключевые улучшения

🗣️ Поддакивание (обратный канал)

Пока вы говорите, реагирует «угу». Возникает ощущение, что вас слушают.

⏱️ Быстрый обмен репликами

Много раз в секунду решает, говорить или слушать дальше, и отвечает в темпе разговора. Числа задержки нет ни в анонсе OpenAI, ни на странице модели.

✋ Следует за перебиванием

Даже если перебить в середине, он слушает и корректирует ход мысли.

🤫 Не обрывает паузу

Не принимает паузу на раздумье за «конец фразы» и ждёт.

6. Текущие ограничения — честно о том, что стоит учесть

Ожидания легко опережают реальность, поэтому стоит честно сказать, чего он не умеет. Ниже ограничения на момент запуска разделены на те, что остаются в силе, и те, что уже сняты (на 25 сентября 2026 года).

  • 🟡 Нет видео и демонстрации экрана: как и на старте, Live не работает с видеовходом и демонстрацией экрана (OpenAI Help). Если они нужны, переключитесь на прежний голосовой режим Advanced в приложении для iOS или Android.
  • 🟡 Полная поддержка всех языков ещё впереди: на старте OpenAI писала, что GPT-Live оптимизирован под самые популярные языки, а в некоторых возможны неродной акцент и пробелы в беглости.
  • 🟡 Рассчитан на разговор один на один: пока не оптимизирован для нескольких говорящих одновременно и может реагировать, когда люди разговаривают друг с другом (OpenAI Help).
  • 🟢 API уже доступен: на старте он был «скоро», а 10 сентября 2026 года стал общедоступным (см. главу 8).
  • 🟡 Поэтапное развёртывание: какие функции у вас есть и когда они появятся, зависит от тарифа, региона, настроек рабочего пространства и версии приложения.

Ожидается, что в будущих обновлениях это будет расширено, но стоит понимать, что «и видео, и экран — прямо сейчас» это не про текущий момент.

7. Где это пригодится

  • Консультация и «прокачка идей» без рук: на ходу или во время работы проговаривать мысли вслух и упорядочивать их. Паузу не обрывают, поэтому ход мысли реже прерывается.
  • Разговорная практика языка: за счёт поддакиваний и естественного перебивания практика ближе к настоящему разговору.
  • Поиск и конспекты голосом: глубокий поиск передаётся фоновой модели, так что можно разбираться в вопросе прямо во время разговора.
  • Поручать работу голосом: с 23 сентября 2026 года с ChatGPT Work можно говорить в вебе и на телефоне и просить подготовить документы, слайды и таблицы. Если задача ещё выполняется, когда вы завершаете звонок, она продолжится в текстовом режиме (нужен доступ и к Voice, и к Work; заметки о выпуске OpenAI).
  • Доступность: там, где печатать сложно, помогает голосовой интерфейс с хорошим темпом.

В OpenAI Help есть и конкретные советы, как пользоваться им удобнее.

  • Хотите думать вслух — предупредите заранее: в начале скажите что-то вроде «подожди, пока я не попрошу ответить», и он будет сдерживаться. Долгие паузы и фоновые звуки всё же могут вызвать ответ.
  • Если он часто перебивает, измените условия: наденьте наушники, перейдите в место потише или прибавьте громкость. На iPhone откройте Пункт управления, выберите «Режим микрофона» и включите «Изоляцию голоса».
  • Для надиктованного текста используйте диктовку: расшифровка голосового разговора не дословна и может расходиться со сказанным. Если нужно проверить и отредактировать сказанное перед отправкой, диктовка (Dictation) подходит лучше, чем разговор (Voice).
  • Знайте, как обращаются с записями: аудиофрагменты хранятся вместе с расшифровкой чата 30 дней. Для обучения их используют, только если вы сами включили передачу (в Business, Enterprise и Edu передавать их нельзя). Расшифровки могут использоваться в зависимости от настройки «Улучшать модель для всех».

8. Статус API и отличие от GPT-Realtime

На старте API GPT-Live был «скоро», и разработчики и компании могли лишь подписаться на уведомления. Затем, 10 сентября 2026 года, он стал общедоступным в API (журнал изменений API OpenAI). По данным страницы модели на 25 сентября 2026 года, ID модели — gpt-live-1, она работает через отдельный эндпоинт Live (v1/live/sessions), а голосовые сессии стоят $0.05 в минуту с посекундной тарификацией. Фоновая модель и инструменты оплачиваются отдельно.

В API, как и в ChatGPT, схема такая: GPT-Live ведёт разговор, а бэкенд думает. Бэкенд можно доверить OpenAI или подключить собственного агента или сервис (официальное руководство). Проверка прав и всё, что затрагивает ваши собственные системы, по-прежнему остаётся за вашим приложением.

Чтобы не путаться: в API есть и голосовые модели, отдельные от GPT-Live, — GPT-Realtime-2.1 / GPT-Realtime-2.1 mini (вышли 6 июля 2026 года), голосовые модели с рассуждениями и вызовом инструментов для Realtime API. Устроены они по-разному: GPT-Live — полнодуплексный собеседник, который слушает, пока говорит, и передаёт размышления бэкенду, а GPT-Realtime — основа для голосовых агентов на Realtime API. Когда что выбирать, сравнивает руководство OpenAI по голосовым агентам.

Итоги

  • GPT-Live — новая модель, переводящая голос ChatGPT с «очереди реплик» на полный дуплекс (слушать и говорить одновременно) (8 июля 2026 г., по всему миру).
  • Поддакивание, перебивание и терпимость к паузам обеспечивают темп разговора, близкий к человеческому. Заметно предпочитается Advanced Voice Mode.
  • GPT-Live отвечает за живость разговора, а глубокие рассуждения и поиск передаются фоновой модели (на старте — GPT-5.5; с 9 сентября 2026 года — GPT-5.6 или GPT-6 Astra).
  • Free и Go используют GPT-Live-1 mini, Plus и Pro — GPT-Live-1 (на 25 сентября 2026 года). Business, Enterprise и Edu могут пользоваться им в зависимости от настроек. Доступен в ChatGPT для iOS/Android/веба.
  • Текущие ограничения: нет видео и демонстрации экрана, полной поддержки всех языков пока нет. API стал общедоступным 10 сентября 2026 года ($0.05 в минуту). GPT-Realtime-2.1 — отдельная линейка голосовых моделей API.

FAQ

Q1. Можно ли пользоваться GPT-Live бесплатно?

Да. На бесплатном тарифе доступен GPT-Live-1 mini в ограниченном объёме. На 25 сентября 2026 года Go тоже использует GPT-Live-1 mini (до 3 часов в день), а Plus и Pro — старшую GPT-Live-1. Доступно в ChatGPT для iOS, Android и веба (поэтапное развёртывание).

Q2. Что конкретно означает «полный дуплекс»?

Это способ, при котором можно слушать и говорить одновременно, как по телефону. В отличие от прежней очереди реплик (ответ после того, как вы договорите), система может вставлять поддакивания, пока вы говорите, воспринимать перебивание и ждать, не обрывая вашу паузу на раздумье.

Q3. В чём главное отличие от прежнего Advanced Voice Mode?

В способе определения конца реплики. Раньше это делалось по тишине (молчанию), поэтому пауза на раздумье часто принималась за «конец» и следовало перебивание. GPT-Live не ждёт чёткой паузы: слушая, он следит за паузами, перебиваниями и сменой темпа и много раз в секунду решает, ответить или слушать дальше (системная карточка OpenAI), поэтому его сложнее оборвать и он звучит естественнее. В оценках людьми он тоже заметно предпочитается.

Q4. Справляется ли он со сложными вопросами?

Да. GPT-Live отвечает за живость разговора, а когда нужен веб-поиск или глубокие рассуждения, передаёт обработку фоновой модели и возвращает результат в разговор. На старте это была GPT-5.5; с 9 сентября 2026 года используется GPT-5.6 или GPT-6 Astra, а модель и глубину рассуждений выбирают теми же элементами управления, что и в текстовом чате.

Q5. Можно ли использовать видео или демонстрацию экрана?

Нет, на 25 сентября 2026 года — нет. Live не поддерживает видео и демонстрацию экрана, поэтому, когда они нужны, переключитесь на прежний режим Advanced в приложении для iOS или Android (OpenAI Help). На старте OpenAI говорила, что работает над добавлением этих возможностей.

Q6. Можно ли встроить его в своё приложение через API?

Да. API GPT-Live стал общедоступным 10 сентября 2026 года; ID модели — gpt-live-1, голосовые сессии стоят $0.05 в минуту (фоновая модель и инструменты оплачиваются отдельно). Есть и отдельная линейка GPT-Realtime-2.1 / mini, так что выбирайте в зависимости от того, что важнее: естественность разговора или опора на уже существующий Realtime API.

Q7. Как он выглядит на фоне Gemini Live от Google?

Gemini Live от Google позволяет во время разговора показывать изображение с камеры или экран телефона (справка Gemini Live). GPT-Live на 25 сентября 2026 года не поддерживает видео и демонстрацию экрана, поэтому, если нужно показать то, что вы видите, преимущество у Gemini Live. Сильная сторона GPT-Live, которую выделяет OpenAI, — естественность полнодуплексного разговора: он подаёт знаки, что слушает, пока вы говорите, принимает перебивания посреди фразы и ждёт, пока вы обдумываете мысль. Цифр задержки OpenAI не публиковала, поэтому сравнить скорость ответа нельзя. Подробнее см. также сравнение GPT-5.6 и Gemini.

Похожие статьи

Для готового MP3 или M4A, который вы хотите прикрепить к разговору, прочитайте руководство по загрузке аудио в ChatGPT: поддерживаемые форматы, платные планы, проверка расшифровки, отдельная оплата API и ограничения хранения.