Дополнение от 29 сентября 2026 г.: в этой статье сравниваются GPT-5.6 Sol и Gemini 3.1 Pro по состоянию на июль 2026 года. С тех пор OpenAI выпустила GPT-6 Astra (3 сентября), а 22 сентября (по времени США) — GPT-6 Sol и GPT-6 Luna, следующее поколение после сравниваемой здесь GPT-5.6 Sol. По состоянию на 30 сентября 2026 года список моделей API советует начинать с Astra, если вы не уверены в выборе, брать GPT-6.1 Sol (вышла 29 сентября; в ChatGPT доступна в Work и Codex, но не в чате) для баланса интеллекта и стоимости ($2 за вход / $10 за выход на миллион токенов) и GPT-6 Luna для больших объёмов работы, где важна цена (GPT-5.6 Sol остаётся доступной на переходный период). Google 2 сентября открыла общий доступ к Gemini 3.8 Flash, но Gemini 3.1 Pro в API всё ещё предварительная версия, а Gemini 3.5 Pro, который здесь назван ещё не вышедшим, по состоянию на 22 сентября всё ещё отсутствовал на странице цен и в примечаниях к выпускам Gemini API. Anthropic также выпустила Claude Opus 5 (24 июля), Claude Fable 5.1 (1 сентября) и Claude Opus 5.5 (22 сентября). О стоимости см. наше сравнение Astra на low и GPT-5.6 Sol на high по замерам. 22 сентября мы исправили цену Gemini 3.1 Pro на $2/$12 и заменили его результат в Terminal-Bench на значение версии 2.1 (70.7%) — той же, что у Sol. Слова «флагман», «текущий» и значения бенчмарков ниже приведены на момент написания, если не указана дата.
Содержание
- 1. Позиционирование — «агентный Sol» против «мультимодального Gemini»
- 2. С каким Gemini сравнивать — 3.5 Pro ещё не вышел
- 3. Краткая таблица характеристик
- 4. Подробное сравнение бенчмарков
- 5. Мультимодальность — главный козырь Gemini
- 6. Реальная стоимость — Gemini стоит около 40% от Sol
- 7. Карта сильных и слабых сторон
- 8. Как выбирать под задачу
- Итоги
- FAQ
Флагман OpenAI GPT-5.6 «Sol» (общедоступен с 9 июля 2026 г.) и Gemini от Google. Это сравнение выглядит иначе, чем прежние противостояния с Claude (против Opus 4.8 / против Fable 5). Sol доминирует в агентном и терминальном кодинге, а Gemini отвечает нативной мультимодальностью и ценой — их сильные стороны почти не пересекаются.
Есть и ещё одна важная «ловушка времени». Настоящий конкурент от Google, Gemini 3.5 Pro, на момент написания статьи ещё не поступил в общий доступ (из-за полной переработки архитектуры выход сдвинулся на середину июля 2026 г.). Поэтому справедливым объектом сравнения на сегодня остаётся текущий флагман — Gemini 3.1 Pro. В этой статье мы явно обозначаем это допущение и на основе официальных заявлений и независимых бенчмарков разбираем реальную мощь, цену, мультимодальность и выбор под конкретные задачи.
Агент против мультимодальности
— два лидера, чьи сильные стороны почти не пересекаются
Sol: доминирует в терминальном и агентном кодинге / Gemini: отвечает мультимодальностью и ценой
1. Позиционирование — «агентный Sol» против «мультимодального Gemini»
GPT-5.6 Sol — чемпион терминального и агентного кодинга
Sol — флагман линейки GPT-5.6 (Luna/Terra/Sol). С 88.8% в Terminal-Bench 2.1 (автономное управление терминалом) и 64.6% в SWE-bench Pro (исправление реальных репозиториев) он значительно опережает Gemini в области кодинг-агентов. GPQA Diamond — тоже топ-уровень, 94.6% (все три значения — из оценочной таблицы OpenAI). Его оружие — зрелость в роли «агента, который автономно пишет код и управляет терминалом» (источники: официальные заявления OpenAI и Vellum).
Gemini 3.1 Pro — гигант нативной мультимодальности и цены
Оружие Gemini 3.1 Pro — мультимодальность, обрабатывающая нативно не только текст, но и звук и видео, контекст в 1 млн токенов и цена за единицу около 40% от цены Sol. С 92.6% в MMMLU (многоязычные вопросы на знания) и 77.1% в ARC-AGI-2 (обе цифры опубликованы Google) он силён и в общих знаниях, и в абстрактном рассуждении. Идея Gemini — «одна модель, дёшево и широко работающая с изображением, звуком, видео и текстом» (источники: Google DeepMind и различные независимые бенчмарки).
2. С каким Gemini сравнивать — 3.5 Pro ещё не вышел
Перед сравнением нужно точно понимать текущую линейку Gemini. Ошибка здесь делает сравнение бессмысленным.
Выпущен в феврале 2026 г. Объект сравнения в этой статье. Силён в мультимодальности, длинном контексте и цене.
Быстрая и недорогая модель, вышедшая в мае 2026 г. Это не прямой соперник флагмана Sol (другой класс).
Настоящий конкурент от Google. Из-за полной переработки архитектуры GA запланирован на середину июля 2026 г. На сегодня недоступен.
Иначе говоря, если сравнивать «GPT-5.6 vs Gemini» честно на сегодняшний день, соперником будет Gemini 3.1 Pro. Sol — модель июля 2026 г., а Gemini 3.1 Pro — февраля 2026 г., так что разрыв поколений около 5 месяцев нужно учитывать при чтении. И с выходом Gemini 3.5 Pro расклад, особенно в кодинге, может измениться — воспринимайте эту статью как «снимок до появления 3.5 Pro».
3. Краткая таблица характеристик
| Параметр | GPT-5.6 Sol | Gemini 3.1 Pro |
|---|---|---|
| Разработчик | OpenAI | |
| Релиз | 9 июля 2026 г. | 19 февраля 2026 г. |
| Длина контекста | 1 050 000 tokens | 1 000 000 tokens |
| Макс. вывод | 128 000 tokens | 64 000–65 000 tokens |
| Дата отсечки знаний | 16 февраля 2026 г. | Официально не указана |
| Цена API | $5 / $30 per MTok (по промотарифу на три месяца с 21 августа 2026 г. — $4 / $20) | $2 / $12 per MTok (ввод до 200K токенов; сверх этого $4 / $18) |
| Модальности | текст + изображение (звук — отдельная модель GPT-Live) | текст + изображение + звук + видео (нативно) |
| Ядро сильных сторон | терминальный и агентный кодинг, математика, рассуждение | мультимодальность, длинный контекст, цена, общие знания |
* Цены и характеристики основаны на официальных заявлениях компаний. SWE-bench Pro для Sol (64.6%) взят из оценочной таблицы анонса GPT-5.6 от OpenAI; в той же таблице у Gemini 3.1 Pro указано 54.2% — столько же, сколько в карточке модели Google, — и оттуда же значения Terminal-Bench 2.1 для обеих моделей. Одновременно OpenAI опубликовала анализ, по которому около 30% задач SWE-bench Pro содержат дефекты. Бенчмарки различаются условиями и временем измерения, это не строгое сравнение на одном поле.
4. Подробное сравнение бенчмарков
В кодинге и агентах Sol лидирует с большим отрывом
| Бенчмарк | Что измеряет | GPT-5.6 Sol | Gemini 3.1 Pro | Победитель |
|---|---|---|---|---|
| Terminal-Bench 2.1 | Автономное управление терминалом | 88.8% | 70.7% | 🥇 Sol |
| SWE-bench Pro | Исправление багов в реальных репозиториях | 64.6% | 54.2% | 🥇 Sol |
| GPQA Diamond | STEM-рассуждение уровня аспирантуры | 94.6% | 94.3% | 🤝 почти равны |
| MMMLU | Многоязычные вопросы на знания | — | 92.6% | — (у Sol нет опубликованного значения) |
| ARC-AGI-2 | Абстрактное рассуждение | 92.5% (опубликовано в сент. 2026) | 77.1% | 🥇 Sol (измеряли разные организации) |
| Мультимодальность (звук, видео) | Нативная поддержка | △ (отдельная модель GPT-Live) | ◎ нативно | 🥇 Gemini |
Кодинг и агенты — вотчина Sol (Terminal-Bench +18 п., SWE-bench Pro +10 п.; оба сравнения — по одной версии в оценочной таблице OpenAI). При этом GPQA почти на равных. В ARC-AGI-2 значение Sol 92.5%, опубликованное OpenAI вместе с GPT-6 Astra в сентябре 2026 года, выше 77.1%, опубликованных Google для Gemini 3.1 Pro, хотя измеряли их разные организации. MMMLU сравнить нельзя: у Sol нет опубликованного значения. По бенчмаркам впереди Sol; сильные стороны Gemini — мультимодальность и цена, о которых дальше. В итоге правильный ответ всё равно — выбирать того, чья специализация ближе к вашей задаче.
5. Мультимодальность — главный козырь Gemini
Главное отличие Gemini — «одна модель нативно работает со звуком, видео, изображением и текстом». Сама текстовая модель GPT-5.6 принимает вход вплоть до изображения, а звук выделен в отдельную модель GPT-Live (полнодуплексный звук). То есть в интегрированных рабочих процессах с пониманием видео и звука Gemini структурно в выигрыше.
И наоборот, в чистой генерации кода, терминальных агентах и длительном автономном кодинге побеждает Sol. Первая точка развилки — «ввод/вывод в основном текст/код или включает звук и видео».
6. Реальная стоимость — Gemini стоит около 40% от Sol
По цене за единицу у Sol $5/$30, а у Gemini 3.1 Pro $2/$12 (ввод до 200K токенов; сверх этого $4/$18). И по вводу, и по выводу Gemini стоит около 40% от Sol. Однако с 21 августа 2026 г. у Sol действует промотариф на три месяца ($4/$20), и в этот период разрыв сокращается до 2 раз по вводу и примерно 1.7 раза по выводу. Для задач, где нужно дёшево обрабатывать большие объёмы, ценовое преимущество Gemini работает.
- Преимущество Gemini: цена за единицу около 40% от Sol. При вводе свыше 200K токенов Gemini дорожает до $4/$18, но и это дешевле Sol.
- Контраргумент со стороны Sol: эффективность токенов в кодинге выросла на 54%, поэтому в генерации кода объём вывода уменьшается и реальная разница в стоимости сокращается. К тому же при более высоком проценте успеха на задачу возможен разворот за счёт стоимости переделок.
Вывод — «ради дешевизны, мультимодальности и универсальности — Gemini, ради процента успеха в кодинге — Sol». Смотреть надо не только на цену за единицу, но и на «стоимость на выполненную задачу» — так же, как в сравнениях с другими моделями. Если нужно ужать стоимость на стороне GPT-5.6, вместо Sol используйте Terra ($2/$12) — после снижения цен 30 июля 2026 г. она стоит столько же, сколько Gemini 3.1 Pro при вводе до 200K токенов ($2/$12).
7. Карта сильных и слабых сторон
Sol — в агентах, Gemini — в мультимодальности
- ·Большой отрыв в терминальном и агентном кодинге
- ·Силён в SWE-bench Pro, математике и GPQA
- ·Макс. вывод 128K — длинные результаты за один заход
- ·Эффективность токенов +54% (кодинг)
- ·Звук и видео не поддерживаются нативно (отдельная модель)
- ·Цена за единицу примерно в 2.5 раза выше, чем у Gemini
- ·MMLU, SWE-bench Verified и др. не опубликованы
- ·Нативная мультимодальность вплоть до звука и видео
- ·Цена за единицу около 40% от Sol
- ·В GPQA почти наравне с Sol (94.3%)
- ·Интеграция с Google Workspace
- ·Крупно проигрывает в терминальном и агентном кодинге
- ·Макс. вывод 64K — вдвое меньше, чем у Sol
- ·Поколение февраля 2026 г. староватое (ждём 3.5 Pro)
8. Как выбирать под задачу
| Сценарий | Рекомендуемая модель | Причина |
|---|---|---|
| Терминальный и автономный кодинг-агент | Sol | Большой отрыв: Terminal-Bench 88.8%, SWE-bench Pro 64.6% |
| Исправление багов в реальных репозиториях, крупные PR | Sol | Высокий процент успеха правок кода |
| Математика и строгое рассуждение | Sol | Преимущество в математике, GPQA на равных |
| Мультимодальная обработка со звуком и видео | Gemini | Одна модель нативно охватывает звук и видео |
| Массовая обработка и длинный контекст с упором на стоимость | Gemini | Цена за единицу около 40% от Sol. На стороне GPT Terra стоит столько же |
| Работа с центром на Google Workspace | Gemini | Гладкая интеграция экосистемы |
Итоги
- GPT-5.6 Sol: доминирует в терминальном и агентном кодинге (Terminal-Bench 88.8% vs 70.7%, SWE-bench Pro 64.6% vs 54.2%). Силён в математике и GPQA. Но звук и видео — через отдельную модель, а цена за единицу примерно в 2.5 раза выше.
- Gemini 3.1 Pro: нативная мультимодальность вплоть до звука и видео и цена за единицу около 40% от Sol. В GPQA почти на равных, но в кодинге проигрывает с большим отрывом.
- Замечание о времени: настоящий конкурент Gemini — 3.5 Pro — на момент статьи ещё не вышел (GA планировался на середину июля, но и на 22 сентября 2026 года модель всё ещё недоступна). После его появления расклад, особенно в кодинге, может измениться.
- Как выбирать: кодинг/агенты = Sol, мультимодальность/низкая стоимость/универсальность = Gemini. Их сильные стороны не пересекаются, поэтому выбирайте «того, чья специализация ближе».
- Оптимизация стоимости: если на стороне GPT нужно ужать цену за единицу, используйте не Sol, а Terra ($2/$12) — это столько же, сколько Gemini (до 200K токенов: $2/$12).
FAQ
Q1. GPT-5.6 Sol и Gemini — кто сильнее в кодинге?
Sol явно выше. В автономном управлении терминалом Terminal-Bench 2.1 — 88.8% против 70.7%, в исправлении реальных репозиториев SWE-bench Pro — 64.6% против 54.2% (всё — из оценочной таблицы OpenAI); в обоих случаях Sol лидирует с большим отрывом. Для автономных кодинг-агентов Sol — первый выбор.
Q2. Почему сравнение с «Gemini 3.1 Pro», а не с «3.5 Pro»?
Потому что Gemini 3.5 Pro на момент написания статьи ещё не поступил в общий доступ (из-за полной переработки архитектуры GA запланирован на середину июля 2026 г.). Текущий флагман Pro — это 3.1 Pro, поэтому справедливый объект сравнения именно он. С выходом 3.5 Pro разрыв, особенно в кодинге, может сократиться. По состоянию на 22 сентября 2026 года 3.5 Pro всё ещё нет ни на странице цен, ни в примечаниях к выпускам Gemini API.
Q3. Кто сильнее в мультимодальности (звук, видео)?
Gemini. Одна модель нативно обрабатывает звук, видео, изображение и текст. Текстовая модель GPT-5.6 принимает вход вплоть до изображения, а звук вынесен в отдельную модель GPT-Live. В понимании видео и интегрированных процессах со звуком Gemini структурно в выигрыше.
Q4. Кто дешевле по стоимости?
Цена Gemini 3.1 Pro за единицу — около 40% от Sol ($2/$12 при вводе до 200K токенов против $5/$30 у Sol; разрыв сокращается, пока у Sol действует промотариф $4/$20). Правда, у Sol эффективность токенов в кодинге улучшена на 54%, и в генерации кода объём вывода уменьшается, сокращая реальную разницу. Если на стороне GPT нужно ужать цену за единицу, используйте не Sol, а Terra ($2/$12) — после снижения цен 30 июля 2026 г. она стоит столько же, сколько Gemini (до 200K токенов: $2/$12).
Q5. Кто выше в рассуждении и знаниях?
В STEM уровня аспирантуры GPQA Diamond — 94.6% против 94.3%, почти паритет (значение Sol — из оценочной таблицы OpenAI, Gemini — от Google). В абстрактном рассуждении ARC-AGI-2 значение Sol 92.5%, опубликованное OpenAI в сентябре 2026 года, выше 77.1% у Gemini 3.1 Pro, но измеряли их разные организации. Многоязычные знания (MMMLU, Gemini 92.6%) сравнить нельзя: у Sol нет опубликованного значения.
Q6. Так что же в итоге выбрать?
Решайте по задаче. Для генерации кода, терминальных агентов и математики — Sol, для мультимодальности со звуком и видео, низкой стоимости и интеграции с Google Workspace — Gemini. Их сильные стороны не пересекаются, поэтому правильно выбирать не по суммарному баллу, а «того, кто ближе к вашей основной задаче». Разумно и использовать обе модели, распределяя их по задачам.
Q7. А что, если добавить сюда Claude?
В кодинге производственного уровня семейство Claude (у Fable 5 в SWE-bench Pro 80.0% и по оценочной таблице OpenAI, и по системной карте Anthropic) в отдельных случаях превосходит Sol. Подробнее — в статьях Sol vs Claude Opus 4.8 / vs Claude Fable 5. В 2026 году стандартом стала мультимодельная работа — «распределять GPT/Claude/Gemini по задачам».
Связанные статьи
- GPT-5.6 — полный разбор релиза — детали трёх моделей Luna/Terra/Sol
- GPT-5.6 Sol vs Claude Opus 4.8 — против Claude (тот же ценовой сегмент)
- GPT-5.6 Sol vs Claude Fable 5 — против Claude (флагман)
- Что такое Google Gemini — основы Gemini
- GPT-5.6 vs GPT-5.5: от одного флагмана к трём моделям — Terra за 40% цены