Дополнение от 25 сентября 2026 г.: в этой статье сравниваются Claude Opus 4.8 и GPT-5.6 Sol по состоянию на июль 2026 года. С тех пор Anthropic выпустила Claude Opus 5 (24 июля) и Claude Fable 5.1 (1 сентября), а OpenAI — GPT-6 Astra (3 сентября). О стоимости см. наше сравнение Astra на low и Sol на high по замерам. Затем, 22 сентября, Anthropic выпустила Claude Opus 5.5, а OpenAI (по времени США) — GPT-6 Sol и GPT-6 Luna, следующее поколение после GPT-5.6 Sol. Сейчас Anthropic советует, если вы не уверены в выборе, для большинства задач начинать с Opus 5.5. Opus 4.8 по-прежнему доступна в API как модель со статусом Legacy, а GPT-5.6 Sol остаётся доступной на переходный период. Слова «флагман», «лидирует» и значения бенчмарков ниже приведены на момент написания. 22 сентября мы также исправили значения бенчмарков по первоисточникам. GPQA Diamond и FrontierMath, которые мы называли неопубликованными, есть в таблице оценок OpenAI, и в обоих впереди Sol. В той же таблице Sol (77.1%) опережает Opus 4.8 (68.1%) и в GraphWalks 1M, поэтому мы исправили утверждение, будто в математике и длинном контексте лидирует Opus.
Содержание
- 1. Позиционирование моделей и различия в философии
- 2. Сводная таблица характеристик
- 3. Подробное сравнение бенчмарков
- 4. Проверяем «проблему закрытых бенчмарков»: что есть в таблице и чего нет
- 5. Реальная стоимость — цена за токен и эффективность
- 6. Карта сильных и слабых сторон
- 7. Как выбрать под конкретную задачу
- 8. Стратегия миграции и совместного использования
- Итоги
- FAQ
К июлю 2026 года на сцену вышли две модели, спорившие за роль главной в AI-программировании. Anthropic Claude Opus 4.8 (релиз 28 мая) и старшая модель «Sol» в линейке OpenAI GPT-5.6 (общий доступ с 9 июля). GPT-5.6 представлена тремя моделями Luna/Terra/Sol, и Sol — старшая из них.
Обе модели заявлены как «основа агентов нового поколения» и сталкиваются лоб в лоб, но их сильные стороны на удивление противоположны. Sol лидирует в работе с терминалом и в общей агентной мощи, а Opus 4.8 — в кодинге производственного уровня и в «честности»: разделение ролей видно отчётливо. В этой статье мы делаем детальное сравнение на основе официальных публикаций обеих компаний и независимых бенчмарков (Vellum, Artificial Analysis и др.) и с практической точки зрения разбираем, «какую же модель и как использовать».
Два лидера борьбы за первенство в кодинге
— сильные области почти противоположны
Opus 4.8: силён в решении задач в реальной кодовой базе и в надёжности — «мастер-ремесленник»
Sol: силён в работе с терминалом и общей агентной мощи — «универсал»
1. Позиционирование моделей и различия в философии
На момент выхода обе модели метили в «главную роль для агентных нагрузок», но их аргументы чётко расходятся.
Claude Opus 4.8 — «ремесленник, доводящий дело до конца в реальной кодовой базе»
Anthropic сделала главным в Opus 4.8 не «прибавку в бенчмарках», а «большую честность». Модель показала 69.2% на SWE-bench Pro (измеряет правку реальных GitHub-репозиториев; +4.9 п.п. к 64.3% у предыдущего Opus 4.7) и удержала первенство в кодинге производственного уровня. Кроме того, на первый план вынесены показатели надёжности и добросовестности: по анонсу Anthropic, модель примерно в четыре раза реже предшественницы пропускает без замечаний дефекты в написанном ею коде, а в Transparency Hub Anthropic указано, что о важных сбоях в своей работе (непрошедшие тесты, так и не сделанные функции) она не сообщает пользователю лишь в 3.7% случаев.
GPT-5.6 Sol — «универсальный агент, управляющий терминалом»
OpenAI выпустила GPT-5.6 в виде трёх моделей (Luna/Terra/Sol), поставив Sol на вершину. С 88.8% на TerminalBench 2.1 (автономное управление терминалом), 53.6 на Agents' Last Exam (долгие реальные задачи в 55 областях) и 80 на Artificial Analysis Coding Agent Index (метрика кодинг-агентов) она берёт первенство в планировании, работе с терминалом и общей агентной мощи. Вдобавок эффективность по токенам в кодинге выросла на 54%, а сама модель заявлена как «самая мощная модель для кибербезопасности» (источник: официальные публикации OpenAI, CNBC, Vellum).
Глубина и честность vs широта и эффективность
- · Глубоко и точно правит реальную кодовую базу
- · Опережает Sol в SWE-bench Pro (69.2% против 64.6%)
- · Примерно в 4 раза реже пропускает дефекты в своём коде
- · Цена низкая и без изменений ($5/$25)
- · Первенство в терминале и общей агентной мощи
- · Первенство в TerminalBench / Agents' Last Exam
- · Эффективность по токенам +54%, усилена безопасность
- · Выбор из трёх моделей под задачу (Luna/Terra/Sol)
2. Сводная таблица характеристик
| Параметр | Claude Opus 4.8 | GPT-5.6 Sol |
|---|---|---|
| Поставщик | Anthropic | OpenAI |
| Дата релиза | 28 мая 2026 г. | 9 июля 2026 г. (общий доступ) |
| ID модели | claude-opus-4-8 | gpt-5.6-sol (старшая из Luna/Terra/Sol) |
| Длина контекста | 1,000,000 tokens | 1,050,000 tokens |
| Макс. выходных токенов | 128,000 tokens | 128,000 tokens |
| Дата обрезки знаний | Первая половина 2026 г. (публикуется поэтапно) | 16 февраля 2026 г. |
| Цена API | $5 / $25 per MTok (без изменений) | $5 / $30 per MTok (по промотарифу на три месяца с 21 августа 2026 г. — $4 / $20) |
| Управление рассуждением | параметр effort (4 уровня) + адаптивное мышление | reasoning effort (none/low/medium/high/xhigh/max) |
| Заметные новые функции | dynamic workflows (превью параллельных субагентов для исследований), system-запись в Messages API, fast mode (примерно в 2.5 раза быстрее) | Programmatic Tool Calling (связка инструментов через генерацию JS), ChatGPT Work, дуплексный голос GPT-Live |
| Каналы доступа | Claude.ai (все планы), API, AWS, Vertex AI, Microsoft Foundry | ChatGPT, ChatGPT Work, Codex, OpenAI API |
* Цены и характеристики основаны на официальных публикациях обеих компаний (Opus 4.8 — 28 мая 2026 г., GPT-5.6 — 9 июля 2026 г.). Учтите: значения бенчмарков у двух компаний получены при разных условиях, в разное время и на разных harness, поэтому это не строгое сравнение «на одной площадке». Значения для сравнения двух моделей (SWE-bench Pro, TerminalBench 2.1, Agents' Last Exam, Coding Agent Index, GraphWalks, GPQA Diamond, FrontierMath) взяты из таблицы оценок в анонсе GPT-5.6 от OpenAI, где есть обе модели (Coding Agent Index — показатель Artificial Analysis). Часть значений Opus 4.8 в ней не совпадает с данными самой Anthropic: например, TerminalBench 2.1 — 78.9% в таблице OpenAI и 74.6% в таблице из анонса Anthropic.
3. Подробное сравнение бенчмарков
Часто говорят, что «топовые модели идут ноздря в ноздрю», но по отдельным бенчмаркам видна чёткая разница в тенденциях. Можно смело сказать, что сильные области почти противоположны.
3-1. Кодинг
Решение реального кода — за Opus, работа с терминалом — за Sol
Источник: таблица оценок в анонсе GPT-5.6 от OpenAI (значения Opus 4.8 — из той же таблицы; Coding Agent Index — Artificial Analysis)
Суть в том, что «то, что измеряет бенчмарк», у них разное. SWE-bench Pro измеряет генерацию патчей к реальным GitHub-задачам, то есть способность править существующую кодовую базу. А TerminalBench 2.1 — это набор задач с автономным управлением терминалом из командной строки, где смотрят на производительность цикла «планирование — исполнение». Opus 4.8 выигрывает в первом, Sol — во втором. Это напрямую ведёт к практическому разделению ролей: «крупные PR в реальном репозитории — за Opus, а собрать с нуля через CLI или агента — за Sol».
3-2. Агенты и длительные задачи
| Бенчмарк | Что измеряет | Claude Opus 4.8 | GPT-5.6 Sol | Победитель |
|---|---|---|---|---|
| Agents' Last Exam | Длительные реальные рабочие процессы в 55 областях | 45.2 | 53.6 | Sol |
| Coding Agent Index | Сводная оценка кодинг-агентов | 72.5 | 80 (первое место) | Sol |
| TerminalBench 2.1 | Автономное управление терминалом | 78.9% | 88.8% | Sol |
| SWE-bench Pro | Исправление багов в реальных репозиториях | 69.2% | 64.6% | Opus 4.8 |
| GraphWalks (F1 при длинном контексте 1M) | Отслеживание длинного контекста и разрешение ссылок | 68.1% | 77.1% | Sol |
Источник: таблица оценок в анонсе GPT-5.6 от OpenAI (значения Opus 4.8 — из той же таблицы). 53.6 у Sol в Agents' Last Exam — значение из текста анонса, в таблице на той же странице указано 52.7%.
По широте агентных возможностей Sol шире и сильнее. Разница проявляется в областях, близких к «автономному исполнению» — управление терминалом и долгие комплексные рабочие процессы. Opus 4.8 впереди в точной правке реальной кодовой базы (SWE-bench Pro), а в отслеживании длинного контекста та же таблица ставит выше Sol: GraphWalks 1M — 77.1% против 68.1%. Схема такова: «широта — за Sol, правка реального кода — за Opus».
3-3. Рассуждение, математика, надёжность
В математике и длинном контексте та же таблица — за Sol
Математика исследовательского уровня (Tier 1–3). В той же таблице у Opus 4.8 — 80% (Tier 4: 83% против 56.1%)
F1 при длинном контексте 1M токенов. У Opus 4.8 в той же таблице — 68.1%
STEM уровня аспирантуры. У Opus 4.8 в той же таблице — 92%
В таблице OpenAI, где есть обе модели, Sol впереди в GPQA Diamond (94.6% против 92% у Opus 4.8), FrontierMath (Tier 1–3: 89% против 80%; Tier 4: 83% против 56.1%) и GraphWalks 1M (77.1% против 68.1%), так что назвать математику и длинный контекст главным полем Opus нельзя. Anthropic же выносит на первый план надёжность и добросовестность: по её анонсу, Opus 4.8 примерно в четыре раза реже предшественницы пропускает без замечаний дефекты в написанном ею коде, а в Transparency Hub доля случаев, когда модель не сообщает пользователю о важных сбоях, указана как 3.7% (против 27.6% у Mythos Preview — улучшение в пять раз). Это срабатывает в задачах с высокой ценой ошибки, таких как медицина, юриспруденция и финансы. Однако значений, сравнивающих с Sol в тех же условиях, нет.
4. Проверяем «проблему закрытых бенчмарков»: что есть в таблице и чего нет
На что стоит обратить внимание в этом сравнении: сразу после релиза независимый анализ (Vellum) указал, что OpenAI не опубликовала для GPT-5.6 SWE-bench Verified, GPQA Diamond, AIME, MMLU, ARC-AGI-2 и FrontierMath. Однако в таблице оценок на странице анонса OpenAI, проверенной 22 сентября 2026 года, есть GPQA Diamond (Sol 94.6%, Opus 4.8 92%) и FrontierMath (Tier 1–3: Sol 89%, Opus 4.8 80%; Tier 4: Sol 83%, Opus 4.8 56.1%), и в обоих впереди Sol. Нет SWE-bench Verified, AIME и MMLU, а значение Sol в ARC-AGI-2 (92.5%) впервые появилось в таблице анонса GPT-6 Astra 3 сентября.
SWE-bench Pro у Sol — 64.6% в собственной таблице OpenAI
* Таблица OpenAI отражает выбранные OpenAI показатели и условия, и часть значений Opus 4.8 расходится с данными самой Anthropic (TerminalBench 2.1 — 78.9% в таблице OpenAI и 74.6% в анонсе Anthropic). Сравнивайте только значения внутри одной таблицы.
Даже в таблице оценок, которую OpenAI опубликовала вместе с GPT-5.6, SWE-bench Pro у Sol — 64.6%, ниже 69.2% у Opus 4.8 (оба значения — из одной таблицы OpenAI). То есть в «самой близкой к практике метрике кодинга» — исправлении багов в реальных репозиториях — впереди был Opus 4.8. Одновременно OpenAI опубликовала анализ, по которому около 30% задач SWE-bench Pro некорректны (на это обратил внимание Simon Willison). За яркими агентными баллами в главной цитадели кодинга первенство удерживал Claude — и это главный пункт, разводящий две модели.
5. Реальная стоимость — цена за токен и эффективность
По цене на выходе у Opus 4.8 $25/MTok, у Sol $30/MTok — номинально Opus почти на 20% дешевле. На входе у обоих $5, поровну (правда, с 21 августа 2026 г. у Sol действует промотариф на три месяца — ввод $4, вывод $20, так что в этот период Sol дешевле и по вводу). Однако реальный счёт зависит от того, «сколько токенов выдаётся на одну задачу».
- Аргумент в пользу Sol: OpenAI заявляет, что эффективность по токенам в кодинге выросла на 54%; если объём вывода снижается, разрыв в цене ($30 против $25) в реальной стоимости сокращается — вплоть до разворота.
- Аргумент в пользу Opus: стандартная цена оставлена без изменений и низкой, плюс есть варианты эксплуатации вроде fast mode (примерно в 2.5 раза быстрее). С другой стороны, склонность к «narrate-then-code» (сначала объяснить, потом писать) легко увеличивает объём выходных токенов.
Вывод: по одной только таблице цен исход не определить. Для кодинга, где преобладает вывод, правильно оценивать итоговую сумму как «цена × объём вывода» и сравнивать, замеряя под каждую нагрузку. Идёт перетягивание каната: по номинальной цене дешевле Opus, а по эффективности токенов улучшается Sol.
* Конкретный «множитель реальной стоимости» утверждать нельзя, потому что обе компании не публикуют сравнение выходных токенов при одинаковых условиях. Рекомендуем замерить число выходных токенов обеих моделей на своих типичных задачах и сравнить, умножив на цену.
6. Карта сильных и слабых сторон
Топовые модели одного времени, но характеры прямо противоположны
- · SWE-bench Pro 69.2% — первенство в реальном кодинге
- · Не сообщает о важных сбоях лишь в 3.7% случаев (данные Anthropic; значения Sol нет)
- · Примерно в 4 раза реже предшественницы пропускает дефекты в своём коде
- · Цена на выходе низкая и без изменений ($25)
- · Впереди в Toolathlon даже в таблице OpenAI (59.9% против 58%)
- · В работе с терминалом и общей агентной мощи уступает Sol
- · Из-за склонности к narrate легко растёт объём выходных токенов
- · В Terminal-Bench 2.1 уступает GPT-5.5 даже в таблице Anthropic (74.6% против 78.2%)
- · Нет нативной поддержки голоса и видео
- · TerminalBench 88.8% — первенство в работе с терминалом
- · Первенство в Agents' Last Exam и Coding Agent Index
- · Эффективность по токенам +54%, усилена безопасность
- · Оптимизация под задачу тремя моделями Luna/Terra/Sol
- · Интеграция с ChatGPT Work / Codex / GPT-Live
- · В SWE-bench Pro уступает Opus примерно 4.6 п.п.
- · AIME, MMLU и др. в таблице оценок нет
- · Цена на выходе $30 — выше, чем у Opus
- · Нет прямых сравнительных значений по добросовестности
7. Как выбрать под конкретную задачу
| Сценарий использования | Рекомендуемая модель | Причина |
|---|---|---|
| PR, исправление багов и рефакторинг в реальных репозиториях | Opus 4.8 | SWE-bench Pro 69.2% — первенство в боевом кодинге |
| Математика, научные исследования, строгое рассуждение | Sol | В таблице OpenAI Sol впереди и в FrontierMath (Tier 1–3: 89% против 80%), и в GPQA Diamond (94.6% против 92%) |
| Отслеживание и разрешение ссылок в длинных материалах уровня 1M | Sol | В GraphWalks 1M у Sol в той же таблице 77.1% (у Opus 4.8 — 68.1%) |
| Задачи с высокой ценой ошибки: медицина, юриспруденция, финансы | Opus 4.8 | Примерно в 4 раза реже пропускает дефекты в своём коде; не сообщает о важных сбоях в 3.7% случаев (данные Anthropic; прямого сравнения с Sol нет) |
| Агент, автономно управляющий CLI и терминалом | Sol | TerminalBench 2.1 88.8% — первое место |
| Автоматизация долгих комплексных рабочих процессов | Sol | Agents' Last Exam 53.6 — первое место |
| Анализ кибербезопасности, blue team | Sol | OpenAI позиционирует как «сильнейшую модель для безопасности» |
| Интегрированная работа с ChatGPT/Codex/голосом | Sol | Единое целое с ChatGPT Work, GPT-Live и Codex |
| Массовая обработка с приоритетом на стоимость | Зависит от задачи | Цена ниже у Opus, эффективность улучшена у Sol. Сравните на замерах |
8. Стратегия миграции и совместного использования
Практичное решение — не «сводить всё к одной модели», а «разделять по задачам»: так проще оптимизировать и стоимость, и качество.
Паттерн A. Мультивендорная эксплуатация (рекомендуется)
- Основной кодинг (PR и правки в реальных репозиториях): Opus 4.8
- Автоматизация CLI и терминала: GPT-5.6 Sol
- Автоматизация долгих бизнес-процессов: Sol (или Terra при упоре на стоимость)
- Высоконадёжные задачи с дорогой ценой ошибки: Opus 4.8
- Анализ безопасности: Sol
Паттерн B. Схема с роутером
Через OpenRouter / LiteLLM и т. п. классифицировать тип задачи и динамически распределять. Если задать правило «реальный кодинг — Opus, агентные задачи — Sol, лёгкие задачи с упором на стоимость — GPT-5.6 Terra», можно минимизировать реальную стоимость, сдерживая привязку к вендору. Поскольку GPT-5.6 стала трёхмодельной, стало проще применять и трёхступенчатую схему Luna/Terra/Sol только на стороне OpenAI.
Паттерн C. Одновендорная эксплуатация
Если из-за требований к управлению данными нельзя использовать несколько вендоров, выбирайте по основному назначению. Если у вас большие активы реального кода и во главе угла качество кодинга и надёжность — Opus 4.8; если центр тяжести в автоматизации бизнес-процессов и терминальных агентах — GPT-5.6 (с опорой на Sol и подстройкой стоимости через Terra/Luna) будет прямолинейным выбором.
Итоги
- Opus 4.8: силён в правке реальной кодовой базы (SWE-bench Pro 69.2% — выше 64.6% у Sol даже в таблице OpenAI) и в добросовестности. В математике (FrontierMath, GPQA Diamond) и длинном контексте (GraphWalks 1M) таблица OpenAI, где есть обе модели, ставит впереди Sol. Цена тоже низкая и без изменений. Тип «ремесленник».
- GPT-5.6 Sol: первенство в работе с терминалом (TerminalBench 88.8%), общей агентной мощи (Agents' Last Exam 53.6), эффективности по токенам и безопасности. Тремя моделями проще оптимизировать под задачу. Тип «универсал».
- Важно: в таблице оценок OpenAI есть и GPQA Diamond, и FrontierMath, и в обоих впереди Sol (нет AIME, MMLU и SWE-bench Verified). В SWE-bench Pro даже собственная таблица OpenAI ставит Opus 4.8 впереди, а сама OpenAI поставила этот бенчмарк под сомнение.
- Критерий выбора — не суммарный балл по бенчмаркам, а «какой из бенчмарков ближе к вашей работе». Реальная правка кода и надёжность — Opus; терминал, агенты и широта — Sol.
- Практичное решение — двойная эксплуатация. Разделять по задачам — лучший вариант и по стоимости, и по качеству.
FAQ
Q1. Кто сильнее в кодинге — GPT-5.6 Sol или Claude Opus 4.8?
Зависит от метрики. В SWE-bench Pro (исправление багов в реальных репозиториях) Opus 4.8 с 69.2% превосходит Sol с 64.6%. А в TerminalBench 2.1 (автономное управление терминалом) Sol с 88.8% превосходит Opus с 78.9%. Практичное разделение ролей: «править реальный код — Opus, собирать через CLI или агента — Sol».
Q2. Что дешевле?
По номинальной цене на выходе Opus 4.8 стоит $25, а Sol — $30, так что Opus дешевле (на входе у обоих $5 — у Sol $4 в период промотарифа). Однако Sol улучшил эффективность по токенам в кодинге на 54%, поэтому в зависимости от объёма вывода реальная стоимость сокращается — вплоть до разворота. Надёжнее замерить выходные токены на своих типичных задачах и сравнить итоговую сумму.
Q3. Значение «64.6%» у Sol в SWE-bench Pro — официальное?
Да. Это значение из таблицы оценок, которую OpenAI опубликовала вместе с GPT-5.6. Одновременно OpenAI опубликовала анализ, по которому около 30% задач SWE-bench Pro некорректны, тем самым поставив под сомнение сам бенчмарк. GPQA Diamond и FrontierMath, которые Vellum сразу после релиза назвал неопубликованными, в таблице оценок по состоянию на 22 сентября 2026 года есть, и в обоих впереди Sol (GPQA: Sol 94.6%, Opus 4.8 92%). В таблице нет SWE-bench Verified, AIME и MMLU.
Q4. Что подходит для задач с высокой ценой ошибки — медицины, юриспруденции, финансов?
Opus 4.8. Конструкция с упором на добросовестность: по анонсу Anthropic, модель примерно в четыре раза реже предшественницы пропускает без замечаний дефекты в написанном ею коде, а Transparency Hub указывает, что о важных сбоях она не сообщает пользователю в 3.7% случаев. Это подходит для задач с высокой ценой ошибки. По prompt injection Anthropic сообщает о доле успешных атак 0.4% в недельном открытом конкурсе атак Gray Swan (столько же, сколько у Opus 4.7; у GPT-5.5 — 1.6%). И всё же на путях обработки внешнего ввода нужна отдельная защита.
Q5. Как связаны с Sol остальные модели GPT-5.6 (Terra/Luna)?
GPT-5.6 — это три модели: Luna (быстрая и дешёвая) / Terra (баланс) / Sol (старшая). В этой статье мы взяли Sol как сравнение флагманов на момент написания. Если важна стоимость, Terra даёт уровень GPT-5.5 за полцены, поэтому на практике перспективно и сравнение Opus 4.8 с Terra. Подробнее см. полный разбор релиза GPT-5.6.
Q6. Реалистична ли двойная эксплуатация?
Реалистична и даже рекомендуется. Если распределять роутером — реальный кодинг на Opus 4.8, автоматизацию терминала и агентов на Sol, лёгкие задачи на Terra, — можно совместить стоимость и качество. Это также помогает избежать привязки к вендору.
Q7. Как выбирать обычному пользователю (ChatGPT / Claude.ai)?
Прямолинейнее всего — решать по основному назначению. Для точной правки кода — Claude.ai (на момент написания — Opus 4.8), для терминальных агентов, голоса и интеграции с экосистемой ChatGPT — ChatGPT (на момент написания — GPT-5.6). Если не оформлять подписку на оба, выбирайте тот, что ближе к вашей самой частой работе, — так меньше промахов.
Связанные статьи
- GPT-5.6: полный разбор релиза — детали трёх моделей Luna/Terra/Sol
- Claude Opus 4.8: полный разбор релиза — новые функции, бенчмарки, цена
- GPT-5.5 vs Claude Opus 4.7: детальное сравнение — противостояние предыдущего поколения
- Claude vs ChatGPT: сравнение цен — различия в структуре планов
- Насколько ИИ снижает трудозатраты? — данные агентной эпохи о снижении трудозатрат на разработку
- Разбор релиза Claude Opus 5 — производительность, цены и два ломающих изменения
- GPT-5.6 vs GPT-5.5: от одного флагмана к трём моделям — Terra за 40% цены