Дополнение от 25 сентября 2026 г.: в этой статье сравниваются Claude Fable 5 и GPT-5.6 Sol по состоянию на июль 2026 года. С тех пор Anthropic выпустила Claude Opus 5 (24 июля) и преемника Fable 5 — Claude Fable 5.1 (1 сентября), а OpenAI — GPT-6 Astra (3 сентября). О стоимости см. наше сравнение Astra на low и Sol на high по замерам. Затем, 22 сентября, Anthropic выпустила Claude Opus 5.5, а OpenAI (по времени США) — GPT-6 Sol и GPT-6 Luna, следующее поколение после GPT-5.6 Sol. Сейчас Anthropic советует, если вы не уверены в выборе, для большинства задач начинать с Opus 5.5. Fable 5 по-прежнему доступна в API как модель со статусом Legacy, а GPT-5.6 Sol остаётся доступной на переходный период. Слова «высший класс», «флагман», «лидирует» и значения бенчмарков ниже приведены на момент написания. 22 сентября мы также исправили значения бенчмарков по первоисточникам. «86.0%» у Fable 5 в TerminalBench 2.1 нет ни в одной из таблиц двух компаний, поэтому мы заменили его значением из таблицы OpenAI, где есть обе модели (83.1%), а там, где SWE-Bench Pro сравнивается с Sol, теперь используем 80.0% из той же таблицы. Кроме того, «до 12 часов непрерывной автономной работы» — это рассказ одного пользователя, а не слова Anthropic, поэтому мы заменили формулировку словами самой Anthropic.

Тогдашний флагман OpenAI GPT-5.6 «Sol» (общедоступен с 9 июля 2026 г.) и Claude Fable 5 (релиз 9 июня), который Anthropic на момент выхода называла «сильнейшей моделью за всю историю общедоступных выпусков». Если сравнение с Opus 4.8 было «прямой дуэлью в одной ценовой категории», то здесь главной темой становится компромисс между стоимостью и мощью: «универсал Sol за полцены» против «Fable 5 высшего класса, но вдвое дороже».

Если сразу к выводу — в кодинге производственного уровня и длительной автономности Fable 5 явно впереди, а по цене и широте агентных возможностей впереди Sol. Разрыв в SWE-bench Pro здесь ещё больше, чем в дуэли с Opus 4.8. В этой статье мы разберём, как распределять роли между этими двумя асимметричными лидерами, опираясь на официальные заявления обеих компаний и независимые бенчмарки.

FLAGSHIP SHOWDOWN · 2026

Универсал за полцены vs мастер высшего класса

— цена отличается вдвое, но разрыв в SWE-bench Pro ещё больше

ANTHROPIC · ВЫСШИЙ КЛАСС НА МОМЕНТ ВЫХОДА
Claude Fable 5
Релиз 9 июня 2026 г.
SWE-bench Pro: 80.0%
TerminalBench 2.1: 83.1%
Длительная автономность: дольше всех Claude
Цена: $10 / $50 per MTok
VS
OPENAI · ФЛАГМАН НА МОМЕНТ ВЫХОДА
GPT-5.6 Sol
Общедоступен с 9 июля 2026 г.
SWE-bench Pro: 64.6%
TerminalBench 2.1: 88.8%
Эффективность токенов: +54% (кодинг)
Цена: $5 / $30 per MTok

Fable 5: сильнейшая «способность довести до конца» в решении реального кода и длительной автономности
Sol: «выгодная цена и универсальность» в работе с терминалом, широте и полцены

1. Позиционирование обеих моделей — «универсал за полцены» vs «мастер высшего класса»

Claude Fable 5 — всё поставлено на «способность добежать длинную дистанцию»

Fable 5 — это модель, которая открывает рядовым пользователям и разработчикам возможности уровня сильнейшей frontier-модели Anthropic «Mythos» (по сути она идентична Mythos 5, отличаются лишь предохранительные механизмы). Её девиз — «создана для длительной и сложной работы». В SWE-Bench Pro она набрала 80.0%, измеряющем исправление реальных GitHub-репозиториев, значительно оторвавшись от Opus 4.8 (69.2%) и предыдущего поколения GPT-5.5 (58.6%) (по системной карте Anthropic; 80.3% в таблице анонса стоят в общем с Mythos 5 столбце — это более высокий результат Mythos 5). Она сохраняет концентрацию на протяжении миллионов токенов и может работать автономно дольше любой предыдущей модели Claude; есть пример, когда Stripe за один день завершил миграцию 50 млн строк Ruby-кода (источник: официальный анонс Anthropic).

GPT-5.6 Sol — «универсал за полцены»

Sol — высший класс в линейке GPT-5.6 (Luna/Terra/Sol). Он занял первое место по общей агентной мощи: 88.8% в TerminalBench 2.1, где автономно управляет терминалом, и 53.6 в Agents' Last Exam, оценивающем длительную практическую работу, а эффективность токенов в кодинге выросла на 54%. И прежде всего, его главное оружие — цена: примерно вдвое дешевле Fable 5 ($5/$30 против $10/$50). Он занимает позицию «не самый сильный, но берущий соотношением цена/качество» (источник: официальные заявления OpenAI, Vellum, Artificial Analysis).

2. Краткая таблица характеристик

ПараметрClaude Fable 5GPT-5.6 Sol
РазработчикAnthropic (высший класс на момент выхода, общедоступная модель)OpenAI (высший класс GPT-5.6)
Дата релиза9 июня 2026 г.9 июля 2026 г. (общедоступность)
ID моделиclaude-fable-5gpt-5.6-sol
Длина контекста1,000,000 tokens1,050,000 tokens
Макс. выходных токенов128,000 tokens128,000 tokens
Обрезка знанийПервая половина 2026 г. (публикуется поэтапно)16 февраля 2026 г.
Цена API$10 / $50 per MTok$5 / $30 per MTok (примерно вдвое дешевле Fable; по промотарифу на три месяца с 21 августа 2026 г. — $4 / $20)
РассужденияВсегда включены (адаптивное мышление, сырой ход мысли не возвращается)reasoning effort (6 уровней от none до max)
Ядро сильных сторонSWE-Bench Pro 80.0% (данные Anthropic), самая долгая автономность среди Claude, способность добежать длинную дистанциюРабота с терминалом, общая агентная мощь, эффективность токенов, полцены
Дизайн безопасностиОткат на Opus 4.8 только при обнаружении риска тремя классификаторами (срабатывает менее чем в 5% сессий)Заявлена как «сильнейшая по безопасности модель», усилен safety-стек
Каналы доступаClaude.ai, API, GitHub Copilot и другиеChatGPT, ChatGPT Work, Codex, OpenAI API

* Цены и характеристики основаны на официальных заявлениях компаний (Fable 5 — 9 июня 2026 г., GPT-5.6 — 9 июля 2026 г.). Условия измерения, сроки и harness у бенчмарков различаются между компаниями, поэтому это не строгое сравнение на одном поле. Значения для сравнения двух моделей (SWE-Bench Pro 80.0% против 64.6%, TerminalBench 2.1 83.1% против 88.8%, Agents' Last Exam 40.5 против 53.6, Coding Agent Index 77.2 против 80) взяты из таблицы оценок в анонсе GPT-5.6 от OpenAI, где есть обе модели (53.6 у Sol в Agents' Last Exam — значение из текста анонса, в таблице на той же странице указано 52.7%; Coding Agent Index — показатель Artificial Analysis). В таблице из анонса самой Anthropic у Fable 5 указаны 80.3% в SWE-Bench Pro и 88.0% в TerminalBench 2.1, но оба значения стоят в общем с Mythos 5 столбце и являются большим из двух результатов (по системной карте у одной Fable 5 — 80.0% и 84.3%), а к TerminalBench 2.1 Anthropic добавила примечание: из-за переключения запросов защитными механизмами на другую модель результат Fable 5 ближе к Opus 4.8 (82.7% в той же таблице). Значения 86.0% нет ни в одной из таблиц.

3. Подробное сравнение бенчмарков

Ни «Fable 5 побеждает во всём», ни «Sol побеждает во всём». Всё чётко делится по типу кодинга.

CODING & AGENT BENCHMARKS

Решение реального кода — за Fable, терминал и широта — за Sol

SWE-bench Pro (исправление реальных репозиториев)Fable 80.0% vs Sol 64.6%
Fable 5
Sol
TerminalBench 2.1 (автономная работа с терминалом)Sol 88.8% vs Fable 83.1%
Sol
Fable 5
Agents' Last Exam (длительная практическая работа)Sol 53.6 vs Fable 40.5
Sol 53.6
Fable 40.5
Coding Agent Index (Artificial Analysis)Sol 80 vs Fable 77.2
Sol 80
Fable 77.2

Источник: таблица оценок в анонсе GPT-5.6 от OpenAI (Agents' Last Exam у Sol — из текста анонса, Coding Agent Index — Artificial Analysis)

Суть в различии «того, что измеряет бенчмарк». SWE-bench Pro измеряет генерацию патчей для реальных задач GitHub, то есть способность исправлять существующую кодовую базу, и здесь Fable 5 с 80.0% опережает Sol с 64.6% более чем на 15 пунктов. С другой стороны, TerminalBench 2.1 — это автономная работа с командной строкой, где Sol с 88.8% превосходит Fable 5 с 83.1%. Кроме того, в общих агентных Agents' Last Exam и Coding Agent Index лидирует Sol. Получается чёткое разделение ролей: «глубина, чтобы довести реальный код до конца — Fable, широта работы с терминалом и агентами — Sol».

4. «Проблема закрытых бенчмарков» — скрытые показатели и оспоренный SWE-bench Pro

И в этом сравнении требует внимания то, что части показателей в таблице оценок OpenAI нет. Сразу после релиза независимый анализ (Vellum) отметил, что OpenAI не опубликовала SWE-bench Verified, GPQA Diamond, AIME, MMLU, ARC-AGI-2 и FrontierMath. Однако в таблице оценок на странице анонса OpenAI, проверенной 22 сентября 2026 года, есть GPQA Diamond (Sol 94.6%, Fable 5 92.6%) и FrontierMath (Tier 1–3: Sol 89%, Fable 5 87%; Tier 4: Sol 83%, Fable 5 87.8%). Нет SWE-bench Verified, AIME и MMLU, а значение Sol в ARC-AGI-2 (92.5%) впервые появилось в таблице анонса GPT-6 Astra 3 сентября. Значение SWE-bench Pro «64.6%» в этой статье тоже взято из таблицы оценок, которую OpenAI опубликовала вместе с GPT-5.6. Однако одновременно OpenAI опубликовала анализ, по которому около 30% задач SWE-bench Pro некорректны (на это обратил внимание Simon Willison).

THE BENCHMARK PROBLEM

OpenAI оспаривает самый близкий к практике показатель кодинга

🟡 Sol: 64.6%
Значение из собственной таблицы оценок OpenAI, которая одновременно опубликовала анализ: около 30% задач некорректны
✅ У Fable — раскрыто
Anthropic публикует SWE-Bench Pro 80.0% (значение из системной карты, как и в таблице OpenAI; 80.3% в таблице анонса — результат Mythos 5)
🔴 Части показателей нет
У Sol нет значений SWE-bench Verified, AIME и MMLU (GPQA Diamond в таблице есть: Sol 94.6% против 92.6% у Fable 5)

* Если для вас важен кодинг производственного уровня, сильный выбор — Fable 5 с результатом около 80% в SWE-bench Pro в таблицах обеих компаний. Не судите только по ярким агентным цифрам.

5. Длительная автономность — стихия Fable 5

Истинная ценность Fable 5 — не столько в баллах бенчмарков, сколько в «способности добежать длинную дистанцию». Anthropic объясняет, что модель сохраняет концентрацию на протяжении миллионов токенов и может работать автономно дольше любой предыдущей модели Claude (верхний предел в часах не называется). В качестве реального примера приводится случай, когда Stripe за один день завершил миграцию 50 млн строк Ruby-кода (вручную это заняло бы более двух месяцев). Сразу после релиза пользователь также рассказал в блоге Ten Past Tomorrow, что модель по одному заданию проработала самостоятельно более 12 часов. В бенчмарке длительного анализа Hex также сообщалось о первом в истории результате выше 90%.

Дольше всех
Самая долгая автономная работа среди Claude

Сохраняет концентрацию на протяжении миллионов токенов и самостоятельно ведёт долгие сессии кодинга и исследований (по словам Anthropic).

50 млн строк / 1 день
Крупная миграция Stripe

Реальный случай: миграция Ruby, которая вручную заняла бы более двух месяцев, завершена за один день.

SWE-Bench Pro 80.0%
В топе по исправлению реального кода

В таблице OpenAI значительно опережает Opus 4.8 (69.2%) и Sol (64.6%) (в системной карте Anthropic — тоже 80.0%).

Sol тоже лидирует в Agents' Last Exam по длительной практической работе (53.6), но это бенчмарк, измеряющий «широкие рабочие процессы». А вот в «глубокой способности добежать» — довести до конца исправление единой огромной кодовой базы — преимущество у Fable 5. Таково качественное различие между ними. Для крупных миграций, длительных исследований и автономных кодинг-агентов в роли основной силы лучше подходит Fable 5.

6. Реальная стоимость — как оценивать двукратную цену

Цена за единицу — у Fable 5 $10/$50, у Sol $5/$30. По входу вдвое, по выходу в 1.67 раза, Fable 5 примерно вдвое дороже Sol (около 2.5 раза, пока у Sol действует промотариф $4/$20). Именно здесь проходит развилка выбора.

  • Ценовое преимущество Sol: цена за единицу вдвое ниже, а в кодинге эффективность токенов выросла на 54%. При одной и той же работе расход токенов тоже меньше, поэтому для задач «взять объёмом» общая стоимость оказывается значительно ниже, чем у Fable 5.
  • Ценность Fable 5: цена за единицу выше, но высок процент успеха «сделать правильно с первого раза» (SWE-bench Pro около 80% в таблицах обеих компаний). Если учесть затраты на переделки, ревью и ручные доработки, то на сложных задачах она бывает «дорогой, но в итоге дешёвой». Если можно за один день мигрировать 50 млн строк, то в пересчёте на расходы на персонал это баснословно выгодно.

То есть смотреть надо не на «цену за токен», а на «стоимость за выполненную задачу». Повседневные конвейерные задачи и работа с терминалом — за Sol (а если акцент ещё сильнее на стоимости — GPT-5.6 Terra или Luna), а крупные и длительные задачи, где ошибка обходится дорого — за Fable 5. Такое разделение ролей разумно и с точки зрения оптимизации стоимости.

* Поскольку компании не публикуют сравнение выходных токенов при одинаковых условиях, конкретный «множитель реальной стоимости» утверждать нельзя. Рекомендуем на своих типовых задачах замерить процент успеха и число выходных токенов и сравнить с учётом затрат на переделки.

7. Карта сильных и слабых сторон

STRENGTHS & WEAKNESSES

Способность довести до конца у высшего класса vs универсальность за полцены

CLAUDE FABLE 5
◯ Сильные стороны
  • · SWE-Bench Pro около 80% (в обеих таблицах) — в топе по реальному кодингу
  • · Самая долгая автономность среди Claude, способность добежать
  • · Реальный результат крупной миграции (Stripe 50 млн строк/1 день)
  • · Опережает Sol в FrontierMath Tier 4 даже в таблице OpenAI (87.8% против 83%)
  • · Новый дизайн безопасности с 3 классификаторами (подавляет только опасные зоны)
△ Слабые стороны
  • · Высокая цена за единицу ($10/$50 = примерно вдвое дороже Sol; около 2.5 раза в период промотарифа Sol)
  • · По широте работы с терминалом и общей агентности уступает Sol
  • · Избыточна для лёгких конвейерных задач
  • · Сырой ход мысли не возвращается
GPT-5.6 SOL
◯ Сильные стороны
  • · TerminalBench 88.8% — первое место по работе с терминалом
  • · Первое место в Agents' Last Exam и Coding Agent Index
  • · Цена вдвое ниже + эффективность токенов +54% = лучшая цена/качество
  • · Три модели Luna/Terra/Sol для оптимизации под задачи
  • · Интеграция с ChatGPT Work / Codex / GPT-Live
△ Слабые стороны
  • · Проигрыш более 15 пунктов в SWE-bench Pro
  • · AIME, MMLU и др. в таблице оценок нет
  • · По «глубокой способности добежать» на едином огромном коде уступает Fable
  • · По подтверждённым результатам длительной автономности Fable впереди

8. Как выбирать по сценариям использования

Сценарий использованияРекомендуемая модельПричина
Крупная миграция кода, обновление legacyFable 5Длительная автономность + способность добежать (Stripe 50 млн строк/1 день)
Исправление сложных багов в реальных репозиториях, большие PRFable 5Высокий процент успеха при SWE-Bench Pro около 80% (обе таблицы)
Длительные автономные исследования и аналитические агентыFable 5Оптимизирована под концентрацию на миллионах токенов и способность добежать
Важные задачи, где переделка обходится дорогоFable 5Высокая вероятность сделать правильно с первого раза
Агенты, автономно управляющие CLI и терминаломSolПервое место с TerminalBench 2.1 88.8%
Автоматизация широких рабочих процессовSolПервое место с Agents' Last Exam 53.6
Конвейерные задачи с акцентом на стоимостьSolПолцены + эффективность токенов +54%. Для лёгкой работы также Terra/Luna
Интегрированная работа с ChatGPT/Codex/голосомSolЕдиное целое с ChatGPT Work, GPT-Live и Codex

Итоги

  • Claude Fable 5: в топе по исправлению реального кода (SWE-Bench Pro около 80%) и длительной автономности. Её стихия — «способность добежать» в крупных миграциях и сложных задачах. Но цена за единицу примерно вдвое выше, чем у Sol.
  • GPT-5.6 Sol: первое место по работе с терминалом (TerminalBench 88.8%) и общей агентной мощи, лучшая цена/качество за счёт полцены + эффективности токенов +54%. Тремя моделями легко оптимизировать под задачи.
  • Разрыв в SWE-bench Pro больше, чем в дуэли с Opus 4.8 (80.0 vs 64.6 в таблице OpenAI, более 15 пунктов). Но стоит помнить, что OpenAI также опубликовала анализ, по которому около 30% задач SWE-bench Pro некорректны.
  • Стоимость надо смотреть не по «цене за токен», а «за выполненную задачу». Конвейер и терминал — за Sol, крупные и длительные задачи, где ошибка обходится дорого — за Fable 5.
  • Реальное решение — двойная эксплуатация. Оптимально распределять роли: повседневное — за Sol (или Terra), а решающие крупные задачи — за Fable 5.

FAQ

Q1. Кто сильнее в кодинге — GPT-5.6 Sol или Claude Fable 5?

Зависит от показателя. В SWE-Bench Pro, измеряющем исправление багов в реальных репозиториях, Fable 5 с 80.0% опережает Sol с 64.6% более чем на 15 пунктов. С другой стороны, в TerminalBench 2.1 по автономной работе с терминалом Sol с 88.8% превосходит Fable 5 с 83.1% (оба значения — из таблицы оценок OpenAI; в системной карте Anthropic у Fable 5 в SWE-Bench Pro тоже 80.0%). Практичное разделение ролей: «довести реальный код до конца — Fable, широта работы с терминалом и агентами — Sol».

Q2. Стоит ли платить вдвое больше?

Зависит от задачи. Для повседневного конвейера и работы с терминалом достаточно Sol за полцены (а для лёгкой работы — Terra/Luna). Однако на задачах, где «переделка после провала обходится дорого» — крупные миграции, исправление сложных багов — более надёжная Fable 5 в итоге выходит дешевле. Судите не по цене за токен, а по «стоимости за выполненную задачу».

Q3. Значение «64.6%» у Sol в SWE-bench Pro — официальное?

Да. Это значение из таблицы оценок, которую OpenAI опубликовала вместе с GPT-5.6. Одновременно OpenAI опубликовала анализ, по которому около 30% задач SWE-bench Pro некорректны, тем самым поставив под сомнение сам бенчмарк. GPQA Diamond и FrontierMath, которые Vellum сразу после релиза назвал неопубликованными, в таблице оценок по состоянию на 22 сентября 2026 года есть (GPQA: Sol 94.6%, Fable 5 92.6%). В таблице нет SWE-bench Verified, AIME и MMLU.

Q4. Какая модель лучше для длительных автономных задач?

Fable 5. Она сохраняет концентрацию на протяжении миллионов токенов и, по словам Anthropic, может работать автономно дольше любой предыдущей модели Claude; есть подтверждённый результат, когда Stripe за один день завершил миграцию 50 млн строк Ruby. «Способность добежать» — довести до конца исправление единой огромной кодовой базы — это стихия Fable 5.

Q5. Чем Fable 5 отличается от Mythos 5?

Начинка (способности) идентична, отличаются лишь предохранительные механизмы. Общедоступной является Fable 5, и она обладает дизайном безопасности с 3 классификаторами, откатывающимся на Opus 4.8 только при обнаружении риска (срабатывает менее чем в 5% сессий, более 95% времени работает самостоятельно).

Q6. Как в этом сравнении участвует «Terra» из GPT-5.6?

GPT-5.6 — это три модели Luna/Terra/Sol. В этой статье мы взяли Sol как флагман против флагмана на момент написания, но при акценте на стоимости Terra ($2/$12) предлагает уровень GPT-5.5 за 40% тарифа Sol (после снижения цен 30 июля 2026 г.). Комбинация «Fable 5 для сложных задач, Terra для конвейера» тоже сильна на практике. Подробнее см. полный разбор релиза GPT-5.6.

Q7. Opus 4.8 или Fable 5 — с чем сравнивать Sol?

Выбирайте по задаче и бюджету. Opus 4.8 ($5/$25) находится в одной ценовой категории с Sol и предлагает выгодный кодинг с SWE-bench Pro 69.2%. Fable 5 ($10/$50) — тогдашний высший класс с 80.0% и несравнимой способностью довести до конца, но дорогая. Реалистичен трёхступенчатый подход: повседневное — Opus 4.8/Sol, решающие задачи — Fable 5. См. также сравнение Sol vs Opus 4.8.

Похожие статьи