За последний год то, как Claude «думает», изменилось до неузнаваемости. Старое расширенное мышление (extended thinking) работало так: человек указывал, сколько токенов модель может потратить на рассуждения. Текущее поколение заменяет его адаптивным мышлением (adaptive thinking) — модель сама решает, думать ли вообще и насколько глубоко. А начиная с Claude Opus 5 мышление включено по умолчанию, так что и старое допущение «нет настройки — нет мышления» осталось в прошлом.

В этой статье разберём, чем на самом деле различаются расширенное и адаптивное мышление, как поведение меняется от модели к модели и какие ловушки подстерегают при миграции кода — ошибки 400, обрезанный вывод и счета, которые незаметно растут. Всё опирается на официальную документацию Anthropic.

МЫШЛЕНИЕ: EXTENDED → ADAPTIVE

От «глубину задаёт человек» к «решает сама модель»

Смена поколений в три шага

EXTENDED THINKING (СТАРОЕ)
budget_tokens: 10000
Бюджет мышления задаёт человек
ADAPTIVE THINKING (ТЕКУЩЕЕ)
type: "adaptive"
Думать ли и сколько — решает сама модель
OPUS 5 И НОВЕЕ
Мышление включено по умолчанию
Глубина теперь настраивается через effort
Источник: документация Anthropic «Thinking» и «Extended thinking» (по состоянию на август 2026 года)

1. Что такое мышление (thinking)

Мышление — это этап, на котором Claude прорабатывает задачу своими словами, прежде чем начать писать окончательный ответ. Он переформулирует вопрос, пробует несколько подходов, проверяет промежуточные результаты и отбрасывает пути, которые никуда не ведут, — и весь этот процесс генерируется в виде блоков контента thinking перед ответом. Наибольшую отдачу это даёт на задачах, где качество промежуточной работы определяет качество ответа: математика, программирование, анализ и длительная агентная работа.

Однако это не бесплатно. Как прямо сказано в документации Anthropic «Thinking», токены, которые Claude тратит на рассуждения, тарифицируются как выходные и учитываются в max_tokens — причём оплата та же даже в конфигурациях, где текст мышления вам вообще не возвращается (см. раздел 6). Проектирование настройки мышления — это вопрос стоимости и задержки не в меньшей степени, чем вопрос качества.

2. Эпоха расширенного мышления — budget_tokens задаёте вы

Первым воплощением было расширенное мышление. К запросу добавляется thinking: {"type": "enabled", "budget_tokens": N}, и Claude рассуждает в рамках этого бюджета, прежде чем ответить. Сколько думать, указывает человек — и в каждом запросе. Согласно официальной документации, правила такие:

  • Минимум 1,024 токена. Меньшие значения API отклоняет
  • Должен быть меньше max_tokens — мышление учитывается в этом лимите, поэтому нужно оставить место для самого ответа
  • Бюджет — это ориентир, а не жёсткий потолок. Фактический расход зависит от задачи, и Claude часто заканчивает думать задолго до исчерпания бюджета
  • Для бюджетов мышления выше 32,000 Anthropic рекомендует пакетную обработку, чтобы избежать таймаутов

Проблема этой конструкции очевидна: правильный бюджет зависит от задачи, и заранее угадать его человек не может. Простой вопрос может впустую сжечь выделенный бюджет; сложной задаче его может не хватить. К тому же изменение значения бюджета инвалидирует кеш промптов — документация демонстрирует это на измеренном примере.

3. Переход к адаптивному мышлению — решает модель

Именно это заменяет адаптивное мышление, появившееся в 2026 году. Вся настройка — одна строка: thinking: {"type": "adaptive"}. Думать ли и насколько глубоко, Claude решает сам — исходя из того, насколько сложным выглядит запрос. Лёгкие входные данные получают мгновенный ответ без мышления; трудные задачи — глубокие рассуждения.

Миграция шла по графику, описанному в документации Anthropic «Extended thinking»: budget_tokens объявлен устаревшим на Claude Opus 4.6 / Sonnet 4.6 (там он ещё работает), а модели начиная с Claude Opus 4.7 отклоняют его с ошибкой 400. Направьте старый код на новую модель — и он остановится вот на этом:

# Старое: расширенное мышление (ошибка 400 на Opus 4.7 и новее)
"thinking": {"type": "enabled", "budget_tokens": 10000}
→ 400: "thinking.type.enabled" is not supported ...

# Новое: адаптивное мышление (глубина задаётся через effort)
"thinking": {"type": "adaptive"},
"output_config": {"effort": "high"}

Сама правка невелика: удалить budget_tokens, переключиться на adaptive и отдать управление глубиной параметру effort. Но, как предупреждает документация, это изменение поведения, а не только синтаксиса. С фиксированным бюджетом Claude думал в каждом запросе; при адаптивном мышлении на низких уровнях effort он может полностью пропускать мышление на лёгких входных данных.

4. Как каждая модель обращается с мышлением: сводная таблица

Коварство в том, что «включено ли по умолчанию» и «можно ли выключить» различаются от модели к модели. Вот официальная документация, сведённая в одну таблицу.

Модель Если ничего не настраивать Отключение мышления budget_tokens
Claude Fable 5 / Mythos 5 Мышление включено (всегда) Невозможно (400) Невозможно (400)
Claude Opus 5 Мышление включено (адаптивное) Только при effort high и ниже
В сочетании с xhigh / max: 400
Невозможно (400)
Claude Sonnet 5 Мышление включено (адаптивное) Допускается Невозможно (400)
Claude Opus 4.8 / 4.7 Без мышления (включается явным adaptive) Допускается Невозможно (400)
Claude Opus 4.6 / Sonnet 4.6 Без мышления (включается явным adaptive) Допускается Устарел (пока работает)
Sonnet 4.5 / Haiku 4.5 и более ранние Без мышления — (по умолчанию и так выключено) Обязателен (единственный режим мышления; adaptive возвращает 400)

Источник: Anthropic, «Thinking» и «Extended thinking» (по состоянию на август 2026 года)

На практике важны две вещи. Во-первых, с поколением Opus 5 умолчание перевернулось в сторону «мышление включено» — если вы дёшево гоняли задачу на Opus 4.8 с выключенным мышлением и поменяли только ID модели, выходные токены вырастут на долю мышления, и ответы начнут обрезаться по max_tokens либо счёт пойдёт вверх (подробно разобрано в нашем гайде по ломающим изменениям Opus 5). Во-вторых, budget_tokens продолжают использовать только устаревшие модели — пока вы остаётесь на Sonnet 4.5 или более ранних, мигрировать нечего; переписывайте код тогда, когда переходите на более новую модель.

5. Глубина теперь настраивается через effort

С исчезновением «бюджета» глубина мышления регулируется через output_config: {"effort": ...} — пять уровней, low / medium / high / xhigh / max, причём high — значение по умолчанию в API. Effort влияет не только на глубину мышления: от него зависят и то, насколько консолидированы вызовы инструментов, и объём вступлений, то есть общий расход токенов.

low / medium

Рутинные задачи, классификация, субагенты. Может пропускать мышление на лёгких входных данных = быстро и дёшево

high (по умолчанию) — xhigh

high — для обычной работы; xhigh — рекомендованная Anthropic отправная точка для кодинга и агентов

max

Для задач, где правильность важнее стоимости. Не всегда даёт лучший результат, поэтому не закрепляйте его навсегда

Что означают пять уровней, как устроен ползунок в Claude Code и как сохраняются настройки — в нашем гайде по настройке effort. Одно замечание о кешировании из документации: в адаптивном режиме значение effort подставляется в промпт, поэтому его изменение инвалидирует кеш промптов — та же картина, что и «смена бюджета сбрасывает кеш» в эпоху расширенного мышления. Не переключайте его туда-сюда посреди диалога.

6. За мышление платят, даже когда его не видно

То, как мышление выглядит снаружи, управляется полем display. Оно принимает два значения:

  • "summarized" — блок thinking содержит читаемое резюме рассуждений. Умолчание на Claude Opus 4.6 / Sonnet 4.6 и более ранних
  • "omitted" — блок thinking возвращается с пустой строкой внутри. Умолчание на Fable 5 / Mythos 5 / Opus 5 / Sonnet 5 / Opus 4.8 / 4.7

Здесь прячутся две ловушки. Во-первых, чем новее модель, тем сильнее умолчание склоняется к «не показывать» — перенесите приложение, которое стримило рассуждения пользователям, на новую модель, и опыт превратится в долгую тишину, за которой внезапно следует ответ. Хотите видимость — попросите её явно: thinking: {"type": "adaptive", "display": "summarized"}. Во-вторых, display меняет только видимость — оплата идентична. Документация говорит об этом прямо: при omitted вы всё равно платите за полный объём токенов мышления; экономите вы задержку, а не деньги. И ни в одной конфигурации вы не получите сырую цепочку рассуждений — то, что показывает summarized, является резюме.

Как измерить, во что вам обходится мышление: поле ответа usage.output_tokens_details.thinking_tokens показывает, сколько оплаченных выходных токенов пришлось на внутренние рассуждения. При стриминге оно появляется только в финальном событии message_delta. «Я не вижу мышления» никогда не означает «его нет» — проверьте это поле после миграции.

Ещё одна практически важная вещь: обращение с блоками мышления. В многоходовых диалогах и при работе с инструментами передавайте блоки мышления из предыдущего ответа обратно строго без изменений. Их редактирование вызывает ошибку 400 — ошибка «invalid signature in thinking block», с которой сталкиваются пользователи Claude Code, возникает именно из этого механизма.

7. Ловушки отключения мышления

«Нам важна скорость — выключаем мышление» — решение вполне законное, но на Opus 5 оно обставлено условиями. Согласно официальной документации:

✅ Допускается

Мышление выключено + effort low / medium / high

❌ Ошибка 400

Мышление выключено + effort xhigh / max (проверяется в каждом запросе)

🔧 Рекомендация

Не выключайте — вместо этого снизьте effort до low / medium

Даже когда запрос проходит, есть побочные эффекты. Anthropic документирует: с выключенным мышлением Opus 5 может выписывать вызовы инструментов обычным текстом (инструмент так и не запускается, хотя ход выглядит успешным) и пропускать внутренние XML-теги в вывод. Если вы строите агентов, безопасный путь — оставить мышление включённым и снизить effort: расходы это сокращает примерно в ту же сторону.

8. Мышление между вызовами инструментов — interleaved thinking

Мышление — это не только «один раз, перед ответом». При чередующемся мышлении (interleaved thinking) Claude рассуждает и между вызовами инструментов, взвешивая каждый результат перед выбором следующего шага: пересматривает план после чтения результатов поиска, подбирает следующую команду по выводу предыдущей. Именно этот механизм стоит за качественным агентным поведением.

Здесь тоже есть разница поколений. В старом мире расширенного мышления для этого требовался бета-заголовок interleaved-thinking-2025-05-14; при адаптивном мышлении это происходит автоматически, и заголовок не нужен (документация констатирует, что «адаптивное мышление чередуется автоматически», и разрешает убрать заголовок после миграции). Переход на адаптивное мышление упрощает код ещё на одну настройку.

9. Когда нужна скорость: fast mode

Если вам нужно качество мышления, но меньше ожидания, вариант один — быстрый режим (fast mode). Согласно документации Claude Code о fast mode, это не даунгрейд на другую модель: тот же Claude Opus работает в конфигурации, заточенной под скорость. Вывод быстрее примерно до 2.5x, а цена удваивается ($10 вход / $50 выход за миллион токенов и на Opus 5, и на Opus 4.8). Доступен только на Opus 5 и Opus 4.8; fast mode для Opus 4.7 отключили 24 июля 2026 года.

В Claude Code: /fast

Введите /fast в CLI, чтобы переключить режим (расширение для VS Code его не поддерживает). Официальная рекомендация: включать для интерактивной быстрой итерации, выключать, когда стоимость важнее задержки.

В API: research preview

Только Claude API — недоступен на Amazon Bedrock, Google Cloud и Microsoft Foundry. Учтите также, что переключение скорости инвалидирует кеш промптов.

Мышление, effort и fast mode играют разные роли: мышление = механизм «рассуждать или нет», effort = насколько глубоко рассуждать, fast mode = насколько быстро доставляются те же рассуждения. Прежде чем хвататься за «медленно — убираем мышление», вспомните: у вас на руках ещё две карты — снизить effort или включить fast mode.

Итоги

  • Расширенное мышление (budget_tokens) — старый способ. Устарел на Opus 4.6 / Sonnet 4.6, с Opus 4.7 — ошибка 400, и при этом по-прежнему единственный режим мышления на устаревших моделях (Sonnet 4.5 / Haiku 4.5 и др.)
  • Адаптивное мышление — текущий способ. Модель сама решает, думать ли и сколько; глубина настраивается через effort (пять уровней, по умолчанию high)
  • У Opus 5 / Sonnet 5 / Fable 5 мышление включено по умолчанию. На Fable 5 его нельзя выключить; на Opus 5 — только при effort high и ниже
  • За мышление платят, даже когда его не видно. Умолчание нового поколения — display: "omitted" (пустые блоки мышления). Измеряйте через usage.output_tokens_details.thinking_tokens
  • У отключения мышления есть побочные эффекты (вызовы инструментов текстом, утечка тегов). Снизить effort безопаснее, чем выключать
  • Чередующееся мышление при adaptive работает автоматически — бета-заголовок больше не нужен
  • Нужна скорость? Fast mode (примерно 2.5x, цена 2x, Opus 5/4.8; в Claude Code переключается через /fast)

FAQ

Q. Я задал budget_tokens и получил ошибку 400.

A. Модели начиная с Opus 4.7 (включая Opus 5 / Sonnet 5 / Fable 5) не принимают thinking: {"type": "enabled", "budget_tokens": N}. Перепишите на thinking: {"type": "adaptive"} и управляйте глубиной через output_config: {"effort": ...}. Если вы остаётесь на устаревших моделях вроде Sonnet 4.5 / Haiku 4.5, переписывать ничего не нужно.

Q. После перехода на адаптивное мышление ответы обрываются на середине предложения.

A. Токены мышления учитываются в max_tokens. У Opus 5 мышление к тому же включено по умолчанию, поэтому код, где max_tokens был подобран впритык под старую модель, теперь теряет бюджет на мышление и обрезает ответ. Дайте max_tokens больше запаса или снизьте effort.

Q. Блоки мышления возвращаются пустыми. Что-то сломалось?

A. Так и задумано. На Opus 5 / Sonnet 5 / Fable 5 / Opus 4.8 / 4.7 значение display по умолчанию — "omitted" (пустые блоки мышления). Чтобы видеть резюме, явно задайте thinking: {"type": "adaptive", "display": "summarized"}. Оплата в обоих случаях одинакова.

Q. Если выключить мышление, эти деньги сэкономятся?

A. Сами токены мышления — да. Но на Opus 5 это нельзя сочетать с effort xhigh/max (ошибка 400), и даже там, где это работает, Anthropic документирует побочные эффекты: вызовы инструментов, записанные обычным текстом, и утечку внутренних тегов в вывод. Для агентных нагрузок безопаснее сокращать расходы, оставив мышление включённым и снизив effort до low / medium.

Q. Нужно ли настраивать мышление в Claude Code (или чат-приложениях)?

A. Нет — Claude Code и claude.ai управляют мышлением сами, так что никаких параметров API настраивать не требуется. Вам доступны настройка effort и /fast (переключатель fast mode); механика включения и выключения мышления наружу не выходит.

Примечание: спецификации и цифры в этой статье основаны на документации Anthropic «Thinking», «Extended thinking» и документации Claude Code «Fast mode» (всё — по состоянию на август 2026 года). Спецификации меняются; прежде чем опираться на них, сверьтесь с актуальными формулировками в официальной документации.