Содержание
- 1. Что такое мышление (thinking)
- 2. Эпоха расширенного мышления — budget_tokens задаёте вы
- 3. Переход к адаптивному мышлению — решает модель
- 4. Как каждая модель обращается с мышлением: сводная таблица
- 5. Глубина теперь настраивается через effort
- 6. За мышление платят, даже когда его не видно
- 7. Ловушки отключения мышления
- 8. Мышление между вызовами инструментов — interleaved thinking
- 9. Когда нужна скорость: fast mode
- Итоги
- FAQ
За последний год то, как Claude «думает», изменилось до неузнаваемости. Старое расширенное мышление (extended thinking) работало так: человек указывал, сколько токенов модель может потратить на рассуждения. Текущее поколение заменяет его адаптивным мышлением (adaptive thinking) — модель сама решает, думать ли вообще и насколько глубоко. А начиная с Claude Opus 5 мышление включено по умолчанию, так что и старое допущение «нет настройки — нет мышления» осталось в прошлом.
В этой статье разберём, чем на самом деле различаются расширенное и адаптивное мышление, как поведение меняется от модели к модели и какие ловушки подстерегают при миграции кода — ошибки 400, обрезанный вывод и счета, которые незаметно растут. Всё опирается на официальную документацию Anthropic.
От «глубину задаёт человек» к «решает сама модель»
Смена поколений в три шага
1. Что такое мышление (thinking)
Мышление — это этап, на котором Claude прорабатывает задачу своими словами, прежде чем начать писать окончательный ответ. Он переформулирует вопрос, пробует несколько подходов, проверяет промежуточные результаты и отбрасывает пути, которые никуда не ведут, — и весь этот процесс генерируется в виде блоков контента thinking перед ответом. Наибольшую отдачу это даёт на задачах, где качество промежуточной работы определяет качество ответа: математика, программирование, анализ и длительная агентная работа.
Однако это не бесплатно. Как прямо сказано в документации Anthropic «Thinking», токены, которые Claude тратит на рассуждения, тарифицируются как выходные и учитываются в max_tokens — причём оплата та же даже в конфигурациях, где текст мышления вам вообще не возвращается (см. раздел 6). Проектирование настройки мышления — это вопрос стоимости и задержки не в меньшей степени, чем вопрос качества.
2. Эпоха расширенного мышления — budget_tokens задаёте вы
Первым воплощением было расширенное мышление. К запросу добавляется thinking: {"type": "enabled", "budget_tokens": N}, и Claude рассуждает в рамках этого бюджета, прежде чем ответить. Сколько думать, указывает человек — и в каждом запросе. Согласно официальной документации, правила такие:
- Минимум 1,024 токена. Меньшие значения API отклоняет
- Должен быть меньше
max_tokens— мышление учитывается в этом лимите, поэтому нужно оставить место для самого ответа - Бюджет — это ориентир, а не жёсткий потолок. Фактический расход зависит от задачи, и Claude часто заканчивает думать задолго до исчерпания бюджета
- Для бюджетов мышления выше 32,000 Anthropic рекомендует пакетную обработку, чтобы избежать таймаутов
Проблема этой конструкции очевидна: правильный бюджет зависит от задачи, и заранее угадать его человек не может. Простой вопрос может впустую сжечь выделенный бюджет; сложной задаче его может не хватить. К тому же изменение значения бюджета инвалидирует кеш промптов — документация демонстрирует это на измеренном примере.
3. Переход к адаптивному мышлению — решает модель
Именно это заменяет адаптивное мышление, появившееся в 2026 году. Вся настройка — одна строка: thinking: {"type": "adaptive"}. Думать ли и насколько глубоко, Claude решает сам — исходя из того, насколько сложным выглядит запрос. Лёгкие входные данные получают мгновенный ответ без мышления; трудные задачи — глубокие рассуждения.
Миграция шла по графику, описанному в документации Anthropic «Extended thinking»: budget_tokens объявлен устаревшим на Claude Opus 4.6 / Sonnet 4.6 (там он ещё работает), а модели начиная с Claude Opus 4.7 отклоняют его с ошибкой 400. Направьте старый код на новую модель — и он остановится вот на этом:
# Старое: расширенное мышление (ошибка 400 на Opus 4.7 и новее) "thinking": {"type": "enabled", "budget_tokens": 10000} → 400: "thinking.type.enabled" is not supported ... # Новое: адаптивное мышление (глубина задаётся через effort) "thinking": {"type": "adaptive"}, "output_config": {"effort": "high"}
Сама правка невелика: удалить budget_tokens, переключиться на adaptive и отдать управление глубиной параметру effort. Но, как предупреждает документация, это изменение поведения, а не только синтаксиса. С фиксированным бюджетом Claude думал в каждом запросе; при адаптивном мышлении на низких уровнях effort он может полностью пропускать мышление на лёгких входных данных.
4. Как каждая модель обращается с мышлением: сводная таблица
Коварство в том, что «включено ли по умолчанию» и «можно ли выключить» различаются от модели к модели. Вот официальная документация, сведённая в одну таблицу.
| Модель | Если ничего не настраивать | Отключение мышления | budget_tokens |
|---|---|---|---|
| Claude Fable 5 / Mythos 5 | Мышление включено (всегда) | Невозможно (400) | Невозможно (400) |
| Claude Opus 5 | Мышление включено (адаптивное) | Только при effort high и ниже В сочетании с xhigh / max: 400 |
Невозможно (400) |
| Claude Sonnet 5 | Мышление включено (адаптивное) | Допускается | Невозможно (400) |
| Claude Opus 4.8 / 4.7 | Без мышления (включается явным adaptive) |
Допускается | Невозможно (400) |
| Claude Opus 4.6 / Sonnet 4.6 | Без мышления (включается явным adaptive) |
Допускается | Устарел (пока работает) |
| Sonnet 4.5 / Haiku 4.5 и более ранние | Без мышления | — (по умолчанию и так выключено) | Обязателен (единственный режим мышления; adaptive возвращает 400) |
Источник: Anthropic, «Thinking» и «Extended thinking» (по состоянию на август 2026 года)
На практике важны две вещи. Во-первых, с поколением Opus 5 умолчание перевернулось в сторону «мышление включено» — если вы дёшево гоняли задачу на Opus 4.8 с выключенным мышлением и поменяли только ID модели, выходные токены вырастут на долю мышления, и ответы начнут обрезаться по max_tokens либо счёт пойдёт вверх (подробно разобрано в нашем гайде по ломающим изменениям Opus 5). Во-вторых, budget_tokens продолжают использовать только устаревшие модели — пока вы остаётесь на Sonnet 4.5 или более ранних, мигрировать нечего; переписывайте код тогда, когда переходите на более новую модель.
5. Глубина теперь настраивается через effort
С исчезновением «бюджета» глубина мышления регулируется через output_config: {"effort": ...} — пять уровней, low / medium / high / xhigh / max, причём high — значение по умолчанию в API. Effort влияет не только на глубину мышления: от него зависят и то, насколько консолидированы вызовы инструментов, и объём вступлений, то есть общий расход токенов.
Рутинные задачи, классификация, субагенты. Может пропускать мышление на лёгких входных данных = быстро и дёшево
high — для обычной работы; xhigh — рекомендованная Anthropic отправная точка для кодинга и агентов
Для задач, где правильность важнее стоимости. Не всегда даёт лучший результат, поэтому не закрепляйте его навсегда
Что означают пять уровней, как устроен ползунок в Claude Code и как сохраняются настройки — в нашем гайде по настройке effort. Одно замечание о кешировании из документации: в адаптивном режиме значение effort подставляется в промпт, поэтому его изменение инвалидирует кеш промптов — та же картина, что и «смена бюджета сбрасывает кеш» в эпоху расширенного мышления. Не переключайте его туда-сюда посреди диалога.
6. За мышление платят, даже когда его не видно
То, как мышление выглядит снаружи, управляется полем display. Оно принимает два значения:
"summarized"— блокthinkingсодержит читаемое резюме рассуждений. Умолчание на Claude Opus 4.6 / Sonnet 4.6 и более ранних"omitted"— блокthinkingвозвращается с пустой строкой внутри. Умолчание на Fable 5 / Mythos 5 / Opus 5 / Sonnet 5 / Opus 4.8 / 4.7
Здесь прячутся две ловушки. Во-первых, чем новее модель, тем сильнее умолчание склоняется к «не показывать» — перенесите приложение, которое стримило рассуждения пользователям, на новую модель, и опыт превратится в долгую тишину, за которой внезапно следует ответ. Хотите видимость — попросите её явно: thinking: {"type": "adaptive", "display": "summarized"}. Во-вторых, display меняет только видимость — оплата идентична. Документация говорит об этом прямо: при omitted вы всё равно платите за полный объём токенов мышления; экономите вы задержку, а не деньги. И ни в одной конфигурации вы не получите сырую цепочку рассуждений — то, что показывает summarized, является резюме.
Как измерить, во что вам обходится мышление: поле ответа usage.output_tokens_details.thinking_tokens показывает, сколько оплаченных выходных токенов пришлось на внутренние рассуждения. При стриминге оно появляется только в финальном событии message_delta. «Я не вижу мышления» никогда не означает «его нет» — проверьте это поле после миграции.
Ещё одна практически важная вещь: обращение с блоками мышления. В многоходовых диалогах и при работе с инструментами передавайте блоки мышления из предыдущего ответа обратно строго без изменений. Их редактирование вызывает ошибку 400 — ошибка «invalid signature in thinking block», с которой сталкиваются пользователи Claude Code, возникает именно из этого механизма.
7. Ловушки отключения мышления
«Нам важна скорость — выключаем мышление» — решение вполне законное, но на Opus 5 оно обставлено условиями. Согласно официальной документации:
Мышление выключено + effort low / medium / high
Мышление выключено + effort xhigh / max (проверяется в каждом запросе)
Не выключайте — вместо этого снизьте effort до low / medium
Даже когда запрос проходит, есть побочные эффекты. Anthropic документирует: с выключенным мышлением Opus 5 может выписывать вызовы инструментов обычным текстом (инструмент так и не запускается, хотя ход выглядит успешным) и пропускать внутренние XML-теги в вывод. Если вы строите агентов, безопасный путь — оставить мышление включённым и снизить effort: расходы это сокращает примерно в ту же сторону.
8. Мышление между вызовами инструментов — interleaved thinking
Мышление — это не только «один раз, перед ответом». При чередующемся мышлении (interleaved thinking) Claude рассуждает и между вызовами инструментов, взвешивая каждый результат перед выбором следующего шага: пересматривает план после чтения результатов поиска, подбирает следующую команду по выводу предыдущей. Именно этот механизм стоит за качественным агентным поведением.
Здесь тоже есть разница поколений. В старом мире расширенного мышления для этого требовался бета-заголовок interleaved-thinking-2025-05-14; при адаптивном мышлении это происходит автоматически, и заголовок не нужен (документация констатирует, что «адаптивное мышление чередуется автоматически», и разрешает убрать заголовок после миграции). Переход на адаптивное мышление упрощает код ещё на одну настройку.
9. Когда нужна скорость: fast mode
Если вам нужно качество мышления, но меньше ожидания, вариант один — быстрый режим (fast mode). Согласно документации Claude Code о fast mode, это не даунгрейд на другую модель: тот же Claude Opus работает в конфигурации, заточенной под скорость. Вывод быстрее примерно до 2.5x, а цена удваивается ($10 вход / $50 выход за миллион токенов и на Opus 5, и на Opus 4.8). Доступен только на Opus 5 и Opus 4.8; fast mode для Opus 4.7 отключили 24 июля 2026 года.
Введите /fast в CLI, чтобы переключить режим (расширение для VS Code его не поддерживает). Официальная рекомендация: включать для интерактивной быстрой итерации, выключать, когда стоимость важнее задержки.
Только Claude API — недоступен на Amazon Bedrock, Google Cloud и Microsoft Foundry. Учтите также, что переключение скорости инвалидирует кеш промптов.
Мышление, effort и fast mode играют разные роли: мышление = механизм «рассуждать или нет», effort = насколько глубоко рассуждать, fast mode = насколько быстро доставляются те же рассуждения. Прежде чем хвататься за «медленно — убираем мышление», вспомните: у вас на руках ещё две карты — снизить effort или включить fast mode.
Итоги
- Расширенное мышление (budget_tokens) — старый способ. Устарел на Opus 4.6 / Sonnet 4.6, с Opus 4.7 — ошибка 400, и при этом по-прежнему единственный режим мышления на устаревших моделях (Sonnet 4.5 / Haiku 4.5 и др.)
- Адаптивное мышление — текущий способ. Модель сама решает, думать ли и сколько; глубина настраивается через
effort(пять уровней, по умолчанию high) - У Opus 5 / Sonnet 5 / Fable 5 мышление включено по умолчанию. На Fable 5 его нельзя выключить; на Opus 5 — только при effort high и ниже
- За мышление платят, даже когда его не видно. Умолчание нового поколения —
display: "omitted"(пустые блоки мышления). Измеряйте черезusage.output_tokens_details.thinking_tokens - У отключения мышления есть побочные эффекты (вызовы инструментов текстом, утечка тегов). Снизить effort безопаснее, чем выключать
- Чередующееся мышление при adaptive работает автоматически — бета-заголовок больше не нужен
- Нужна скорость? Fast mode (примерно 2.5x, цена 2x, Opus 5/4.8; в Claude Code переключается через
/fast)
FAQ
Q. Я задал budget_tokens и получил ошибку 400.
A. Модели начиная с Opus 4.7 (включая Opus 5 / Sonnet 5 / Fable 5) не принимают thinking: {"type": "enabled", "budget_tokens": N}. Перепишите на thinking: {"type": "adaptive"} и управляйте глубиной через output_config: {"effort": ...}. Если вы остаётесь на устаревших моделях вроде Sonnet 4.5 / Haiku 4.5, переписывать ничего не нужно.
Q. После перехода на адаптивное мышление ответы обрываются на середине предложения.
A. Токены мышления учитываются в max_tokens. У Opus 5 мышление к тому же включено по умолчанию, поэтому код, где max_tokens был подобран впритык под старую модель, теперь теряет бюджет на мышление и обрезает ответ. Дайте max_tokens больше запаса или снизьте effort.
Q. Блоки мышления возвращаются пустыми. Что-то сломалось?
A. Так и задумано. На Opus 5 / Sonnet 5 / Fable 5 / Opus 4.8 / 4.7 значение display по умолчанию — "omitted" (пустые блоки мышления). Чтобы видеть резюме, явно задайте thinking: {"type": "adaptive", "display": "summarized"}. Оплата в обоих случаях одинакова.
Q. Если выключить мышление, эти деньги сэкономятся?
A. Сами токены мышления — да. Но на Opus 5 это нельзя сочетать с effort xhigh/max (ошибка 400), и даже там, где это работает, Anthropic документирует побочные эффекты: вызовы инструментов, записанные обычным текстом, и утечку внутренних тегов в вывод. Для агентных нагрузок безопаснее сокращать расходы, оставив мышление включённым и снизив effort до low / medium.
Q. Нужно ли настраивать мышление в Claude Code (или чат-приложениях)?
A. Нет — Claude Code и claude.ai управляют мышлением сами, так что никаких параметров API настраивать не требуется. Вам доступны настройка effort и /fast (переключатель fast mode); механика включения и выключения мышления наружу не выходит.
Примечание: спецификации и цифры в этой статье основаны на документации Anthropic «Thinking», «Extended thinking» и документации Claude Code «Fast mode» (всё — по состоянию на август 2026 года). Спецификации меняются; прежде чем опираться на них, сверьтесь с актуальными формулировками в официальной документации.