Содержание
- 1. Что такое мышление (thinking)
- 2. Эпоха расширенного мышления — budget_tokens задаёте вы
- 3. Переход к адаптивному мышлению — решает модель
- 4. Как каждая модель обращается с мышлением: сводная таблица
- 5. Глубина теперь настраивается через effort
- 6. За мышление платят, даже когда его не видно
- 7. Ловушки отключения мышления
- 8. Мышление между вызовами инструментов — interleaved thinking
- 9. Когда нужна скорость: fast mode
- Итоги
- FAQ
За последний год то, как Claude «думает», изменилось до неузнаваемости. Старое расширенное мышление (extended thinking) работало так: человек указывал, сколько токенов модель может потратить на рассуждения. Текущее поколение заменяет его адаптивным мышлением (adaptive thinking) — модель сама решает, думать ли вообще и насколько глубоко. А начиная с Claude Opus 5 мышление включено по умолчанию, так что и старое допущение «нет настройки — нет мышления» осталось в прошлом. А на вышедшем позже Claude Opus 5.5 и на моделях Fable мышление нельзя даже выключить.
В этой статье разберём, чем на самом деле различаются расширенное и адаптивное мышление, как поведение меняется от модели к модели и какие ловушки подстерегают при миграции кода — ошибки 400, обрезанный вывод и счета, которые незаметно растут. Всё опирается на официальную документацию Anthropic.
От «глубину задаёт человек» к «решает сама модель»
Смена поколений в три шага
1. Что такое мышление (thinking)
Мышление — это этап, на котором Claude прорабатывает задачу своими словами, прежде чем начать писать окончательный ответ. Он переформулирует вопрос, пробует несколько подходов, проверяет промежуточные результаты и отбрасывает пути, которые никуда не ведут, — и весь этот процесс генерируется в виде блоков контента thinking перед ответом. Наибольшую отдачу это даёт на задачах, где качество промежуточной работы определяет качество ответа: математика, программирование, анализ и длительная агентная работа.
Однако это не бесплатно. Как прямо сказано в документации Anthropic «Thinking», токены, которые Claude тратит на рассуждения, тарифицируются как выходные и учитываются в max_tokens — причём оплата та же даже в конфигурациях, где текст мышления вам вообще не возвращается (см. раздел 6). Проектирование настройки мышления — это вопрос стоимости и задержки не в меньшей степени, чем вопрос качества.
2. Эпоха расширенного мышления — budget_tokens задаёте вы
Первым воплощением было расширенное мышление. К запросу добавляется thinking: {"type": "enabled", "budget_tokens": N}, и Claude рассуждает в рамках этого бюджета, прежде чем ответить. Сколько думать, указывает человек — и в каждом запросе. Согласно официальной документации, правила такие:
- Минимум 1,024 токена. Меньшие значения API отклоняет
- Должен быть меньше
max_tokens— мышление учитывается в этом лимите, поэтому нужно оставить место для самого ответа - Бюджет — это ориентир, а не жёсткий потолок. Фактический расход зависит от задачи, и Claude часто заканчивает думать задолго до исчерпания бюджета
- Для бюджетов мышления выше 32,000 Anthropic рекомендует пакетную обработку, чтобы избежать таймаутов
Проблема этой конструкции очевидна: правильный бюджет зависит от задачи, и заранее угадать его человек не может. Простой вопрос может впустую сжечь выделенный бюджет; сложной задаче его может не хватить. К тому же изменение значения бюджета инвалидирует кеш промптов — документация демонстрирует это на измеренном примере.
3. Переход к адаптивному мышлению — решает модель
Именно это заменяет адаптивное мышление, появившееся в 2026 году. Вся настройка — одна строка: thinking: {"type": "adaptive"}. Думать ли и насколько глубоко, Claude решает сам — исходя из того, насколько сложным выглядит запрос. Лёгкие входные данные получают мгновенный ответ без мышления; трудные задачи — глубокие рассуждения.
Миграция шла по графику, описанному в документации Anthropic «Extended thinking»: budget_tokens объявлен устаревшим на Claude Opus 4.6 / Sonnet 4.6 (там он ещё работает), а модели начиная с Claude Opus 4.7 отклоняют его с ошибкой 400. Направьте старый код на новую модель — и он остановится вот на этом:
# Старое: расширенное мышление (ошибка 400 на Opus 4.7 и новее) "thinking": {"type": "enabled", "budget_tokens": 10000} → 400: "thinking.type.enabled" is not supported ... # Новое: адаптивное мышление (глубина задаётся через effort) "thinking": {"type": "adaptive"}, "output_config": {"effort": "high"}
Сама правка невелика: удалить budget_tokens, переключиться на adaptive и отдать управление глубиной параметру effort. Но, как предупреждает документация, это изменение поведения, а не только синтаксиса. С фиксированным бюджетом Claude думал в каждом запросе; при адаптивном мышлении на низких уровнях effort он может полностью пропускать мышление на лёгких входных данных.
4. Как каждая модель обращается с мышлением: сводная таблица
Коварство в том, что «включено ли по умолчанию» и «можно ли выключить» различаются от модели к модели. Вот официальная документация, сведённая в одну таблицу. По состоянию на 29 сентября 2026 года в официальном списке Anthropic текущие модели — Fable 5.1, Opus 5.5, Sonnet 5.5 и Haiku 4.5; остальные относятся к прежним поколениям (Opus 5 и Sonnet 5 по-прежнему доступны как Legacy). Когда выйдет новая модель, проверьте те же три пункта в таблице по моделям на официальной странице «Troubleshooting thinking».
| Модель | Если ничего не настраивать | Отключение мышления | budget_tokens |
|---|---|---|---|
| Claude Fable 5.1 / Fable 5 / Mythos 5.1 / Mythos 5 | Мышление включено (всегда) | Невозможно (400) | Невозможно (400) |
| Claude Opus 5.5 | Мышление включено (всегда) | Невозможно (400) | Невозможно (400) |
| Claude Sonnet 5.5 | Мышление включено (адаптивное) | Невозможно (400) Вместо этого between_tools отключает только начальное мышление (effort high и ниже) |
Невозможно (400) |
| Claude Opus 5 (Legacy) | Мышление включено (адаптивное) | Только при effort high и ниже В сочетании с xhigh / max: 400 |
Невозможно (400) |
| Claude Sonnet 5 (Legacy) | Мышление включено (адаптивное) | Допускается | Невозможно (400) |
| Claude Opus 4.8 / 4.7 | Без мышления (включается явным adaptive) |
Допускается | Невозможно (400) |
| Claude Opus 4.6 / Sonnet 4.6 | Без мышления (включается явным adaptive) |
Допускается | Устарел (пока работает) |
| Haiku 4.5 / Sonnet 4.5 / Opus 4.5 | Без мышления | — (по умолчанию и так выключено) | Обязателен (единственный режим мышления; adaptive возвращает 400) |
Источник: Anthropic, «Thinking» и «Extended thinking» и «Troubleshooting thinking» (по состоянию на 29 сентября 2026 года)
На практике важны две вещи. Во-первых, с поколением Opus 5 умолчание перевернулось в сторону «мышление включено», а на Opus 5.5 его уже нельзя и выключить — если вы дёшево гоняли задачу на Opus 4.8 с выключенным мышлением и поменяли только ID модели, выходные токены вырастут на долю мышления, и ответы начнут обрезаться по max_tokens либо счёт пойдёт вверх (подробно разобрано в нашем гайде по ломающим изменениям Opus 5). На Opus 5.5 ограничить объём мышления можно только через effort. Во-вторых, budget_tokens продолжают использовать модели, поддерживающие только расширенное мышление — это Haiku 4.5, Sonnet 4.5 и Opus 4.5. Пока вы остаётесь на них, переписывать ничего не нужно, но Sonnet 4.5 перестанет работать в Claude API 30 ноября 2026 года (объявлено 30 сентября, преемник — Sonnet 5.5; см. официальный список выводимых из эксплуатации моделей). Задачи на Sonnet 4.5 переведите до этой даты на Sonnet 5.5 и заодно перепишите их на адаптивное мышление.
5. Глубина теперь настраивается через effort
С исчезновением «бюджета» глубина мышления регулируется через output_config: {"effort": ...} — пять уровней, low / medium / high / xhigh / max, причём high — значение по умолчанию в API для большинства моделей, а у Opus 5.5 — medium (без effort Opus 5.5 работает на уровень ниже, чем Opus 5). Effort влияет не только на глубину мышления: от него зависят и то, насколько консолидированы вызовы инструментов, и объём вступлений, то есть общий расход токенов.
Рутинные задачи, классификация, субагенты. Может пропускать мышление на лёгких входных данных = быстро и дёшево
Сложные рассуждения, кодинг и агенты. С какого уровня начинать, зависит от модели; Anthropic советует не переносить настройки при смене модели, а подбирать уровень на собственных тестах
Для задач, где правильность важнее стоимости. Не всегда даёт лучший результат, поэтому не закрепляйте его навсегда
Что означают пять уровней, как устроен ползунок в Claude Code и как сохраняются настройки — в нашем гайде по настройке effort. Одно замечание о кешировании из документации: в адаптивном режиме значение effort подставляется в промпт, поэтому его изменение инвалидирует кеш промптов — та же картина, что и «смена бюджета сбрасывает кеш» в эпоху расширенного мышления. Не переключайте его туда-сюда посреди диалога. Исключение: на Fable 5.1, Opus 5.5, Opus 5 и некоторых других смена effort сообщением посреди диалога (бета) сохраняет кеш всего, что было до него.
6. За мышление платят, даже когда его не видно
То, как мышление выглядит снаружи, управляется полем display. Оно принимает два значения:
"summarized"— блокthinkingсодержит читаемое резюме рассуждений. Умолчание на Claude Opus 4.6 / Sonnet 4.6 и более ранних"omitted"— блокthinkingвозвращается с пустой строкой внутри. Умолчание на Fable 5.1 / Fable 5 / Mythos 5.1 / Mythos 5 / Opus 5.5 / Opus 5 / Sonnet 5.5 / Sonnet 5 / Opus 4.8 / 4.7
Здесь прячутся две ловушки. Во-первых, чем новее модель, тем сильнее умолчание склоняется к «не показывать» — перенесите приложение, которое стримило рассуждения пользователям, на новую модель, и опыт превратится в долгую тишину, за которой внезапно следует ответ. Хотите видимость — попросите её явно: thinking: {"type": "adaptive", "display": "summarized"}. Во-вторых, display меняет только видимость — оплата идентична. Документация говорит об этом прямо: при omitted вы всё равно платите за полный объём токенов мышления; экономите вы задержку, а не деньги. И ни в одной конфигурации вы не получите сырую цепочку рассуждений — то, что показывает summarized, является резюме.
Как измерить, во что вам обходится мышление: поле ответа usage.output_tokens_details.thinking_tokens показывает, сколько оплаченных выходных токенов пришлось на внутренние рассуждения. При стриминге оно появляется только в финальном событии message_delta. «Я не вижу мышления» никогда не означает «его нет» — проверьте это поле после миграции.
Ещё одна практически важная вещь: обращение с блоками мышления. В многоходовых диалогах и при работе с инструментами передавайте блоки мышления из предыдущего ответа обратно строго без изменений. Их редактирование вызывает ошибку 400 — ошибка «invalid signature in thinking block», с которой сталкиваются пользователи Claude Code, возникает именно из этого механизма.
7. Ловушки отключения мышления
«Нам важна скорость — выключаем мышление» — решение вполне законное, но на Opus 5.5 и моделях Fable мышление выключить нельзя (disabled возвращает ошибку 400). Выключить его можно, например, на Sonnet 5 и на Opus 4.8 и более ранних, а на Opus 5 это обставлено условиями. Согласно официальной документации, на Opus 5:
Мышление выключено + effort low / medium / high
Мышление выключено + effort xhigh / max (проверяется в каждом запросе)
Не выключайте — вместо этого снизьте effort до low / medium
Даже когда запрос проходит, есть побочные эффекты. Anthropic документирует: с выключенным мышлением Opus 5 может выписывать вызовы инструментов обычным текстом (инструмент так и не запускается, хотя ход выглядит успешным) и пропускать внутренние XML-теги в вывод. Если вы строите агентов, безопасный путь — оставить мышление включённым и снизить effort: расходы это сокращает примерно в ту же сторону.
Sonnet 5.5 не принимает disabled (ошибка 400). Самая низкая настройка у него — thinking: {"type": "between_tools"}: она выключает только начальное мышление перед ответом. Короткие заметки о ходе работы, которые модель пишет между вызовами инструментов, по-прежнему приходят блоками мышления, а запрос без инструментов возвращает только текст — как disabled на Sonnet 5. Работает только при effort high и ниже; в сочетании с xhigh / max возвращается ошибка 400 (Anthropic, «What's new in Claude Sonnet 5.5»).
8. Мышление между вызовами инструментов — interleaved thinking
Мышление — это не только «один раз, перед ответом». При чередующемся мышлении (interleaved thinking) Claude рассуждает и между вызовами инструментов, взвешивая каждый результат перед выбором следующего шага: пересматривает план после чтения результатов поиска, подбирает следующую команду по выводу предыдущей. Именно этот механизм стоит за качественным агентным поведением.
Здесь тоже есть разница поколений. В старом мире расширенного мышления для этого требовался бета-заголовок interleaved-thinking-2025-05-14; при адаптивном мышлении это происходит автоматически, и заголовок не нужен (документация констатирует, что «адаптивное мышление чередуется автоматически», и разрешает убрать заголовок после миграции). Переход на адаптивное мышление упрощает код ещё на одну настройку.
9. Когда нужна скорость: fast mode
Если вам нужно качество мышления, но меньше ожидания, вариант один — быстрый режим (fast mode). Согласно документации Claude Code о fast mode, это не даунгрейд на другую модель: тот же Claude Opus работает в конфигурации, заточенной под скорость. Вывод быстрее примерно до 2.5x, а цена удваивается (на 25 сентября 2026 года: $8 вход / $40 выход за миллион токенов на Opus 5.5 и $10 / $50 на Opus 5 и Opus 4.8). Доступен только на Opus 5.5, Opus 5 и Opus 4.8; fast mode для Opus 4.7 отключили 24 июля 2026 года.
Введите /fast в CLI, чтобы переключить режим (в расширении для VS Code, если выбранная модель его поддерживает, появляется команда «Toggle fast mode»). Официальная рекомендация: включать для интерактивной быстрой итерации, выключать, когда стоимость важнее задержки.
Только Claude API — недоступен на Amazon Bedrock, Google Cloud и Microsoft Foundry. Учтите также, что переключение скорости инвалидирует кеш промптов.
Мышление, effort и fast mode играют разные роли: мышление = механизм «рассуждать или нет», effort = насколько глубоко рассуждать, fast mode = насколько быстро доставляются те же рассуждения. Прежде чем хвататься за «медленно — убираем мышление», вспомните: у вас на руках ещё две карты — снизить effort или включить fast mode.
Итоги
- Расширенное мышление (budget_tokens) — старый способ. Устарел на Opus 4.6 / Sonnet 4.6, с Opus 4.7 — ошибка 400, и при этом по-прежнему единственный режим мышления на моделях, поддерживающих только расширенное мышление (Haiku 4.5 / Sonnet 4.5 / Opus 4.5)
- Адаптивное мышление — текущий способ. Модель сама решает, думать ли и сколько; глубина настраивается через
effort(пять уровней; по умолчанию high у большинства моделей и medium у Opus 5.5) - У Opus 5 и новее, Sonnet 5 и новее и моделей Fable мышление включено по умолчанию. На Opus 5.5 и Fable его нельзя выключить; на Opus 5 — только при effort high и ниже; на Sonnet 5 — можно; на Sonnet 5.5 вместо
disabledиспользуетсяbetween_tools(выключает только начальное мышление, при effort high и ниже) - За мышление платят, даже когда его не видно. Умолчание нового поколения —
display: "omitted"(пустые блоки мышления). Измеряйте черезusage.output_tokens_details.thinking_tokens - У отключения мышления есть побочные эффекты (вызовы инструментов текстом, утечка тегов). Снизить effort безопаснее, чем выключать
- Чередующееся мышление при adaptive работает автоматически — бета-заголовок больше не нужен
- Нужна скорость? Fast mode (примерно 2.5x, цена 2x, Opus 5.5/5/4.8; в Claude Code переключается через
/fast)
FAQ
Q. Я задал budget_tokens и получил ошибку 400.
A. Модели начиная с Opus 4.7 (включая Opus 5.5 / Opus 5 / Sonnet 5.5 / Sonnet 5 / Fable) не принимают thinking: {"type": "enabled", "budget_tokens": N}. Перепишите на thinking: {"type": "adaptive"} и управляйте глубиной через output_config: {"effort": ...}. На моделях, поддерживающих только расширенное мышление, вроде Haiku 4.5 и Sonnet 4.5, наоборот, ошибку 400 вернёт adaptive, так что там ничего не переписывайте.
Q. После перехода на адаптивное мышление ответы обрываются на середине предложения.
A. Токены мышления учитываются в max_tokens. У Opus 5 и более новых моделей мышление к тому же включено по умолчанию, поэтому код, где max_tokens был подобран впритык под старую модель, теперь теряет бюджет на мышление и обрезает ответ. Дайте max_tokens больше запаса или снизьте effort.
Q. Блоки мышления возвращаются пустыми. Что-то сломалось?
A. Так и задумано. На Opus 5.5 / Opus 5 / Sonnet 5.5 / Sonnet 5 / Fable / Opus 4.8 / 4.7 значение display по умолчанию — "omitted" (пустые блоки мышления). Чтобы видеть резюме, явно задайте thinking: {"type": "adaptive", "display": "summarized"}. Оплата в обоих случаях одинакова.
Q. Если выключить мышление, эти деньги сэкономятся?
A. Сами токены мышления — да. Но на Opus 5.5 и Fable мышление вообще нельзя выключить (ошибка 400), на Opus 5 это нельзя сочетать с effort xhigh/max (ошибка 400), и даже там, где это работает, Anthropic документирует побочные эффекты: вызовы инструментов, записанные обычным текстом, и утечку внутренних тегов в вывод. Для агентных нагрузок безопаснее сокращать расходы, оставив мышление включённым и снизив effort до low / medium.
Q. Нужно ли настраивать мышление в Claude Code (или чат-приложениях)?
A. Нет — Claude Code и claude.ai управляют мышлением сами, так что никаких параметров API настраивать не требуется. Вам доступны настройка effort и /fast (переключатель fast mode); механика включения и выключения мышления наружу не выходит.
Примечание: спецификации и цифры в этой статье основаны на документации Anthropic «Thinking», «Extended thinking» и документации Claude Code «Fast mode» (всё — по состоянию на август 2026 года). Спецификации меняются; прежде чем опираться на них, сверьтесь с актуальными формулировками в официальной документации.