Обновлено 26 сентября 2026 года: мы убрали цифры из заголовка и вступительной графики — «сжать до 20–30% от неоптимизированной стоимости», «−60–90% за счёт кэша», «$30K/мес снижается до $6–9K», «восемь из десяти задач справляются на более дешёвой модели», — потому что не смогли указать для них источник. Вместо них — примеры, которые можно посчитать по ценам и множителям с официальных страниц тарифов Anthropic и OpenAI, с формулой. Также исправлены точка окупаемости кэша (для 5-минутного кэша хватает одного чтения, для часового — двух) и цена вывода (в 5 раз дороже входа), добавлена глава о пакетной обработке. Что именно изменилось — в конце статьи.

Если перейти с фиксированного тарифа вроде ChatGPT Plus ($20 в месяц) на оплату за токены — Claude Code по API-ключу или собственное ИИ-приложение, — счёт может измениться на порядок в зависимости от того, как вы работаете. У оплаты по факту нет потолка.

Хорошая новость: самые действенные меры сводятся к трём — кэширование промптов, выбор модели и бюджет вывода. Эффект каждой задаётся множителями, опубликованными в официальных прайс-листах, поэтому его можно посчитать для своей нагрузки. Статья опирается на официальную документацию Anthropic и OpenAI и показывает эти множители и порядок расчёта.

3 РЫЧАГА

Экономию можно посчитать по официальным ценам

— по официальным прайс-листам Anthropic и OpenAI на 26 сентября 2026 года

РЫЧАГ 1 КЭШ
0,1×
Вход, прочитанный из кэша, стоит 0,1× базовой цены (0,05× у Claude Opus 5.5). Запись стоит 1,25× для 5-минутного кэша и 2× для часового (Anthropic, официально).
РЫЧАГ 2 ВЫБОР МОДЕЛИ
1/4
При переходе с Opus 5.5 на Haiku 4.5 вход дешевеет с $4 до $1, выход — с $20 до $5 (за миллион токенов, Anthropic, официально). С Sonnet 5 — вдвое.
РЫЧАГ 3 БЮДЖЕТ ВЫВОДА
5×
Вывод стоит в 5 раз дороже входа (у всех текущих моделей Claude и у всех трёх моделей GPT-6). Каждый срезанный токен вывода равен пяти токенам входа.

Пример: отправьте в Opus 5.5 один и тот же префикс на 100 000 токенов десять раз с интервалом меньше 5 минут — и стоимость входа снизится с $4,00 без кэша до $0,68 с 5-минутным кэшем (одна запись за $0,50 и девять чтений за $0,18).
То, что может подождать, через пакетный API стоит вдвое дешевле и на входе, и на выходе, а множители кэша применяются поверх.
Источники: Claude Platform Docs, «Pricing» и OpenAI API Pricing (проверено 26 сентября 2026 года; расчёты редакции)

1. Почему счёт за ИИ незаметно раздувается

Инструменты ИИ имеют две схемы биллинга: персональные тарифы (фикс) и API-биллинг (по расходу). Взрывается счёт в основном по второй схеме.

  • Персональные тарифы: ChatGPT Plus $20/мес, Claude Pro $20/мес ($17/мес при оплате за год), Max от $100/мес. Фиксированная стоимость, поэтому даже при интенсивном использовании есть потолок (с лимитами использования).
  • API-биллинг: по токенам, по факту использования. Сюда относятся Claude Code по API-ключу и ИИ-приложения, которые вы разрабатываете сами. Сумма за месяц может сильно колебаться в зависимости от того, как вы работаете.

Счёт по факту раздувается потому, что (1) токены вывода стоят в 5 раз дороже входа, (2) чем длиннее контекст, тем больше вы пересылаете целиком в каждом запросе, (3) субагенты раз за разом вызываются за кулисами и (4) если что-то зацикливается, оно не останавливается — всё это накапливается. Стоит понять механику — и каждое исправимо.

2. Структура расходов — вход, выход, кэш, batch

На примере цен API Claude Opus (на сентябрь 2026 года — Opus 5.5; уровень ниже старшей модели Fable, который Anthropic советует как отправную точку) разберём, куда уходят деньги.

СтатьяЦена (за 1M токенов)Описание
Токены входа$4То, что вы отправляете: промпт + история диалога + файлы и т. д.
Токены вывода$20То, что возвращает ИИ. В 5 раз дороже входа.
Запись в кэш (5 мин)$5 (1,25× входа)Сохранение префикса в кэше. Каждое чтение в течение 5 минут продлевает его без доплаты.
Запись в кэш (1 ч)$8 (2× входа)Переживает паузы дольше 5 минут, но запись дороже.
Чтение из кэша$0,20 (0,05× входа)0,1× у большинства моделей, 0,05× у Opus 5.5. Главная звезда экономии.
Пакетная обработкаВход $2, выход $10 (половина цены)Асинхронная обработка запросов, которые могут подождать. Сочетается с множителями кэша.
Вызовы инструментовУчитываются как входОпределения инструментов — часть контекста. Если передан хотя бы один инструмент, добавляется ещё и системный промпт для инструментов (286 токенов у Opus 5.5).

Короче говоря, префикс, который лежит в кэше, читается за десятую часть цены входа или дешевле. Множители записи (1,25× для 5 минут, 2× для часа) и соотношение «вывод в 5 раз дороже входа» одинаковы у всех текущих моделей Claude; различается только множитель чтения (у Fable 5.1 — 0,025×). Учтите также, что Claude Opus 4.7 и более новые модели используют новый токенизатор, который, по данным Anthropic, даёт примерно на 30% больше токенов для того же текста, — это важно при сравнении цен разных поколений. Источник: Claude Platform Docs, «Pricing» (проверено 26 сентября 2026 года).

3. Выбор тарифа и его влияние на экономию

В тот момент, когда вы можете предсказать, как будете пользоваться, сначала переключитесь на правильный тариф.

ИспользованиеРекомендуемый тарифЦель в месяцОговорки
Хобби, обучение, несколько раз в неделюClaude Free / ChatGPT Free$0Лимиты использования; не для рабочих данных.
Личное, несколько часов в деньClaude Pro / ChatGPT Plus$20Персональный тариф; не для рабочих данных.
Интенсивное личное использованиеClaude MaxОт $100В 5 или 20 раз больше использования, чем в Pro; для тех, кто часами работает в Claude Code.
Командная работаClaude Team / ChatGPT BusinessСтандартное место Claude Team: $20 (при оплате за год) — $25/пользовательПодходит для рабочих данных; данные не используются для обучения.
Крупная организацияEnterpriseПо запросуSSO, журналы аудита, SLA.
Разработка со встроенным ИИПрямой API (Anthropic / OpenAI)По расходуИспользуйте кэширование и batch.

Источники: страница цен Claude и OpenAI Help, «What is ChatGPT Plus?» (проверено 26 сентября 2026 года).

Если вы каждый день подолгу работаете в Claude Code и регулярно упираетесь в лимиты Pro, присмотритесь к тарифу Max. Это фиксированная плата, поэтому счёт не может разогнаться, как при работе по API-ключу. Cursor начинается с индивидуального тарифа Pro за $20 в месяц, выше есть Pro+ и Ultra.

4. Кэширование промптов — самый выгодный рычаг

Если вы обращаетесь к API напрямую и раз за разом отправляете один и тот же префикс, причин отказываться от кэширования промптов почти нет. То, что читается из кэша, оплачивается по малой доле базовой цены входа.

Как это работает

Когда вы переиспользуете один и тот же системный промпт или одни и те же документы между запросами, первый вызов записывает их в кэш (1,25× входа для 5-минутного кэша). Каждый последующий вызов читает из кэша по 0,1× входа (у Opus 5.5 — 0,05×, у Fable 5.1 — 0,025×). Но слишком короткий префикс не кэшируется: минимум — 512 токенов у Opus 5.5, 1024 у Sonnet 5 и 4096 у Haiku 4.5 (Claude Platform Docs, «Prompt caching»).

Точка окупаемости — одно чтение для 5-минутного кэша, два для часового

Примем цену входа за 1 и сравним стоимость отправки одного и того же префикса (расчёт по официальным множителям Anthropic):

  • 5-минутный кэш: запись 1,25 + одно чтение 0,1 = 1,35. Отправить дважды без кэша стоит 2, значит, окупается уже одно чтение.
  • Часовой кэш: запись 2 + два чтения 0,2 = 2,2. Отправить трижды без кэша стоит 3, значит, окупаются два чтения (при одном чтении выходит 2,1 — чуть больше, чем 2 без кэша).

На странице цен Anthropic сказано то же самое: кэш окупается после одного чтения при 5-минутном сроке и после двух — при часовом. Opus 5.5 читает по 0,05×, так что при том же числе чтений разрыв ещё больше.

Пример — префикс на 100 000 токенов, отправленный 10 раз

МодельБез кэша5-минутный кэшРазница
Claude Opus 5.5 (вход $4, запись $5, чтение $0,20)0,1 × $4 × 10 = $4,000,1 × $5 + 0,1 × $0,20 × 9 = $0,68Примерно на 83% меньше
Claude Sonnet 5 (вход $2, запись $2,50, чтение $0,20)0,1 × $2 × 10 = $2,000,1 × $2,50 + 0,1 × $0,20 × 9 = $0,43Примерно на 79% меньше

Считается только вход префикса (системный промпт, справочные документы и т. п.); 100 000 токенов = 0,1 в единицах миллиона. Предполагается, что все десять запросов приходят с интервалом меньше 5 минут, первый записывает кэш, остальные девять его читают. Цены: Claude Platform Docs, «Pricing» (проверено 26 сентября 2026 года). Вывод и меняющаяся часть каждого запроса не учитываются.

Модели GPT-6 от OpenAI устроены похоже. Кэшированный вход стоит 0,1×, запись — 1,25×, и руководство OpenAI приводит тот же расчёт: записать префикс один раз и один раз переиспользовать стоит 1,35× против 2× при двукратной обработке без кэша. Кэш живёт 30 минут с последнего использования и у поддерживаемых моделей включён по умолчанию (OpenAI, «Prompt caching»).

Срок жизни по умолчанию — 5 минут

В API Anthropic срок жизни (TTL) кэша промптов по умолчанию — 5 минут. Каждое чтение продлевает его без доплаты, но после паузы дольше 5 минут кэш истекает, и следующий запрос записывает его заново (1,25× цены входа). Можно выбрать срок в 1 час, но тогда запись стоит 2× цены входа (источник: Claude Platform Docs, «Prompt caching»).

Claude Code работает на том же механизме. В пределах включённого в подписку Claude объёма основной диалог получает срок в 1 час, но при работе по API-ключу или после выхода за лимит тарифа на кредиты использования срок падает до 5 минут. Начиная с v2.1.242 можно самому выбрать 5m или 1h через настройку promptCacheTtl (источник: Claude Code Docs, «Prompt caching», проверено 26 сентября 2026 года). Если вы работаете с перерывами, от того, какой из двух сроков действует, зависит, как часто кэш будет перезаписываться.

Как выбрать между 5 минутами и часом

Ориентиры из официальной документации:

  • Префикс используется чаще, чем раз в 5 минут: оставайтесь на 5-минутном кэше. Каждое чтение бесплатно его продлевает, и более дорогая часовая запись не нужна.
  • Префикс используется с паузами от 5 минут до часа (ожидание ответа пользователя, вызов после задачи дольше 5 минут): подходит часовой кэш.
  • Если сочетать оба: часовой кэш ставьте перед 5-минутным — тот же порядок, что и при размещении в начале неизменных системного промпта и определений инструментов.

Проверить, работает ли кэш, можно по полям cache_read_input_tokens (чтение) и cache_creation_input_tokens (запись) в usage ответа. Если чтение остаётся нулевым, префикс где-то меняется в каждом запросе или не дотягивает до минимального числа токенов.

5. Управление контекстом — /compact и разбиение

Поработайте с Claude Code или Cursor какое-то время, и где-то посреди длинного диалога вы обнаружите, что на каждом ходу заново отправляете большой объём прошлого диалога. Раздувается не вывод, а вход (= прошлый диалог).

Тактика 1: активно используйте /compact

В Claude Code есть команда /compact. Она подытоживает диалог на данный момент и освобождает контекст (Claude Code Docs, «Commands»); можно передать указание, что сохранить в сводке. Пользуйтесь ею на естественных паузах в работе.

Тактика 2: разбивайте сессии по задачам

Не делайте «реализовать функцию A», «исправить баг B» и «сгенерировать док C» в одном длинном диалоге — начинайте свежие сессии. Закрывайте сессию по завершении каждой задачи. Если нужна долгосрочная память, выпишите её в файл памяти.

Тактика 3: подрезайте шум через Hooks

Claude Agent SDK / Claude Code предоставляют Hooks — они позволяют преобразовать вывод инструментов до того, как тот дойдёт до ИИ. Пример: сжать длинный лог npm install до простого «успех/неудача» через Hook. Чем длиннее лог, тем легче становится вход на каждом ходу.

6. Выбор модели — маршрутизация по задачам

«Всегда Opus» — стратегия миллионера. С рутинной работой вроде классификации и извлечения часто справляются Sonnet или Haiku. Цена определяется уровнем модели (старший, средний, лёгкий); официальные цены на 26 сентября 2026 года (за миллион токенов) приведены ниже. От версии к версии соотношение — чем выше уровень, тем дороже, а лёгкая модель стоит лишь долю старшей — не менялось.

МодельВходВыходЛучше всего для
Claude Opus 5.5 (старшая)$4$20Сложный дизайн, рассуждения, длинные автономные задачи
Claude Sonnet 5 (средняя)$2$10Ежедневный кодинг, анализ, суммирование
Claude Haiku 4.5 (лёгкая)$1$5Классификация, извлечение, короткое преобразование, реальное время
GPT-6 Sol (сбалансированная модель OpenAI)$2$10Сложный кодинг и агентная работа
GPT-6 Luna (недорогая модель OpenAI)$0,10$0,50Узкие лёгкие задачи в большом объёме

Источники: Claude Platform Docs, «Pricing» и OpenAI API Pricing (проверено 26 сентября 2026 года; у OpenAI — цены для короткого контекста). Выше них стоят Fable 5.1 от Anthropic ($10 / $50) и флагман OpenAI GPT-6 Astra ($10 / $50). Текущие модели всех компаний — в списке текущих моделей и дат среза знаний.

Переход со старшей Opus на лёгкую Haiku снижает цену за токен вчетверо (на сентябрь 2026 года). Для задачи классификации, которая тратит 2 млн токенов входа и 200 000 токенов выхода в день, официальные цены дают:

  • Opus 5.5: 2 × $4 + 0,2 × $20 = $12
  • Sonnet 5: 2 × $2 + 0,2 × $10 = $6
  • Haiku 4.5: 2 × $1 + 0,2 × $5 = $3
  • Haiku 4.5 пакетом: $3 × 0,5 = $1,50 (глава 8)

Хватит ли качества — зависит от задачи, поэтому перед переходом на более дешёвую модель сравните результаты на одном и том же входе (FAQ, Q4). Ориентиры:

  • Используйте Opus для: сложного рефакторинга, дизайна, охватывающего множество файлов, глубоких рассуждений, исследования незнакомой области
  • Используйте Sonnet для: ежедневного кодинга, анализа, суммирования, ревью, добавления тестов
  • Используйте Haiku для: классификации, извлечения, преобразования формата, подсказок в реальном времени, генерации сообщений коммитов

7. Управление бюджетом вывода

Токены вывода стоят в 5 раз дороже входа — и у текущих моделей Claude, и у GPT-6 Astra, Sol и Luna. Ответ Opus 5.5 на 2000 токенов входа и 1000 токенов вывода стоит $0,008 + $0,020 = $0,028. Ограничьте вывод 500 токенами — и получится $0,018, примерно на 36% меньше (расчёт по официальным ценам).

Три подхода

  • Подбирайте max_tokens под задачу: в Messages API Anthropic max_tokens — обязательный параметр, и указанное число становится потолком вывода (справочник API, «Messages»). Не оставляйте большое значение по инерции; ставьте соответствующее задаче, например max_tokens: 1000.
  • Добавляйте «отвечай кратко» или «пять пунктов» в промпт: ИИ слушается. Подавляйте лишние вступления, резюме и подписи.
  • Структурированный вывод (режим JSON): JSON короче прозы. Если ваше приложение потребляет результат — это путь.

Для ситуаций, где «длинный красивый ответ» не нужен (классификация, извлечение, решения), жёсткое урезание оказывается экономнее.

8. Пакетная обработка — половина цены для того, что может подождать

Работа, которой не нужен немедленный ответ, — ночная массовая классификация, пакетное суммирование, прогоны оценки — через пакетный API стоит вдвое дешевле и на входе, и на выходе. Message Batches API от Anthropic принимает до 100 000 запросов в одном пакете; большинство завершается меньше чем за час, но пакет может выполняться до 24 часов (Claude Platform Docs, «Batch processing»). Batch API у OpenAI тоже даёт скидку 50%, срок выполнения — 24 часа (OpenAI, «Batch API»).

Согласно странице цен Anthropic, множители кэша сочетаются со скидкой за пакетную обработку. Например, чтение из кэша у Haiku 4.5 внутри пакета обходится в $1 × 0,1 × 0,5 = $0,05 за миллион токенов.

9. Ловушка мультиагентов — 15-кратные токены

Тренд 2026 года, мультиагентные сборки (оркестратор + параллельные субагенты), мощный, но Anthropic опубликовала данные своей функции Research: агенты тратят примерно в 4 раза больше токенов, чем обычный чат, а мультиагентные системы — примерно в 15 раз больше (Anthropic, «How we built our multi-agent research system», июнь 2025). 15 раз — это сравнение с чатом, а не с одним агентом.

Критерии решения для экономии

  • Ясные, последовательные задачи (правка одного файла, суммирование, ревью кода) → достаточно одного агента
  • Параллелизм, реально сокращающий время выполнения → мультиагент оправдан
  • «Мультиагент по умолчанию» — экономически неверно. Начните с одного агента и разделяйте только те узкие места, которые реально видите.

Подробнее: см. Что такое мультиагент?

10. Мониторинг и оповещения о биллинге

Чтобы счёт по факту не застал вас врасплох, регулярный мониторинг + оповещения необходимы.

Пользователи API

  • Проверяйте ежедневное потребление токенов в Claude Console / OpenAI Dashboard
  • Установите лимит расхода: например, остановка при превышении $200/мес. Без лимита — опасно.
  • Оповещения о биллинге: email при $50, Slack при $100 — пороги по этапам.

Пользователи Claude Code

  • Через /usage проверяйте стоимость текущей сессии и расход по тарифу (/cost теперь — псевдоним /usage)
  • Сделайте привычкой проверку /usage в конце дня

Администраторы организаций

  • Отчёты по потреблению на пользователя (админ-консоль Anthropic Team / Enterprise)
  • Обнаружение аномалий (помечать тех, кто тратит заметно больше обычного)
  • Ежеквартальное распространение «шаблонов расточительства» на всю компанию

11. Семь типичных шаблонов расточительства

ШаблонЧто не такИсправление
Прикреплять все файлы заново на каждом ходуКэш не срабатывает; вход раздуваетсяПоместите неизменяемые документы в префикс и закэшируйте
Задавать один и тот же вопрос и в ChatGPT, и в ClaudeПлатите дважды за один и тот же вход на разных тарифахВыберите один
Продолжать длинный диалог без /compactПолная история шлётся каждый ход/compact на естественных паузах
Использовать Opus для простой классификации или извлеченияПлатите вчетверо больше, чем стоил бы Haiku, за тот же результатПодбирайте модель под задачу
Повторять «более отполированно» / «чуть длиннее»Токены вывода накапливаютсяЗаявите желаемую длину сразу
Определять много ненужных инструментовОпределения инструментов едут в контекстеОпределяйте только то, чем пользуетесь
Тянуться к мультиагенту по привычкеПримерно в 15 раз больше токенов, чем у чата (у одного агента — примерно в 4 раза)Только при ясной необходимости

Итоги

  • Три рычага оптимизации стоимости ИИ: кэширование промптов, выбор модели, бюджет вывода. Эффект каждого задают официальные множители, и эти множители перемножаются.
  • Чтение из кэша = 0,1× входа (0,05× у Opus 5.5). 5-минутный кэш окупается после одного чтения, часовой — после двух. Префикс на 100 000 токенов, отправленный в Opus 5.5 десять раз, дешевеет с $4,00 до $0,68.
  • Выбор модели: от Opus 5.5 к Haiku 4.5 цена за токен падает вчетверо, к Sonnet 5 — вдвое (на сентябрь 2026 года).
  • Бюджет вывода: вывод в 5 раз дороже входа. Явно задавайте max_tokens и просите «кратко».
  • Пакетная обработка: то, что может подождать, вдвое дешевле на входе и выходе и сочетается со скидкой кэша.
  • Управление контекстом: /compact на естественных паузах, разбивайте по задачам, сжимайте вывод через Hooks.
  • Ловушка мультиагентов: примерно в 15 раз больше токенов, чем у чата. Используйте только при ясной необходимости.
  • Мониторинг: лимиты расхода, оповещения о биллинге и проверка /usage должны стать привычкой.

FAQ

Q1. Я пользуюсь Claude Code ежедневно — что выгоднее, Pro за $20 или Max?

Если вы регулярно упираетесь в лимиты Pro, присмотритесь к Max. Справочный центр Anthropic советует пользователям Pro, которые постоянно упираются в лимиты и которым нужно больше ресурсов для крупных репозиториев, рассмотреть переход на Max 5x (Claude Help Center, «Using Claude Code with your Pro or Max plan»). Если в лимиты не упираетесь, оставайтесь на Pro.

Q2. Нужна ли особая настройка для использования кэширования промптов?

В API Anthropic нужно указать cache_control — один раз на верхнем уровне запроса (автоматическое кэширование) или на отдельных блоках (явные точки разбиения). У OpenAI кэширование для поддерживаемых моделей включено по умолчанию. Claude Code использует кэш автоматически. Подробнее — в официальной документации Anthropic.

Q3. ChatGPT vs. Claude — что экономичнее?

Зависит от сценария. Только по цене за единицу средняя Claude Sonnet 5 и GPT-6 Sol равны: $2 на входе и $10 на выходе. Для коротких Q&A и рутинных задач в большом объёме недорогая модель OpenAI (на сентябрь 2026 года — GPT-6 Luna, $0,10 на входе) в десять раз дешевле Haiku 4.5 ($1 на входе). В длинных задачах, где один и тот же префикс отправляется снова и снова, важны чтения из кэша, и тогда в расчёт входит и Opus 5.5 (0,05×). «Подписаться на оба и подбирать инструмент под задачу» — тоже практичный вариант.

Q4. Как понять, что «Haiku достаточно»?

Проведите трёхступенчатый эксперимент. (1) Заставьте работать на Opus. (2) Отправьте тот же промпт в Sonnet и сравните качество. (3) Если Sonnet выглядит сопоставимо, попробуйте и Haiku. Чем рутиннее задача, тем меньше обычно разница. Берегите Opus для случаев, где действительно нужны глубокое суждение или рассуждение.

Q5. Стоит ли частному пользователю обращаться к API напрямую?

По обстоятельствам. Если вы в основном программируете в интерактивном режиме, тариф Max держит счёт фиксированным и удобнее. Для встраивания ИИ в собственное приложение, пакетной обработки или автоматизации нужен прямой API. Многие используют и то, и другое.

Q6. Какой порог поставить на оповещения о биллинге?

Единственно верного ответа нет, но один из вариантов ступеней — первое оповещение на 1,5× от обычного месячного расхода и остановка на 3×. Если обычно тратите $30/мес, оповещение на $50 и стоп на $100. На первых порах ставьте небольшие ежедневные оповещения, чтобы почувствовать свой расход, а затем ослабьте.

Q7. Нам сказали: «бюджет компании на ИИ слишком вырос». С чего начать?

Три шага по порядку. (1) Посмотрите на использование по пользователям и найдите, где концентрируется потребление. (2) Поговорите с самыми активными пользователями о рабочем процессе и выявите шаблоны расточительства. (3) Разошлите по компании внутреннее руководство по «кэшированию, выбору модели, бюджету вывода» и ежемесячно отчитывайтесь о прогрессе.

Исправления к прежней версии

26 сентября 2026 года мы исправили следующее.

Прежняя версияСейчас
Три рычага сжимают расходы до 20–30% от неоптимизированной стоимости (заголовок, вступление, изображение)Удалено: источник указать нельзя. Заменено примерами, рассчитанными по официальным ценам и множителям.
−60–90% за счёт кэша, −50–80% за счёт выбора модели, −30–60% за счёт бюджета вывода, $30K/мес снижается до $6–9KТо же. Заменено расчётами вроде «префикс на 100 000 токенов, отправленный десять раз: $4,00 → $0,68».
Восемь из десяти задач справляются на более дешёвой моделиУдалено; нет источника.
5-минутный кэш окупается с двух чтенийОкупается с одного чтения (запись 1,25 + чтение 0,1 = 1,35 < 2).
Часовой кэш окупается с пяти чтенийОкупается с двух чтений (2 + 0,2 = 2,2 < 3).
Токены вывода стоят в 5–6 раз дороже входаВ 5 раз (у всех текущих моделей Claude и всех трёх моделей GPT-6).
Hit-rate кэша ниже 60% — есть куда оптимизировать; на продакшене целиться в 80%+Удалено; нет источника. Заменено проверкой токенов чтения и записи в usage.
/compact ужимает 200k токенов до 5 000Цифры удалены; нет источника.