Содержание
- 1. Почему счёт за ИИ незаметно раздувается
- 2. Структура расходов — вход, выход, кэш, batch
- 3. Выбор тарифа и его влияние на экономию
- 4. Кэширование промптов — самый выгодный рычаг
- 5. Управление контекстом — /compact и разбиение
- 6. Выбор модели — маршрутизация по задачам
- 7. Управление бюджетом вывода
- 8. Пакетная обработка — половина цены для того, что может подождать
- 9. Ловушка мультиагентов — 15-кратные токены
- 10. Мониторинг и оповещения о биллинге
- 11. Семь типичных шаблонов расточительства
- Итоги
- FAQ
- Исправления к прежней версии
Обновлено 26 сентября 2026 года: мы убрали цифры из заголовка и вступительной графики — «сжать до 20–30% от неоптимизированной стоимости», «−60–90% за счёт кэша», «$30K/мес снижается до $6–9K», «восемь из десяти задач справляются на более дешёвой модели», — потому что не смогли указать для них источник. Вместо них — примеры, которые можно посчитать по ценам и множителям с официальных страниц тарифов Anthropic и OpenAI, с формулой. Также исправлены точка окупаемости кэша (для 5-минутного кэша хватает одного чтения, для часового — двух) и цена вывода (в 5 раз дороже входа), добавлена глава о пакетной обработке. Что именно изменилось — в конце статьи.
Если перейти с фиксированного тарифа вроде ChatGPT Plus ($20 в месяц) на оплату за токены — Claude Code по API-ключу или собственное ИИ-приложение, — счёт может измениться на порядок в зависимости от того, как вы работаете. У оплаты по факту нет потолка.
Хорошая новость: самые действенные меры сводятся к трём — кэширование промптов, выбор модели и бюджет вывода. Эффект каждой задаётся множителями, опубликованными в официальных прайс-листах, поэтому его можно посчитать для своей нагрузки. Статья опирается на официальную документацию Anthropic и OpenAI и показывает эти множители и порядок расчёта.
Экономию можно посчитать по официальным ценам
— по официальным прайс-листам Anthropic и OpenAI на 26 сентября 2026 года
Пример: отправьте в Opus 5.5 один и тот же префикс на 100 000 токенов десять раз с интервалом меньше 5 минут — и стоимость входа снизится с $4,00 без кэша до $0,68 с 5-минутным кэшем (одна запись за $0,50 и девять чтений за $0,18).
То, что может подождать, через пакетный API стоит вдвое дешевле и на входе, и на выходе, а множители кэша применяются поверх.
Источники: Claude Platform Docs, «Pricing» и OpenAI API Pricing (проверено 26 сентября 2026 года; расчёты редакции)
1. Почему счёт за ИИ незаметно раздувается
Инструменты ИИ имеют две схемы биллинга: персональные тарифы (фикс) и API-биллинг (по расходу). Взрывается счёт в основном по второй схеме.
- Персональные тарифы: ChatGPT Plus $20/мес, Claude Pro $20/мес ($17/мес при оплате за год), Max от $100/мес. Фиксированная стоимость, поэтому даже при интенсивном использовании есть потолок (с лимитами использования).
- API-биллинг: по токенам, по факту использования. Сюда относятся Claude Code по API-ключу и ИИ-приложения, которые вы разрабатываете сами. Сумма за месяц может сильно колебаться в зависимости от того, как вы работаете.
Счёт по факту раздувается потому, что (1) токены вывода стоят в 5 раз дороже входа, (2) чем длиннее контекст, тем больше вы пересылаете целиком в каждом запросе, (3) субагенты раз за разом вызываются за кулисами и (4) если что-то зацикливается, оно не останавливается — всё это накапливается. Стоит понять механику — и каждое исправимо.
2. Структура расходов — вход, выход, кэш, batch
На примере цен API Claude Opus (на сентябрь 2026 года — Opus 5.5; уровень ниже старшей модели Fable, который Anthropic советует как отправную точку) разберём, куда уходят деньги.
| Статья | Цена (за 1M токенов) | Описание |
|---|---|---|
| Токены входа | $4 | То, что вы отправляете: промпт + история диалога + файлы и т. д. |
| Токены вывода | $20 | То, что возвращает ИИ. В 5 раз дороже входа. |
| Запись в кэш (5 мин) | $5 (1,25× входа) | Сохранение префикса в кэше. Каждое чтение в течение 5 минут продлевает его без доплаты. |
| Запись в кэш (1 ч) | $8 (2× входа) | Переживает паузы дольше 5 минут, но запись дороже. |
| Чтение из кэша | $0,20 (0,05× входа) | 0,1× у большинства моделей, 0,05× у Opus 5.5. Главная звезда экономии. |
| Пакетная обработка | Вход $2, выход $10 (половина цены) | Асинхронная обработка запросов, которые могут подождать. Сочетается с множителями кэша. |
| Вызовы инструментов | Учитываются как вход | Определения инструментов — часть контекста. Если передан хотя бы один инструмент, добавляется ещё и системный промпт для инструментов (286 токенов у Opus 5.5). |
Короче говоря, префикс, который лежит в кэше, читается за десятую часть цены входа или дешевле. Множители записи (1,25× для 5 минут, 2× для часа) и соотношение «вывод в 5 раз дороже входа» одинаковы у всех текущих моделей Claude; различается только множитель чтения (у Fable 5.1 — 0,025×). Учтите также, что Claude Opus 4.7 и более новые модели используют новый токенизатор, который, по данным Anthropic, даёт примерно на 30% больше токенов для того же текста, — это важно при сравнении цен разных поколений. Источник: Claude Platform Docs, «Pricing» (проверено 26 сентября 2026 года).
3. Выбор тарифа и его влияние на экономию
В тот момент, когда вы можете предсказать, как будете пользоваться, сначала переключитесь на правильный тариф.
| Использование | Рекомендуемый тариф | Цель в месяц | Оговорки |
|---|---|---|---|
| Хобби, обучение, несколько раз в неделю | Claude Free / ChatGPT Free | $0 | Лимиты использования; не для рабочих данных. |
| Личное, несколько часов в день | Claude Pro / ChatGPT Plus | $20 | Персональный тариф; не для рабочих данных. |
| Интенсивное личное использование | Claude Max | От $100 | В 5 или 20 раз больше использования, чем в Pro; для тех, кто часами работает в Claude Code. |
| Командная работа | Claude Team / ChatGPT Business | Стандартное место Claude Team: $20 (при оплате за год) — $25/пользователь | Подходит для рабочих данных; данные не используются для обучения. |
| Крупная организация | Enterprise | По запросу | SSO, журналы аудита, SLA. |
| Разработка со встроенным ИИ | Прямой API (Anthropic / OpenAI) | По расходу | Используйте кэширование и batch. |
Источники: страница цен Claude и OpenAI Help, «What is ChatGPT Plus?» (проверено 26 сентября 2026 года).
Если вы каждый день подолгу работаете в Claude Code и регулярно упираетесь в лимиты Pro, присмотритесь к тарифу Max. Это фиксированная плата, поэтому счёт не может разогнаться, как при работе по API-ключу. Cursor начинается с индивидуального тарифа Pro за $20 в месяц, выше есть Pro+ и Ultra.
4. Кэширование промптов — самый выгодный рычаг
Если вы обращаетесь к API напрямую и раз за разом отправляете один и тот же префикс, причин отказываться от кэширования промптов почти нет. То, что читается из кэша, оплачивается по малой доле базовой цены входа.
Как это работает
Когда вы переиспользуете один и тот же системный промпт или одни и те же документы между запросами, первый вызов записывает их в кэш (1,25× входа для 5-минутного кэша). Каждый последующий вызов читает из кэша по 0,1× входа (у Opus 5.5 — 0,05×, у Fable 5.1 — 0,025×). Но слишком короткий префикс не кэшируется: минимум — 512 токенов у Opus 5.5, 1024 у Sonnet 5 и 4096 у Haiku 4.5 (Claude Platform Docs, «Prompt caching»).
Точка окупаемости — одно чтение для 5-минутного кэша, два для часового
Примем цену входа за 1 и сравним стоимость отправки одного и того же префикса (расчёт по официальным множителям Anthropic):
- 5-минутный кэш: запись 1,25 + одно чтение 0,1 = 1,35. Отправить дважды без кэша стоит 2, значит, окупается уже одно чтение.
- Часовой кэш: запись 2 + два чтения 0,2 = 2,2. Отправить трижды без кэша стоит 3, значит, окупаются два чтения (при одном чтении выходит 2,1 — чуть больше, чем 2 без кэша).
На странице цен Anthropic сказано то же самое: кэш окупается после одного чтения при 5-минутном сроке и после двух — при часовом. Opus 5.5 читает по 0,05×, так что при том же числе чтений разрыв ещё больше.
Пример — префикс на 100 000 токенов, отправленный 10 раз
| Модель | Без кэша | 5-минутный кэш | Разница |
|---|---|---|---|
| Claude Opus 5.5 (вход $4, запись $5, чтение $0,20) | 0,1 × $4 × 10 = $4,00 | 0,1 × $5 + 0,1 × $0,20 × 9 = $0,68 | Примерно на 83% меньше |
| Claude Sonnet 5 (вход $2, запись $2,50, чтение $0,20) | 0,1 × $2 × 10 = $2,00 | 0,1 × $2,50 + 0,1 × $0,20 × 9 = $0,43 | Примерно на 79% меньше |
Считается только вход префикса (системный промпт, справочные документы и т. п.); 100 000 токенов = 0,1 в единицах миллиона. Предполагается, что все десять запросов приходят с интервалом меньше 5 минут, первый записывает кэш, остальные девять его читают. Цены: Claude Platform Docs, «Pricing» (проверено 26 сентября 2026 года). Вывод и меняющаяся часть каждого запроса не учитываются.
Модели GPT-6 от OpenAI устроены похоже. Кэшированный вход стоит 0,1×, запись — 1,25×, и руководство OpenAI приводит тот же расчёт: записать префикс один раз и один раз переиспользовать стоит 1,35× против 2× при двукратной обработке без кэша. Кэш живёт 30 минут с последнего использования и у поддерживаемых моделей включён по умолчанию (OpenAI, «Prompt caching»).
Срок жизни по умолчанию — 5 минут
В API Anthropic срок жизни (TTL) кэша промптов по умолчанию — 5 минут. Каждое чтение продлевает его без доплаты, но после паузы дольше 5 минут кэш истекает, и следующий запрос записывает его заново (1,25× цены входа). Можно выбрать срок в 1 час, но тогда запись стоит 2× цены входа (источник: Claude Platform Docs, «Prompt caching»).
Claude Code работает на том же механизме. В пределах включённого в подписку Claude объёма основной диалог получает срок в 1 час, но при работе по API-ключу или после выхода за лимит тарифа на кредиты использования срок падает до 5 минут. Начиная с v2.1.242 можно самому выбрать 5m или 1h через настройку promptCacheTtl (источник: Claude Code Docs, «Prompt caching», проверено 26 сентября 2026 года). Если вы работаете с перерывами, от того, какой из двух сроков действует, зависит, как часто кэш будет перезаписываться.
Как выбрать между 5 минутами и часом
Ориентиры из официальной документации:
- Префикс используется чаще, чем раз в 5 минут: оставайтесь на 5-минутном кэше. Каждое чтение бесплатно его продлевает, и более дорогая часовая запись не нужна.
- Префикс используется с паузами от 5 минут до часа (ожидание ответа пользователя, вызов после задачи дольше 5 минут): подходит часовой кэш.
- Если сочетать оба: часовой кэш ставьте перед 5-минутным — тот же порядок, что и при размещении в начале неизменных системного промпта и определений инструментов.
Проверить, работает ли кэш, можно по полям cache_read_input_tokens (чтение) и cache_creation_input_tokens (запись) в usage ответа. Если чтение остаётся нулевым, префикс где-то меняется в каждом запросе или не дотягивает до минимального числа токенов.
5. Управление контекстом — /compact и разбиение
Поработайте с Claude Code или Cursor какое-то время, и где-то посреди длинного диалога вы обнаружите, что на каждом ходу заново отправляете большой объём прошлого диалога. Раздувается не вывод, а вход (= прошлый диалог).
Тактика 1: активно используйте /compact
В Claude Code есть команда /compact. Она подытоживает диалог на данный момент и освобождает контекст (Claude Code Docs, «Commands»); можно передать указание, что сохранить в сводке. Пользуйтесь ею на естественных паузах в работе.
Тактика 2: разбивайте сессии по задачам
Не делайте «реализовать функцию A», «исправить баг B» и «сгенерировать док C» в одном длинном диалоге — начинайте свежие сессии. Закрывайте сессию по завершении каждой задачи. Если нужна долгосрочная память, выпишите её в файл памяти.
Тактика 3: подрезайте шум через Hooks
Claude Agent SDK / Claude Code предоставляют Hooks — они позволяют преобразовать вывод инструментов до того, как тот дойдёт до ИИ. Пример: сжать длинный лог npm install до простого «успех/неудача» через Hook. Чем длиннее лог, тем легче становится вход на каждом ходу.
6. Выбор модели — маршрутизация по задачам
«Всегда Opus» — стратегия миллионера. С рутинной работой вроде классификации и извлечения часто справляются Sonnet или Haiku. Цена определяется уровнем модели (старший, средний, лёгкий); официальные цены на 26 сентября 2026 года (за миллион токенов) приведены ниже. От версии к версии соотношение — чем выше уровень, тем дороже, а лёгкая модель стоит лишь долю старшей — не менялось.
| Модель | Вход | Выход | Лучше всего для |
|---|---|---|---|
| Claude Opus 5.5 (старшая) | $4 | $20 | Сложный дизайн, рассуждения, длинные автономные задачи |
| Claude Sonnet 5 (средняя) | $2 | $10 | Ежедневный кодинг, анализ, суммирование |
| Claude Haiku 4.5 (лёгкая) | $1 | $5 | Классификация, извлечение, короткое преобразование, реальное время |
| GPT-6 Sol (сбалансированная модель OpenAI) | $2 | $10 | Сложный кодинг и агентная работа |
| GPT-6 Luna (недорогая модель OpenAI) | $0,10 | $0,50 | Узкие лёгкие задачи в большом объёме |
Источники: Claude Platform Docs, «Pricing» и OpenAI API Pricing (проверено 26 сентября 2026 года; у OpenAI — цены для короткого контекста). Выше них стоят Fable 5.1 от Anthropic ($10 / $50) и флагман OpenAI GPT-6 Astra ($10 / $50). Текущие модели всех компаний — в списке текущих моделей и дат среза знаний.
Переход со старшей Opus на лёгкую Haiku снижает цену за токен вчетверо (на сентябрь 2026 года). Для задачи классификации, которая тратит 2 млн токенов входа и 200 000 токенов выхода в день, официальные цены дают:
- Opus 5.5: 2 × $4 + 0,2 × $20 = $12
- Sonnet 5: 2 × $2 + 0,2 × $10 = $6
- Haiku 4.5: 2 × $1 + 0,2 × $5 = $3
- Haiku 4.5 пакетом: $3 × 0,5 = $1,50 (глава 8)
Хватит ли качества — зависит от задачи, поэтому перед переходом на более дешёвую модель сравните результаты на одном и том же входе (FAQ, Q4). Ориентиры:
- Используйте Opus для: сложного рефакторинга, дизайна, охватывающего множество файлов, глубоких рассуждений, исследования незнакомой области
- Используйте Sonnet для: ежедневного кодинга, анализа, суммирования, ревью, добавления тестов
- Используйте Haiku для: классификации, извлечения, преобразования формата, подсказок в реальном времени, генерации сообщений коммитов
7. Управление бюджетом вывода
Токены вывода стоят в 5 раз дороже входа — и у текущих моделей Claude, и у GPT-6 Astra, Sol и Luna. Ответ Opus 5.5 на 2000 токенов входа и 1000 токенов вывода стоит $0,008 + $0,020 = $0,028. Ограничьте вывод 500 токенами — и получится $0,018, примерно на 36% меньше (расчёт по официальным ценам).
Три подхода
- Подбирайте
max_tokensпод задачу: в Messages API Anthropicmax_tokens— обязательный параметр, и указанное число становится потолком вывода (справочник API, «Messages»). Не оставляйте большое значение по инерции; ставьте соответствующее задаче, напримерmax_tokens: 1000. - Добавляйте «отвечай кратко» или «пять пунктов» в промпт: ИИ слушается. Подавляйте лишние вступления, резюме и подписи.
- Структурированный вывод (режим JSON): JSON короче прозы. Если ваше приложение потребляет результат — это путь.
Для ситуаций, где «длинный красивый ответ» не нужен (классификация, извлечение, решения), жёсткое урезание оказывается экономнее.
8. Пакетная обработка — половина цены для того, что может подождать
Работа, которой не нужен немедленный ответ, — ночная массовая классификация, пакетное суммирование, прогоны оценки — через пакетный API стоит вдвое дешевле и на входе, и на выходе. Message Batches API от Anthropic принимает до 100 000 запросов в одном пакете; большинство завершается меньше чем за час, но пакет может выполняться до 24 часов (Claude Platform Docs, «Batch processing»). Batch API у OpenAI тоже даёт скидку 50%, срок выполнения — 24 часа (OpenAI, «Batch API»).
Согласно странице цен Anthropic, множители кэша сочетаются со скидкой за пакетную обработку. Например, чтение из кэша у Haiku 4.5 внутри пакета обходится в $1 × 0,1 × 0,5 = $0,05 за миллион токенов.
9. Ловушка мультиагентов — 15-кратные токены
Тренд 2026 года, мультиагентные сборки (оркестратор + параллельные субагенты), мощный, но Anthropic опубликовала данные своей функции Research: агенты тратят примерно в 4 раза больше токенов, чем обычный чат, а мультиагентные системы — примерно в 15 раз больше (Anthropic, «How we built our multi-agent research system», июнь 2025). 15 раз — это сравнение с чатом, а не с одним агентом.
Критерии решения для экономии
- Ясные, последовательные задачи (правка одного файла, суммирование, ревью кода) → достаточно одного агента
- Параллелизм, реально сокращающий время выполнения → мультиагент оправдан
- «Мультиагент по умолчанию» — экономически неверно. Начните с одного агента и разделяйте только те узкие места, которые реально видите.
Подробнее: см. Что такое мультиагент?
10. Мониторинг и оповещения о биллинге
Чтобы счёт по факту не застал вас врасплох, регулярный мониторинг + оповещения необходимы.
Пользователи API
- Проверяйте ежедневное потребление токенов в Claude Console / OpenAI Dashboard
- Установите лимит расхода: например, остановка при превышении $200/мес. Без лимита — опасно.
- Оповещения о биллинге: email при $50, Slack при $100 — пороги по этапам.
Пользователи Claude Code
- Через
/usageпроверяйте стоимость текущей сессии и расход по тарифу (/costтеперь — псевдоним/usage) - Сделайте привычкой проверку
/usageв конце дня
Администраторы организаций
- Отчёты по потреблению на пользователя (админ-консоль Anthropic Team / Enterprise)
- Обнаружение аномалий (помечать тех, кто тратит заметно больше обычного)
- Ежеквартальное распространение «шаблонов расточительства» на всю компанию
11. Семь типичных шаблонов расточительства
| Шаблон | Что не так | Исправление |
|---|---|---|
| Прикреплять все файлы заново на каждом ходу | Кэш не срабатывает; вход раздувается | Поместите неизменяемые документы в префикс и закэшируйте |
| Задавать один и тот же вопрос и в ChatGPT, и в Claude | Платите дважды за один и тот же вход на разных тарифах | Выберите один |
Продолжать длинный диалог без /compact | Полная история шлётся каждый ход | /compact на естественных паузах |
| Использовать Opus для простой классификации или извлечения | Платите вчетверо больше, чем стоил бы Haiku, за тот же результат | Подбирайте модель под задачу |
| Повторять «более отполированно» / «чуть длиннее» | Токены вывода накапливаются | Заявите желаемую длину сразу |
| Определять много ненужных инструментов | Определения инструментов едут в контексте | Определяйте только то, чем пользуетесь |
| Тянуться к мультиагенту по привычке | Примерно в 15 раз больше токенов, чем у чата (у одного агента — примерно в 4 раза) | Только при ясной необходимости |
Итоги
- Три рычага оптимизации стоимости ИИ: кэширование промптов, выбор модели, бюджет вывода. Эффект каждого задают официальные множители, и эти множители перемножаются.
- Чтение из кэша = 0,1× входа (0,05× у Opus 5.5). 5-минутный кэш окупается после одного чтения, часовой — после двух. Префикс на 100 000 токенов, отправленный в Opus 5.5 десять раз, дешевеет с $4,00 до $0,68.
- Выбор модели: от Opus 5.5 к Haiku 4.5 цена за токен падает вчетверо, к Sonnet 5 — вдвое (на сентябрь 2026 года).
- Бюджет вывода: вывод в 5 раз дороже входа. Явно задавайте
max_tokensи просите «кратко». - Пакетная обработка: то, что может подождать, вдвое дешевле на входе и выходе и сочетается со скидкой кэша.
- Управление контекстом:
/compactна естественных паузах, разбивайте по задачам, сжимайте вывод через Hooks. - Ловушка мультиагентов: примерно в 15 раз больше токенов, чем у чата. Используйте только при ясной необходимости.
- Мониторинг: лимиты расхода, оповещения о биллинге и проверка
/usageдолжны стать привычкой.
FAQ
Q1. Я пользуюсь Claude Code ежедневно — что выгоднее, Pro за $20 или Max?
Если вы регулярно упираетесь в лимиты Pro, присмотритесь к Max. Справочный центр Anthropic советует пользователям Pro, которые постоянно упираются в лимиты и которым нужно больше ресурсов для крупных репозиториев, рассмотреть переход на Max 5x (Claude Help Center, «Using Claude Code with your Pro or Max plan»). Если в лимиты не упираетесь, оставайтесь на Pro.
Q2. Нужна ли особая настройка для использования кэширования промптов?
В API Anthropic нужно указать cache_control — один раз на верхнем уровне запроса (автоматическое кэширование) или на отдельных блоках (явные точки разбиения). У OpenAI кэширование для поддерживаемых моделей включено по умолчанию. Claude Code использует кэш автоматически. Подробнее — в официальной документации Anthropic.
Q3. ChatGPT vs. Claude — что экономичнее?
Зависит от сценария. Только по цене за единицу средняя Claude Sonnet 5 и GPT-6 Sol равны: $2 на входе и $10 на выходе. Для коротких Q&A и рутинных задач в большом объёме недорогая модель OpenAI (на сентябрь 2026 года — GPT-6 Luna, $0,10 на входе) в десять раз дешевле Haiku 4.5 ($1 на входе). В длинных задачах, где один и тот же префикс отправляется снова и снова, важны чтения из кэша, и тогда в расчёт входит и Opus 5.5 (0,05×). «Подписаться на оба и подбирать инструмент под задачу» — тоже практичный вариант.
Q4. Как понять, что «Haiku достаточно»?
Проведите трёхступенчатый эксперимент. (1) Заставьте работать на Opus. (2) Отправьте тот же промпт в Sonnet и сравните качество. (3) Если Sonnet выглядит сопоставимо, попробуйте и Haiku. Чем рутиннее задача, тем меньше обычно разница. Берегите Opus для случаев, где действительно нужны глубокое суждение или рассуждение.
Q5. Стоит ли частному пользователю обращаться к API напрямую?
По обстоятельствам. Если вы в основном программируете в интерактивном режиме, тариф Max держит счёт фиксированным и удобнее. Для встраивания ИИ в собственное приложение, пакетной обработки или автоматизации нужен прямой API. Многие используют и то, и другое.
Q6. Какой порог поставить на оповещения о биллинге?
Единственно верного ответа нет, но один из вариантов ступеней — первое оповещение на 1,5× от обычного месячного расхода и остановка на 3×. Если обычно тратите $30/мес, оповещение на $50 и стоп на $100. На первых порах ставьте небольшие ежедневные оповещения, чтобы почувствовать свой расход, а затем ослабьте.
Q7. Нам сказали: «бюджет компании на ИИ слишком вырос». С чего начать?
Три шага по порядку. (1) Посмотрите на использование по пользователям и найдите, где концентрируется потребление. (2) Поговорите с самыми активными пользователями о рабочем процессе и выявите шаблоны расточительства. (3) Разошлите по компании внутреннее руководство по «кэшированию, выбору модели, бюджету вывода» и ежемесячно отчитывайтесь о прогрессе.
Исправления к прежней версии
26 сентября 2026 года мы исправили следующее.
| Прежняя версия | Сейчас |
|---|---|
| Три рычага сжимают расходы до 20–30% от неоптимизированной стоимости (заголовок, вступление, изображение) | Удалено: источник указать нельзя. Заменено примерами, рассчитанными по официальным ценам и множителям. |
| −60–90% за счёт кэша, −50–80% за счёт выбора модели, −30–60% за счёт бюджета вывода, $30K/мес снижается до $6–9K | То же. Заменено расчётами вроде «префикс на 100 000 токенов, отправленный десять раз: $4,00 → $0,68». |
| Восемь из десяти задач справляются на более дешёвой модели | Удалено; нет источника. |
| 5-минутный кэш окупается с двух чтений | Окупается с одного чтения (запись 1,25 + чтение 0,1 = 1,35 < 2). |
| Часовой кэш окупается с пяти чтений | Окупается с двух чтений (2 + 0,2 = 2,2 < 3). |
| Токены вывода стоят в 5–6 раз дороже входа | В 5 раз (у всех текущих моделей Claude и всех трёх моделей GPT-6). |
| Hit-rate кэша ниже 60% — есть куда оптимизировать; на продакшене целиться в 80%+ | Удалено; нет источника. Заменено проверкой токенов чтения и записи в usage. |
/compact ужимает 200k токенов до 5 000 | Цифры удалены; нет источника. |