Содержание
- 1. Поддержка 1M стала нормой — но «дочитать до конца» — это другое
- 2. Что такое контекст? — Отделяем контейнер от его содержимого
- 3. Размер контейнера читается по трём числам
- 4. Три причины, почему «больше — значит лучше» не работает
- 5. Ловушка стоимости — модели, у которых цена растёт на длинных входах, и модели, у которых нет
- 6. Пять тактик экономии — ранжированы по реальной отдаче для соло-разработчиков
- Итоги
- FAQ
В 2023 году контекстное окно в 32K токенов казалось «просторным». Сегодня окно класса 1 миллиона токенов (1M) для топовых моделей подразумевается само собой. По состоянию на сентябрь 2026 года Anthropic, OpenAI и Google указывают в официальных спецификациях своих старших моделей лимит входа около миллиона токенов. Конкретные названия моделей и цифры меняются с каждым релизом, поэтому я оставляю их списку актуальных моделей и дат отсечения знаний и официальным страницам вендоров. Эта статья о том, что переживает смену поколений: как читать цифры и как с ними работать.
«Один миллион токенов» — это примерно 8–10 книг карманного формата на английском или десятки тысяч строк исходного кода. Теперь столько информации можно держать «в поле зрения» в рамках одной сессии. Но то, что документ помещается в контейнер, ещё не значит, что модель его прочитает целиком. Результаты, которые OpenAI публикует по своему multi-needle-бенчмарку длинного контекста (MRCR), показывают: одна и та же модель набирает меньше по мере роста входа, а величина падения сильно зависит от модели и поколения (подробнее в §1 и §4).
Сразу скажу своё мнение: эпоха выбора модели только по размеру контейнера закончилась. Важна тройка «эффективный контекст × стоимость × способ подачи». В статье разберём, что такое контекст на самом деле, как читать спецификации, почему размера недостаточно, как измерить эффективный диапазон для своей задачи, как растёт цена на длинных входах, и пять тактик экономии, которые соло-разработчики и небольшие команды могут применить уже сегодня, — на официальных цифрах и данных опубликованных бенчмарков.
За три года контейнер вырос в 250 раз
— Хронология: как 1M из роскоши превратился в норму
Но «поддерживает» и «дочитывает до конца» — разные вещи. В бенчмарке длинного контекста MRCR (8 «иголок») от OpenAI GPT-5.5 опускается с 98,1% на 4K–8K до 74,0% на 512K–1M.
Насколько сильно падает результат, зависит от модели и поколения (таблица оценок в «Introducing GPT-5.5» от OpenAI, 23 апреля 2026 года; подробнее в §1 и §4).
1. Поддержка 1M стала нормой — но «дочитать до конца» — это другое
Поддержка 1M быстро распространилась за последние два года. В апреле 2025 года вышла GPT-4.1 от OpenAI с окном около 1,05 млн токенов, в августе 2025 года Claude Sonnet 4 от Anthropic получил 1 млн (в бета-режиме), а по состоянию на сентябрь 2026 года старшие модели Anthropic, OpenAI и Google указывают около миллиона токенов в официальных спецификациях. В 2023 году 32K казались просторными — это рост более чем в 30 раз всего за три года. Гонка за размер контейнера выглядела завершённой.
Но если посмотреть на результаты по длинному контексту, которые публикуют сами разработчики, картина усложняется. Полный набор результатов по длине есть у MRCR v2 (8 «иголок») от OpenAI. В длинный диалог с ИИ прячут восемь однотипных просьб — например, «напиши стихотворение о тапирах», — а затем просят точно вернуть одну из них, скажем «верни 2-е стихотворение». Модели нужно различать почти одинаковые фрагменты вплоть до их порядка, так что это multi-needle-вариант needle-in-a-haystack. Оценка — насколько возвращённый текст совпадает с правильным. Вот результаты по длине:
- GPT-5.5: 98,1% на 4K–8K, 87,5% на 128K–256K, 74,0% на 512K–1M
- GPT-5.4 (предыдущее поколение в той же таблице): 97,3% → 79,3% → 36,6% в тех же трёх диапазонах
- Claude Opus 4.7 (значения, которые OpenAI привела в той же таблице): 59,2% на 128K–256K, 32,2% на 512K–1M
- GPT-6 Astra (анонсирована в сентябре 2026 года): 100,0% на 256K–512K, 96,3% на 512K–1M (GPT-5.6 Sol в той же таблице: 91,5% и 73,8%)
Источники (проверено 26 сентября 2026 года): таблицы оценок в публикациях OpenAI «Introducing GPT-5.5» (23 апреля 2026 года) и «GPT-6 Astra» (3 сентября 2026 года). Как устроен бенчмарк: описание датасета OpenAI MRCR. Названия моделей — на момент каждого анонса.
Бросаются в глаза две вещи. Во-первых, одна и та же модель набирает меньше по мере роста входа. Во-вторых, крутизна падения сильно различается у разных моделей и поколений: в диапазоне, ближайшем к 1M, GPT-5.4 опустилась ниже 40%, а GPT-6 Astra, анонсированная в сентябре 2026 года, удержалась выше 90%. Рейтинг меняется с каждым поколением, так что сами числа быстро устаревают. Остаётся урок: заявленный лимит и диапазон, в котором точность действительно сохраняется, — это два разных числа.
Не поймите неправильно. Речь не о том, что «Claude или GPT плохи». Задач, которым действительно нужен весь 1M, меньше, чем кажется. Если модель стабильно читает до 300K (примерно 2–3 книги), в этот объём укладывается почти любая задача по программированию, исследованию или суммаризации. Проблема в выборе только по цифре «поддерживает 1M» — так легко ошибиться с критериями.
2. Что такое контекст? — Отделяем контейнер от его содержимого
Краткая терминология. Три слова в этой области часто путают.
Токен, окно, контекст
Коротко: «окно = размер контейнера», «контекст = содержимое», «токен = единица».
Большой контейнер с беспорядочным содержимым по-прежнему даёт беспорядочные ответы.
И ещё: не путайте «контекст» с «памятью». Контекст живёт внутри сессии — закройте чат, и его нет. Функции вроде ChatGPT Memory или Claude Memory — это отдельный механизм межсессионного хранения. Содержимое памяти в итоге всё равно подгружается в окно контекста, но с точки зрения пользователя это постоянное хранилище против эфемерного рабочего пространства.
3. Размер контейнера читается по трём числам
Глядя на спецификацию модели, в части контекста нужно проверить всего три вещи. Разобравшись в них, вы сможете сравнивать любые модели по одной и той же схеме.
Самое заметное число в каталоге. Но это «сколько влезет», а не «сколько будет прочитано»: как показано в следующей главе, фактический объём заметно меньше.
Его часто упускают из виду, но он на порядок меньше лимита входа. Даже у основных моделей на сентябрь 2026 года можно подать 1 млн токенов, а получить обратно лишь около 65K–128K. В задачах вроде «перепиши весь этот длинный документ» упираешься сначала именно в него.
Плоская по всему окну — или с порогом, за которым цена за токен подскакивает. В эксплуатации это влияет сильнее всего, а в спецификациях чаще всего не указано. Расчёт — в §5.
Ниже — значения с официальных страниц вендоров на 29 сентября 2026 года. С каждым поколением цифры меняются, поэтому читайте это как пример того, как три оси выше превращаются в реальные различия. Актуальные названия моделей смотрите в списке актуальных моделей и дат отсечения знаний, а цифры — на официальных страницах вендоров.
| Семейство (примеры на сентябрь 2026) | Лимит входа | Лимит выхода | Цена длинных входов |
|---|---|---|---|
| Anthropic, старшие (Claude Fable 5.1, Opus 5.5, Sonnet 5.5) | 1 000 000 | 128 000 | Одна цена до самого лимита |
| Anthropic, лёгкая (Claude Haiku 4.5) | 200 000 | 64 000 | — |
| OpenAI (GPT-6 Astra, Sol) | 1 050 000 | 128 000 | При входе свыше 272K весь запрос — по 2x за вход и 1,5x за выход |
| Google (Gemini 3.1 Pro, preview) | 1 048 576 | 65 536 | Свыше 200K: вход $2→$4, выход $12→$18 |
Источники (проверено 29 сентября 2026 года): Anthropic Models overview и Pricing / страницы моделей OpenAI GPT-6 Astra и GPT-6 Sol / Google Gemini 3.1 Pro Preview и Gemini API pricing
По таблице видно, что лимиты входа у всех вендоров почти одинаковы; различаются лимиты выхода и форма тарификации. Если лимиты равны, размер окна перестаёт быть причиной выбора. Реальная разница в другом: Anthropic держит одну цену до самого лимита, а OpenAI и Google повышают её после определённой длины. Под одной и той же вывеской «поддержка 1M» свобода отправлять длинные входы разная. Это не просто деталь прайса — это разные подходы к нагрузкам с длинным контекстом. В главе о стоимости всё посчитаем.
На практике выбор выглядит так. Ориентируйтесь на размер документов, с которыми работаете постоянно. Если они укладываются примерно в 200K, выбирайте по стабильности точности в этом диапазоне и по тому, остаётесь ли вы ниже ценового порога, а не по размеру окна. Только если вы постоянно работаете с огромными документами больше 300K, решающими становятся ширина эффективного диапазона и цена длинных входов. Не ставьте на одну модель — распределяйте по задачам. Такой способ решать работает при любом актуальном поколении.
Где проверять лимиты
Проверяйте цифры на официальных страницах вендоров, а не на сайтах-сводках и не в таблицах статей (включая эту). Где смотреть — довольно предсказуемо:
- Anthropic: в сравнительной таблице на странице обзора моделей есть строки «Context window» и «Max output». Цена длинных входов — в разделе «Long context pricing» на странице цен
- OpenAI: на странице каждой модели в документации API указаны «context window» и «max output tokens», а также примечание о цене длинных промптов
- Google: на странице модели в Gemini API указаны «Input token limit» и «Output token limit», а на странице цен есть уровень «prompts > 200k tokens»
Ещё один момент, который легко упустить: в один и тот же лимит у разных моделей помещается разный объём текста. Лимиты считаются в токенах, поэтому при смене токенизатора (схемы, по которой текст делится на токены) меняется и число токенов в том же документе (см. примечание в §5). Перейдя на другую модель, пересчитайте на своих документах, чтобы убедиться, что запас остаётся.
4. Три причины, почему «больше — значит лучше» не работает
Таблица в прошлой главе показывает лишь физический размер контейнера. Но использует ли модель заявленный контейнер на самом деле? Коротко: не рассчитывайте, что она читает с одинаковой точностью до самого лимита. Причин три.
Причина ①: Lost in the Middle
Это явление в 2023 году описали исследователи из Стэнфорда и других организаций (Liu и соавторы) в статье «Lost in the Middle». В задачах вроде поиска ответа среди нескольких документов модели лучше всего отвечали, когда ответ находился в начале или в конце входа, и заметно теряли точность, когда он был в середине — та же картина наблюдалась и у моделей, рассчитанных на длинный контекст.
На практике это выглядит так: «Вставляете длинный PDF целиком, спрашиваете „Какая цифра по X?“ — и модель путает число ровно из середины документа». Это и есть Lost in the Middle. Насколько сильно это проявляется, зависит от модели, но безопаснее исходить из того, что информация в середине документа теряется легче, и продумывать подачу с учётом этого.
Причина ②: Context Rot
Чем дольше идёт разговор, тем сильнее размываются первоначальные инструкции. В начале вы попросили отвечать официально, а через 20 обменов модель снова перешла на разговорный тон — это и есть Context Rot.
Причин две. ① Ранние инструкции в истории диалога начинают восприниматься как относительно старые и менее важные. ② Длинная история рассеивает внимание, и на конкретные токены становится труднее опереться. В своей документации для разработчиков Anthropic называет снижение точности и полноты извлечения по мере роста числа токенов «context rot» и пишет, что выбор того, что попадает в контекст, так же важен, как и объём, который туда помещается. В сентябре 2025 года компания описала работу с этой проблемой как осознанный навык в технической статье под названием «Effective context engineering for AI agents».
Причина ③: Заявленный контекст ≠ эффективный контекст
Если взять из значений §1 только диапазон, ближайший к 1M (512K–1M), получится вот что. Все значения — из таблиц оценок в анонсах OpenAI, бенчмарк один и тот же: OpenAI MRCR v2 (8 «иголок»).
Возвращает ли модель ровно тот фрагмент, который просили, около 1M?
Источники: таблицы оценок в публикациях OpenAI «Introducing GPT-5.5» (23 апреля 2026 года; GPT-5.5, GPT-5.4, Claude Opus 4.7) и «GPT-6 Astra» (3 сентября 2026 года; GPT-6 Astra, GPT-5.6 Sol). Названия моделей — на момент каждого анонса.
В коротком диапазоне той же таблицы (4K–8K) GPT-5.5 набрала 98,1%, GPT-5.4 — 97,3%. Все значения OpenAI опубликовала в собственных анонсах; это не сторонние измерения.
Это не значит, что «модели с низким результатом плохи». В коротком диапазоне той же таблицы и GPT-5.5, и GPT-5.4 набирают больше 97%, а большая часть реальной работы — ревью кода, длинные тексты, резюме протоколов, сведение результатов исследований — завершается задолго до 1M. Проблема в подходе «раз есть 1M, закину 1M». Помните и о том, что это значения, которые OpenAI опубликовала в собственных анонсах, и сравнивать их можно только внутри одной таблицы. Google тоже приводит результаты MRCR v2 (8 «иголок») в карточке модели Gemini 3.1 Pro (февраль 2026 года) — 84,9% на 128K (в среднем) против 26,3% на 1M, — но делит длины иначе, поэтому среди столбцов выше их нет. На страницах анонсов Anthropic для Claude Opus 5.5 и других текущих моделей таких результатов по длине нет. Чтобы понять, на что способна модель, которой вы пользуетесь сегодня, проверьте её на своей задаче по методу ниже.
Измерьте «эффективный диапазон» для своей задачи
Цифры бенчмарков получены на других типах документов и других формулировках вопросов, чем у вас. Надёжнее всего — собрать небольшой needle-in-a-haystack на своих документах.
- Возьмите документ того типа, с которым реально работаете (код, протоколы, договоры и т. п.), и разместите 3–5 фактов с однозначным ответом в начале, в середине и в конце (подойдут и факты, которые уже есть в документе)
- Попросите «перечислить все и указать, где каждый встречается», чтобы модели пришлось извлекать несколько фактов одновременно. Вопрос об одном факте делает модель лучше, чем она есть (разница между одной «иголкой» и несколькими)
- Повторите тот же вопрос на разных длинах — например, 50K, 200K и 500K — и запишите длину, на которой ответы начинают сыпаться
- Добавьте вопросы, объединяющие факты, а не только извлекающие их («сравни A и B»). Вопросы, требующие синтеза, обычно ломаются раньше
Чуть ниже длины, где начинаются ошибки, и лежит «эффективный контекст» этой модели для этой задачи. При смене модели измерьте заново. Это занимает несколько десятков минут и помогает в реальных решениях лучше любой цифры из спецификации.
5. Ловушка стоимости — модели, у которых цена растёт на длинных входах, и модели, у которых нет
В прошлой главе мы увидели, что эффективный диапазон ниже лимита. Сверху накладывается вторая ловушка: длинный вход может резко поднять цену. Вендоры устроили это по-разному.
| Модель (на сентябрь 2026) | Стандартная цена (вход / выход, за 1M токенов) | Длинные входы |
|---|---|---|
| Claude Opus 5.5 | $4 / $20 | Одна цена на весь 1M |
| GPT-6 Sol | $2 / $10 | При входе свыше 272K весь запрос — по 2x за вход и 1,5x за выход |
| GPT-6 Astra | $10 / $50 | То же |
| Gemini 3.1 Pro (preview) | $2 / $12 | Свыше 200K: вход $4, выход $18 |
Посчитаем на примере. Допустим, вы отправляете документ на 500K токенов и получаете один ответ на 50K — типичный сценарий «разом суммировать большую кодовую базу или годовой отчёт».
- Claude Opus 5.5 (единая цена): $4.00 × 0.5 + $20.00 × 0.05 = $3.00
- GPT-6 Sol (надбавка свыше 272K): $4.00 × 0.5 + $15.00 × 0.05 = $2.75 (без надбавки — $1.50)
- Gemini 3.1 Pro (цена свыше 200K): $4.00 × 0.5 + $18.00 × 0.05 = $2.90 (по цене до 200K — $1.60)
- GPT-6 Astra (надбавка свыше 272K): $20.00 × 0.5 + $75.00 × 0.05 = $13.75
Выводов два. Первый: как только порог пройден, та же модель стоит примерно в 1,8 раза дороже. На коротких входах GPT-6 Sol вдвое дешевле Claude Opus 5.5, но на 500K разница почти исчезает — какая модель «дешевле», зависит от длины входа. Второй: когда надбавка ложится на и без того дорогую флагманскую модель, стоимость переходит в другой масштаб (GPT-6 Astra выходит более чем в 4 раза дороже Opus 5.5). Прежде чем выбирать, пересчитайте для моделей, которые сравниваете, и для своей типичной длины входа.
При пороговой тарификации делите то, что можно разделить, так, чтобы каждая часть оставалась ниже порога. Если отправить 500K двумя запросами по 250K, GPT-6 Sol не берёт надбавку — итого $1.50 (правда, для задач, где нужно видеть всё сразу, это не подходит). Это та же логика, что и в статье об экономии токенов и расходов на сессии ИИ.
6. Пять тактик экономии — ранжированы по реальной отдаче для соло-разработчиков
«Контейнер — 1M, эффективный диапазон заканчивается заметно раньше, и долгое использование стоит дорого». Мы это разобрали. Что же реально можно сделать в поле? Вот пять тактик, которые я применяю изо дня в день, ранжированные по тому, какая даёт наибольшую отдачу.
Экономия контекста — порядок приоритетов
/compact или начинайте новую сессию.
Из пяти тактик тактика ① «Прервать сессию» даёт самый заметный прирост. Уже одно прерывание чата ощутимо снижает галлюцинации.
Тактика ④ — для разработчиков API: UI (claude.ai / ChatGPT) обрабатывают кэширование автоматически.
Моя личная лучшая практика: уже одно последовательное применение ① и ② заметно сдвигает ощущаемую точность. Даже с Claude Code, вместо того чтобы тянуть одну длинную сессию, нажимать /compact или начинать свежую сессию при каждой смене темы — это удерживает итоговое качество вывода стабильным.
Итоги
Главное из этой статьи:
- Контекстное окно = максимальное число токенов, которое ИИ может обработать за один обмен. Размер контейнера
- По состоянию на сентябрь 2026 года старшие модели Anthropic, OpenAI и Google — все в классе 1M токенов. Лимиты входа почти не различаются; разница — в лимитах выхода и цене длинных входов
- Заявленный лимит и эффективный диапазон — разные вещи. В опубликованном OpenAI multi-needle-бенчмарке MRCR (8 «иголок») одна и та же модель набирает меньше по мере роста входа, а около 1M результаты разошлись от 32,2% у Claude Opus 4.7 (в таблице OpenAI) до 96,3% у GPT-6 Astra
- Надёжнее всего найти эффективный диапазон, разместив факты в своих документах и проверив на разных длинах. При смене модели измеряйте заново
- Цена длинных входов бывает двух видов: одна цена до лимита (Anthropic) или надбавка после порога (272K у OpenAI, 200K у Google). Какая модель дешевле, зависит от длины входа
- Экономия сводится к пяти приёмам: обрывать сессии, отправлять выдержки, повторять инструкции в конце, кэшировать и явно указывать адреса — ① и ② дают больше всего
Контейнер вырос, но по сути мы по-прежнему занимаемся отбором: что передать, а что оставить за бортом. Ключевой навык работы с ИИ — уже не «умение запихнуть всё». Это умение точно и правильно передать только нужное — навык, который остаётся полезным, сколько бы поколений моделей ни сменилось. Таков мой вывод теперь, когда 1M стал нормой.
FAQ
У OpenAI есть библиотека tiktoken, а в API Anthropic есть функция подсчёта токенов (token counting). Ориентиры: 1 японский символ ≈ 1–1,5 токена, 1 английское слово ≈ 1,3–1,8 токена, но это меняется с поколением токенизатора (см. примечание в §5). Код тоже сильно зависит от вида, поэтому перед отправкой длинного входа надёжнее измерить.
Контекст живёт только внутри сессии — закрыли чат, и его нет. Память (ChatGPT Memory / Claude Memory) — это отдельный механизм межсессионного хранения. Содержимое памяти в итоге попадает в окно контекста, но с точки зрения пользователя это постоянное против эфемерного.
RAG — это паттерн «динамически подгружать в контекст только нужную информацию». Даже с окном в 1M сваливать туда всё подряд — медленно, тяжеловесно и дорого, поэтому подход «сначала найти, потом загрузить» (RAG) остаётся мейнстримом. Подробнее в «Что такое RAG».
Складывается несколько факторов: несоответствие между длинами последовательностей, преобладавшими при обучении, и теми, что используются при инференсе, ограничения позиционного кодирования в механизме внимания и резкий рост вычислений, нужных для объединения нескольких фрагментов информации. «Поддерживает» и «точна по всему окну» — разные задачи. Где начинается спад, зависит от модели и задачи, поэтому надёжнее измерить на своих документах по методу из §4.
Да. MCP — это механизм подгрузки по требованию через инструменты, поэтому не нужно загружать всё в контекст заранее. Смените ментальную модель с «вставить файл целиком» на «дать ему сходить и прочитать файл».
Решайте по цели. ① Если нужно резюме всего документа, сначала суммируйте каждую главу, а затем объедините эти резюме вторым проходом. ② Если ищете конкретный ответ, не отправляйте весь текст — извлеките поиском только нужные фрагменты (RAG). ③ Только когда нужно сравнивать по всему документу, имеет смысл отправить его целиком — в длине, которая укладывается в эффективный диапазон. При разбиении режьте по заголовкам и оставляйте перекрытие в несколько абзацев с каждой стороны, чтобы нить не рвалась на стыках.