Содержание
- 1. LLM просто без конца угадывает следующее слово
- 2. Что такое веса? Триллион ручек рождает интеллект
- 3. Два этапа обучения — предобучение и постобучение (RLHF)
- 4. Инференс — момент, когда ваш вопрос превращается в электричество
- 5. Энергия — сколько электричества съедает LLM?
- 6. Правда ли, что разработка — это битва кошельков?
- 7. Но одними деньгами не выиграть — обратная волна эффективности
- 8. Что дальше — стена энергии и физики после денег
- Итоги
- FAQ
Объём вычислений, вложенный в обучение GPT-4, вышедшего в 2023 году, по оценке исследовательской организации Epoch AI составил примерно 2,1×10²⁵ операций с плавающей точкой (FLOP), а стоимость этих вычислений Stanford HAI оценил примерно в 78 млн долларов. Даже обучение более старой GPT-3 потребовало около 1 287 МВт·ч электроэнергии (оценка исследователей Google 2021 года) — больше, чем среднее домохозяйство потребляет за сто лет, ради одной-единственной модели. За будничным «слушай, сократи это» стоит мир физики и пачек денег.
Эта статья глубоко разбирает как на самом деле работает LLM (большая языковая модель) с трёх сторон: механизм, энергия и деньги. Конкретно — (1) почему LLM способна порождать язык из набора ручек, которые называют веса (параметры), (2) сколько электричества потребляет один вопрос или один прогон обучения, и (3) правда ли утверждение, что разработка передовых LLM — это битва кошельков? Краткий ответ на третий вопрос: для самого передового края это по сути правда, но в 2026 году усилилось встречное течение, где одними деньгами не выиграть. Вот точная картина.
Сразу обозначу свою позицию: интеллект LLM — это не магия и не сознание, это результат того, что гигантскую машину вероятностного предсказания отковали в нужную форму при помощи электричества. Понимание механизма растворяет и излишний ажиотаж, и излишний страх. Эта статья идёт на уровень средней сложности. Если вы начинаете с а что вообще такое LLM, сначала прочитайте что такое LLM (вводный курс); о длине контекста смотрите контекстное окно; о ценах — AI API для начинающих.
Разбираем LLM с трёх сторон
— Из чего сделан интеллект, сколько энергии он жжёт, во что обходится
Сообразительность LLM — не магия. Это результат того, что гигантскую вероятностную машину отковали в форму при помощи энергии и денег.
Узнайте механизм — и ажиотаж, и страх растворятся.
1. LLM просто без конца угадывает следующее слово
Это может прозвучать неожиданно, но ChatGPT, Claude и Gemini по сути делают одно и то же. По имеющемуся тексту вычислить вероятность наиболее вероятного следующего слова (точнее, токена) как продолжения, выбрать одно и выстроить их в ряд. Вот и всё. Подайте кот сидит на ___, и модель присвоит вероятности кандидатам вроде коврик, диван, пол и выдаст самый вероятный (или выбранный по вероятности). Она повторяет это по одному токену за раз, пока текст не закончится.
Вот вопрос, на котором спотыкаются многие. Как простая игра в угадывание слов может реферировать статьи или писать код? Ответ: чтобы по-настоящему точно угадать следующее слово, у модели нет иного выбора, кроме как до некоторой степени понимать устройство мира. Угадать столица Японии — это ___ требует географии; 3 + 5 = ___ требует арифметики; причина этого бага — это ___ требует знаний программирования, хранящихся внутри. Как побочный продукт доведённого до предела обучения угадыванию следующего слова на огромных объёмах текста возникают знания и рассуждение. В этом странная и сущностная природа LLM.
Так что же вычисляет эту вероятность следующего слова? Как и было намёком сказано, главный герой — ошеломляющая гора чисел под названием веса (параметры). Следующая глава раскроет, что это такое.
2. Что такое веса? Триллион ручек рождает интеллект
Если описать внутренности LLM одной аналогией: гигантское вычислительное устройство с сотнями миллиардов и более чем триллионом ручек. Каждая ручка — это вес (параметр), и когда сигнал входного слова передаётся на следующий слой, она решает, какие сигналы усилить или ослабить и насколько. У GPT-3 их было около 175 миллиардов; новейшие передовые модели, как говорят, превышают триллион. Настройка этих громадных ручек — это ровно то, что и есть выученные знания модели.
Как веса превращаются в язык
Обучение — это работа по чуть-чуть поворачивать эти триллион ручек в сторону правильного ответа.
Готовая настройка ручек (веса) = и есть сами знания модели.
Transformer, появившийся в 2017 году, — это фундамент современных LLM. Его сердце — механизм Attention (внимание), который динамически решает с помощью весов, какое слово в предложении важно для текущего слова. Означает ли bank в увидел реку перед банком финансовое учреждение или берег реки — решается взвешиванием его связи с другими словами контекста, и это контекстно-зависимое взвешивание — ровно то, почему LLM способна давать связные ответы даже на длинных отрывках. Когда говорят что-то там про взвешивание, имеют в виду именно этот Attention и триллионы умножений за ним.
Ключевой момент: эти веса не задавались вручную. Поначалу это бесформенная масса случайных чисел, лишённая смысла. Смысл вкладывается через обучение. Так как же происходит это обучение?
3. Два этапа обучения — предобучение и постобучение (RLHF)
Обучение LLM в широком смысле делится на два этапа — процесс, в котором случайные ручки из предыдущей главы становятся умными ручками.
Этап 1: предобучение. Подаём модели текст интернет-масштаба (книги, веб, код) и заставляем её неустанно угадывать следующее слово. Каждый раз, когда она ошибается, все параметры корректируются на крошечную величину в направлении, уменьшающем ошибку (этот алгоритм корректировки — знаменитые обратное распространение ошибки и градиентный спуск). Повторите это на триллионах токенов — и основы грамматики, знаний и рассуждения вырезаются в ручках. Предобучение съедает большую часть вычислений, большую часть энергии и большую часть денег. Астрономические ~2×10²⁵ FLOPs модели класса GPT-4 сгорают именно здесь.
Этап 2: дообучение (post-training). Модель, прошедшая только предобучение, «эрудирована, но невоспитанна». Поэтому с помощью RLHF (обучения с подкреплением на основе обратной связи от людей) и похожих методов её учат «полезным и безопасным способам отвечать». Примерно с 2025 года лаборатории также вкладывают много сил в дообучение, которое тренирует долгие рассуждения (обдумывание), использование инструментов и агентное поведение. То, что современные модели так заметно «думают, прежде чем ответить», — результат этой эволюции дообучения. Мультиагентное поведение тоже закладывается здесь.
4. Инференс — момент, когда ваш вопрос превращается в электричество
Если обучение — это строительные работы по настройке ручек, то инференс — это эксплуатация, фактическое производство ответов с помощью готовых ручек. Каждый раз, когда вы вводите вопрос в ChatGPT, триллионы умножений прогоняются через почти триллион ручек, и токены генерируются по одному за раз. Мы видели, насколько тяжело обучение, но в масштабах всего общества энергию съедает именно инференс, а не обучение.
Причина проста: обучение по сути запускается один раз на модель, а инференс выполняется сотни миллионов раз в день по всему миру. На протяжении всего жизненного цикла модели спрос на энергию и вычисления накапливается куда сильнее на стороне инференса, чем на стороне обучения. Один вопрос — это почти ничего электричества, и правда, один крошечный. Но крошечное × сотни миллионов × каждый день складывается в энергетическую проблему государственного масштаба. Дальше посмотрим на конкретные цифры.
5. Энергия — сколько электричества съедает LLM?
Часто говорят ИИ жрёт энергию, но сколько именно? Вот репрезентативные цифры, опубликованные по состоянию на 2026 год.
Энергопотребление LLM в цифрах
один короткий вопрос
в 65+ раз больше самой экономичной
(старое поколение)
прогноз 2024→2030
Даже один короткий запрос (0.42Wh), масштабированный до 700M/день, равен энергии ~35 000 домохозяйств США (оценка третьей стороны).
Стойки ЦОД в среднем потребляют менее 8kW (опрос Uptime Institute 2024 года), а стойка NVIDIA DGX GB200 для ИИ — около 120kW (документация NVIDIA); отдельный ЦОД для ИИ — от менее 50MW до более 1GW (данные Epoch AI).
Бросается в глаза, что «энергопотребление различается на порядки в зависимости от модели и длины запроса». По оценкам третьих сторон (см. таблицу ниже), многим моделям на короткий вопрос нужно меньше 0,5 Wh, но длинный запрос к самым прожорливым моделям превышает 29 Wh — более чем в 65 раз больше самых экономичных. Как уже говорилось в статье о ловушке «потраченные токены = объём работы», «делать всё на топовой модели» — роскошь и по энергии, и по деньгам. Отдавать лёгкие задачи лёгкой модели полезно и планете, и кошельку. По оценке Международного энергетического агентства (МЭА), мировое потребление электроэнергии дата-центрами в 2024 году составило около 415 ТВт·ч (около 1,5 % мирового), а к 2030 году должно удвоиться примерно до 945 ТВт·ч, и главный двигатель этого роста — ИИ.
«Энергия на один запрос» зависит от того, кто и как её измерял
Цифры вида «X Wh на запрос» цитируют часто, но получены они совершенно по-разному в зависимости от источника. Собственные измерения компаний и внешние оценки стоит читать отдельно.
| Цифра | К чему относится | Источник | Как получена |
|---|---|---|---|
| 0.24Wh | Текстовый запрос в приложении Gemini (медиана) | Google (авг. 2025, собственная статья) | Измерено в собственных дата-центрах, включая простаивающие машины и накладные расходы дата-центра |
| ~0.34Wh | Запрос к ChatGPT (в среднем) | Блог CEO OpenAI Сэма Альтмана (июнь 2025) | Цифра самой компании; метод не опубликован |
| 0.42Wh | Короткий запрос к GPT-4o | Jegham и др. (третья сторона, 2025) | Оценка по публичным данным о производительности API и предполагаемым конфигурациям оборудования |
| 29Wh+ | Длинный запрос к самым прожорливым моделям | Там же | Там же; более чем в 65 раз больше самых экономичных моделей |
Измерения компаний проводятся в единых условиях, но их нельзя проверить снаружи; оценки третьих сторон проще сравнивать, но они опираются на большее число допущений. И то и другое — значения для одного текстового запроса: чтение длинных документов, генерация изображений и видео, долгие задачи агентов требуют больше.
Если приложить это к своему использованию, становится понятен масштаб. Задавая 50 коротких вопросов в день, вы получите 0,24–0,42 Wh × 50 = около 12–21 Wh в день — примерно как светодиодная лампа на 10 Вт, горящая один-два часа. А один длинный запрос к тяжёлой модели может превысить 29 Wh. Расход электроэнергии определяется не столько числом вопросов, сколько тем, какой моделью вы пользуетесь и как долго заставляете её думать.
6. Правда ли, что разработка — это битва кошельков?
Вот вопрос, который интересовал вас больше всего. Является ли разработка передовых LLM битвой кошельков? Сначала проверенный вывод: если ограничиться предобучением передового края, это по сути правда. Цифры это подтверждают.
Траектория стоимости обучения передовых моделей
Вычисления для обучения передовых моделей растут в 4–5 раз в год (Epoch AI).
Стоимость обучения растёт в 2,4 раза в год — настоящая битва денег.
Конкретно: AI Index 2024 от Stanford HAI оценил стоимость вычислений для обучения GPT-4 примерно в 78 млн долларов, а Gemini Ultra от Google — примерно в 191 млн долларов (AI Index 2024). В статье исследовательской организации Epoch AI показано, что стоимость обучения крупнейших моделей с 2016 года растёт в 2,4 раза в год и что при сохранении тренда к 2027 году крупнейшие прогоны обучения будут стоить больше миллиарда долларов (Cottier и др.). И это «один успешный прогон» — за ним стоят неудачные пробы и ошибки, подготовка данных, зарплаты и инфраструктура для инференса. К тому же каждый GPU стоит тысячи долларов, а десятки тысяч, работающих месяцами, раздувают счёт за электричество. Денежная стена, которую «удачная идея» или «хитрый алгоритм» сами по себе никогда не преодолеют, стоит у входа на передний край. В этом смысле «битва денег» — не преувеличение, а факт. Поэтому на самом переднем крае могут сражаться лишь немногие, сумевшие привлечь огромный капитал: OpenAI, Google, Anthropic, Meta, xAI.
7. Но одними деньгами не выиграть — обратная волна эффективности
Предыдущая глава сказала, что битва кошельков реальна. Но если закончить рассказ на этом, мы исказим реальность 2026 года. Вовсе не верно, что с достаточным количеством денег ты побеждаешь — если уж на то пошло, встречное течение усилилось. В качестве честного ответа позвольте мне написать и эту другую сторону.
Символичный пример — серия шагов, в которых китайская DeepSeek выпустила модели, приближающиеся к переднему краю, при сравнительно небольшом бюджете, и о ней говорили, что она «обнулила нижнюю планку затрат». Одна за другой были продемонстрированы техники, позволяющие получить ту же производительность на порядки дешевле, — эффективные архитектуры, смесь экспертов (MoE), дистилляция (перенос знаний большой модели в маленькую) и тщательная работа над качеством данных. Они вбили клин в формулу «огромный капитал = победа». Внимание отрасли расширяется от «просто сделать больше» к «как дать ту же производительность дешевле и с меньшими затратами энергии».
Так что точная картина такова: гонка за обновлением пиковой производительности передового края — это битва кошельков. Но гонка за дешёвой доставкой достаточно хорошей производительности — это состязание смекалки и эффективности. Большинство моделей, которыми мы пользуемся изо дня в день, выигрывают от второго, дешевея, ускоряясь и становясь энергоэффективнее год от года. Как написано в материале как далеко можно зайти на бесплатном тарифе, к 2026 году даже бесплатные тарифы достигли практического уровня — плод, переданный пользователям обратной волной эффективности.
8. Что дальше — стена энергии и физики после денег
Так можно ли масштабироваться вечно, просто наваливая деньги? Нет — и это новая стена, которая начала проявляться в 2026 году. По анализу Epoch AI (август 2024 года), к 2030 году обучение масштаба около 2×10²⁹ FLOP, вероятно, станет осуществимым, но первым ограничением, скорее всего, станет электроэнергия, а за ней — мощности по производству чипов. Узким местом оказывается уже не только бюджет на покупку GPU. Путь преграждает —
- Энергия: можете ли вы непрерывно подавать электричество гигаваттного масштаба в одном месте? Теперь это проблема электростанций и сетей
- Межсоединение: пропускная способность для синхронизации десятков и сотен тысяч GPU без задержек. Существует физический потолок того, что может потянуть одна гигантская задача обучения
- Данные: высококачественный обучающий текст сам по себе иссякает (есть предел того, сколько хорошего написало человечество)
То, что наступает после битвы кошельков, — это битва энергии, физики и смекалки. Вот почему компании сейчас смещаются к инвестициям в атомную энергетику, разработке собственных специализированных чипов, использованию синтетических данных и исследованию эффективных архитектур. Эпоха, в которой можно было победить, бросая деньги, по иронии превращается в эпоху, в которой одними деньгами не выиграть.
Итоги
Истинная природа LLM — это гигантское устройство предсказания, где от сотен миллиардов до более чем триллиона весов без конца вычисляют вероятность следующего слова. Attention в Transformer выполняет контекстно-зависимое взвешивание, а предобучение (которое съедает большую часть вычислений, энергии и денег) плюс постобучение (RLHF, тренировка рассуждения) делают ручки умными. Сообразительность — не магия, это побочный продукт доведённого до предела угадывания следующего слова на огромных объёмах текста.
По энергии: один запрос — 0,24 Wh (медиана) по собственному измерению Google, короткий запрос — 0,42 Wh по оценке третьей стороны, а длинный запрос к самым тяжёлым моделям — больше 29 Wh (более чем в 65 раз выше самой экономичной); одно только обучение GPT-3 заняло 1 287 МВт·ч. В масштабах общества потребление на стороне инференса накапливается, и электропотребление дата-центров мира к 2030 году должно удвоиться примерно до 945 ТВт·ч (МЭА). «Делать всё на топовой модели» — роскошь и по энергии, и по деньгам; разумно выбирать модель по весу задачи.
И главный вопрос — «Является ли разработка LLM битвой денег?» Ответ: «по сути да, если говорить о предобучении на переднем крае» (около $78M на вычисления для GPT-4; прогноз — больше $1B за прогон к 2027 году). Но встречное течение «одними деньгами не победить» тоже сильно (сброс нижней планки затрат DeepSeek, эффективность, дистилляция). Обновление пиковой производительности — битва денег; дешёвая доставка практической производительности — битва смекалки: эта двухслойная структура и есть реальность 2026 года. А дальше — физическая стена энергии, межсоединений и нехватки данных. Если понимать LLM не как «волшебную коробку», а как «вероятностную машину на электричестве», вас не унесёт ни ажиотаж, ни страх. Чтобы узнать больше, читайте что такое LLM (введение), контекстное окно и сравнение бесплатных тарифов.
FAQ
В. Чем больше параметров (весов), тем всегда умнее?
О. Раньше больше значит умнее держалось почти повсеместно, но в 2026 году всё не так просто. Даже при одинаковом числе параметров производительность сильно меняется в зависимости от качества данных, постобучения и архитектурной изобретательности. Маленькие, но умные модели (плоды дистилляции и эффективного проектирования) расплодились, и число параметров = интеллект больше не работает. Мы вступили в эпоху как обучено важнее, чем сколько штук.
В. LLM действительно понимает или это зубрёжка наизусть?
О. Даже эксперты расходятся во мнениях — это сложный вопрос. Что наверняка, так это то, что модель демонстрирует обобщение, которое зубрёжкой не объяснить (она решает задачи, отсутствующие в обучении). Является ли это тем же пониманием смысла, что у людей, — отдельный вопрос без ясного ответа. На практике относитесь к ней как к чрезвычайно продвинутому устройству предсказания, которое ведёт себя так, будто понимает. Именно поэтому она так уверенно ошибается (галлюцинации).
В. Могу ли я построить собственную LLM?
О. Класса передового края — невозможно для частного лица (нужны сотни миллионов долларов и десятки тысяч GPU). Но обучить маленькую модель или дообучить существующую открытую модель посильно даже частным лицам. Более того, большинство практических потребностей покрывается использованием существующих моделей через API. Почти нет необходимости строить всё самому.
В. Является ли энергопотребление ИИ серьёзной проблемой для планеты?
О. Факт, что масштаб становится таким, что им нельзя пренебречь (потребление ЦОД — около 1.5% мирового, прогнозируется удвоение к 2030 году; IEA). Но параллельно бешено развивается и эффективность; энергия на токен падает год от года. Проблема не столько в эффективности одного запроса, сколько в взрывном росте общего объёма × частоты. Насколько возобновляемая энергетика, атом и специализированные чипы смогут это компенсировать — фокус будущего.
В. В конечном счёте, что стоит знать пользователю?
О. Три вещи. (1) Модель — это предсказатель вероятностей, поэтому она ошибается даже уверенным тоном (проверяйте важную информацию). (2) Тяжёлые вопросы дороги по энергии и деньгам, поэтому выбирайте модель по весу задачи (лёгкие поручения — лёгким моделям). (3) Пиковая производительность — это битва кошельков, но практическая производительность дешевеет и становится энергоэффективнее каждый год (подождать, пока эволюционируют бесплатные/дешёвые модели, — тоже умно). Чем больше вы знаете механизм, тем дешевле и умнее вы можете пользоваться ИИ.