2023 年发布的 GPT-4,其训练投入的算力按研究机构 Epoch AI 的估算约为 2.1×10²⁵ 次浮点运算(FLOP),斯坦福大学 HAI 估算这部分算力的成本 约为 7,800 万美元。就连更早的 GPT-3,仅训练就耗电 约 1,287 MWh(Google 研究人员 2021 年的估算)——相当于一个普通家庭一百多年的用电量,只为造出一个模型。我们随手敲下的“帮我总结一下”背后,是一个由物理与钞票构成的世界。

本文将从机制、电力、金钱三个方向,深入剖析“LLM(大语言模型)究竟是如何运作的”。具体来说——(1)为什么 LLM 仅凭一堆叫“权重(参数)”的旋钮就能生成语言;(2)一次提问或一次训练究竟消耗多少电;(3)“前沿 LLM 开发就是烧钱大战”这种说法是不是真的?对第三点的简短回答是:“对于绝对前沿而言,基本属实——但'光有钱赢不了'的反向潮流在 2026 年变得更强了。”这才是准确的图景。

先亮明我的立场:LLM 的“智能”既不是魔法也不是意识——它是用电力把一台巨大的概率预测机器硬生生塑造成型的结果。理解了机制,过度的炒作和过度的恐惧就都会消散。本文会深入到中级程度。如果你还在“LLM 到底是什么”的起点,请先读 什么是 LLM(入门);关于上下文长度见 上下文窗口;关于价格见 面向初学者的 AI API。

HOW LLMs WORK · WEIGHTS × POWER × CASH

从三个方向解剖一台 LLM

——智能由什么构成、它烧掉的电、它花掉的钱

机制
权重预测下一个词
数千亿到 1 万亿以上的旋钮只是在计算概率
电力
单次查询 ≈ 0.2–29 Wh
一次训练 = 100 多个家庭年的用电
金钱
2023 年为 $78–191M
预计到 2027 年,单次训练将超过 $1B

LLM 的聪明绝非魔法。它是用电力和金钱把一台巨大的概率机器硬塑造成型的结果。
懂了机制,炒作与恐惧便一并消散。

1. LLM 只是不停地猜“下一个词”

这听上去也许令人意外,但 ChatGPT、Claude、Gemini 本质上做的都是同一件事。“根据目前为止的文本,计算出最可能作为续写的下一个词(更准确地说是'token')的概率,挑一个出来,再一个接一个排好。”就这么简单。喂给它“猫趴在 ___ 上”,它会给“垫子”“沙发”“地板”等候选项分配概率,然后输出概率最高的那个(或按概率采样出来的那个)。它每次生成一个 token,如此反复,直到文本结束。

这里有个让很多人卡住的问题。“区区一个猜词游戏,怎么能总结论文、写代码?”答案是:“为了真正准确地猜出下一个词,它别无选择,只能在某种程度上'理解'世界的结构。”要猜“日本的首都是 ___”需要地理知识;“3 + 5 = ___”需要算术;“这个 bug 的原因是 ___”则需要它内部掌握编程知识。作为把“猜下一个词”在海量文本上训练到极致的副产物,知识与推理便涌现出来。这正是 LLM 既奇异又本质的特性。

那么,计算这个“下一个词概率”的,又是什么呢?正如前文所暗示,主角是一堆数量惊人的数字,叫做“权重(参数)”。下一章就揭晓它们究竟是什么。

2. 什么是“权重”?——一万亿个旋钮造就智能

用一个比喻概括 LLM 的内部:“一台拥有数千亿到一万亿以上'旋钮'的巨型计算装置。”每个旋钮都是一个“权重(参数)”,当输入词的信号传向下一层时,它决定“该增强还是削弱哪些信号、增强或削弱多少”。GPT-3 约有 1750 亿个;据说最新的前沿模型已超过一万亿。这些海量旋钮的设定值,恰恰就是模型所学到的“知识”本身。

WEIGHTS

“权重”如何变成语言

① 分词
把文本切成词片段(token),并转换成数值向量
② 穿过权重
数十层 Transformer 通过乘以权重来变换信号
③ Attention
权重判断应该关注句子中的哪些词
④ 输出概率
计算下一个 token 的概率分布并挑出一个

“学习”就是把这一万亿个旋钮一点点拧向正确答案的工作。
拧好后的旋钮设定(权重)= 模型的“知识”本身。

2017 年问世的 Transformer 是现代 LLM 的基石。它的核心是 “Attention”机制,它通过权重动态判断“句子中哪个词对当前词最重要”。“看到银行前面的那条河”里的“bank”究竟指金融机构还是河岸,是由它在上下文中与其他词的关系的加权来决定的——而这种“依赖上下文的加权”正是 LLM 即便在长篇段落上也能给出连贯回应的原因。当人们说“什么加权之类的”时,指的正是这个 Attention,以及它背后那数以万亿计的乘法运算。

关键的一点:这些权重并非人工设定的。一开始它们只是一团随机数字,毫无意义。意义是通过“学习”被灌输进去的。那么,这个学习又是如何发生的?

3. 学习的两个阶段——预训练与后训练(RLHF)

LLM 的学习大致分为两个阶段——也就是上一章那些“随机旋钮”变成“聪明旋钮”的过程。

阶段 1:预训练。喂给它互联网规模的文本(书籍、网页、代码),让它不停地“猜下一个词”。每当它猜错,所有参数都会朝着缩小误差的方向被微调一点点(这个调整算法就是著名的“反向传播 + 梯度下降”)。在数以万亿计的 token 上反复这么做,语法、知识与推理的基础便被刻进旋钮里。预训练吃掉了大部分算力、大部分电力和大部分金钱。GPT-4 级别模型那天文数字般的约 2×10²⁵ FLOPs,就烧在这里。

第二阶段:后训练(Post-training)。只做过预训练的模型处于“博学但没礼貌”的状态。因此要用 RLHF(基于人类反馈的强化学习)等方法,教会它“对人有用、安全的回答方式”。大约从 2025 年起,各家也在大力投入锻炼长推理(仔细思考)、工具使用和智能体式行为的后训练。“最近的模型总是先思考再回答”,正是后训练进化的结果。多智能体式的行为也是在这里培养出来的。

4. 推理——你的问题变成电力的瞬间

如果说训练是“设定旋钮的建造工程”,那么推理就是“用设定好的旋钮实际生成答案的运行操作”。每当你在 ChatGPT 里敲下一个问题,数以万亿计的乘法就会穿过近一万亿个旋钮,token 被一个接一个地生成出来。我们已经看到训练有多重——但从整个社会层面看,吃电的不是训练,而是推理。

原因很简单:训练每个模型基本上只跑一次,而推理在全球每天要跑上亿次。因此,在一个模型的整个生命周期里,电力与算力的需求压倒性地累积在推理一侧,而非训练。“一个问题用不了多少电”——没错,单个确实微不足道。但“微不足道 × 上亿次 × 每一天”累积起来,就成了国家级的电力问题。下面我们来看具体数字。

5. 电力——LLM 究竟要吃掉多少电?

“AI 吃电”常被提起,但究竟有多少?以下是截至 2026 年公布的代表性数据。

ELECTRICITY

用数字看 LLM 的电力消耗

单次查询(短)
0.42Wh
GPT-4o 级别
一个简短问题
一次重度推理
29Wh+
最耗电的模型、长提示
超过最高效模型的 65 倍
训练 GPT-3
1,287MWh
550t+ CO2
(老一代)
全球数据中心电力
415→945
TWh
2024→2030 预测

哪怕是一次简短查询(0.42Wh),按 每天 7 亿次计算,就相当于约 35,000 户美国家庭的用电(第三方估算)。
数据中心机架的平均功率不到 8kW(Uptime Institute 2024 年调查),而面向 AI 的 NVIDIA DGX GB200 机架约为 120kW(NVIDIA 文档);单座 AI 数据中心的规模从不到 50MW 到超过 1GW(Epoch AI 的追踪数据)。

值得注意的是,“耗电量因模型和提示长度而相差几个数量级”。在第三方的估算中(见下表),许多模型回答一个简短问题不到 0.5Wh,但向最耗电的模型发出长提示则会超过 29Wh——是最高效模型的 65 倍以上。正如在“token 消耗 = 工作量”的陷阱一文中提到的,“什么都用最顶级的模型”在电力和成本上都是一种奢侈。把轻活交给轻量模型,对地球和钱包都更友好。据国际能源署(IEA)估算,全球数据中心 2024 年用电约 415TWh(约占全球总量的 1.5%),预计到 2030 年将翻倍至约 945TWh,而增长的主要驱动力就是 AI。

“一次查询的耗电量”取决于谁、用什么方法测量

“每次查询 X Wh”这类数字经常被引用,但来源不同,得出的方法完全不同。公司自己的实测和外部的估算需要分开来看。

数字对象来源测量方法
0.24WhGemini 应用中的一次文本提问(中位数)Google(2025 年 8 月,自家论文)在自家数据中心实测,包括闲置机器和数据中心配套设施的耗电
约 0.34Wh一次 ChatGPT 查询(平均)OpenAI CEO 萨姆·奥尔特曼的博客(2025 年 6 月)公司自己的数字,但未公开测量方法
0.42Wh向 GPT-4o 发出的一次简短提示Jegham 等(第三方,2025 年)根据公开 API 的性能数据和推测的硬件配置计算出的估算值
29Wh+向最耗电的模型发出的一次长提示同上同上。超过最高效模型的 65 倍

公司的实测条件统一,但外界无法验证;第三方估算便于比较,但依赖更多假设。两者都是一次文本查询的数值,读取长文档、生成图像或视频、智能体的长时间任务都会更多。

套用到自己的使用上就能体会规模。比如每天问 50 个简短问题,0.24–0.42Wh × 50 次,每天约 12–21Wh,大约相当于一盏 10W 的 LED 灯开 1–2 小时。相比之下,向重量级模型发一次长提示就可能超过 29Wh。决定耗电量的,与其说是提问次数,不如说是“用哪个模型、让它想多久”。

6. “开发就是烧钱大战”是真的吗?

这就是你最好奇的那个问题。“前沿 LLM 开发是烧钱大战吗?”先给出经过核实的结论:“仅就前沿的预训练而言,基本属实。”数字支持这一点。

MONEY FIGHT

前沿训练成本的演变轨迹

GPT-3 (2020)
约 3×10²³ FLOPs。在当时高得离谱
GPT-4 (2023)
约 2.1×10²⁵ FLOP,算力成本约 $78M
2023 Gemini Ultra
算力成本 约 $191M(AI Index 2024)
2027 预测
最大规模的训练超过 $1B

前沿训练算力以 每年 4–5 倍 的速度增长(Epoch AI)。
训练成本也以 每年 2.4 倍 的速度膨胀——名副其实的金钱对决。

具体来说,斯坦福大学 HAI 的《AI Index 2024》估算,训练所用算力的成本 GPT-4 约为 7,800 万美元,Google 的 Gemini Ultra 约为 1.91 亿美元(AI Index 2024)。研究机构 Epoch AI 的论文指出,最大规模模型的训练成本自 2016 年以来以 每年 2.4 倍 的速度增长,如果这一趋势持续,到 2027 年最大规模的单次训练将超过 10 亿美元(Cottier 等)。而且这只是“成功的一次”,背后还叠加着失败的反复试错、数据整理、人力成本和推理用基础设施。再加上每块 GPU 价值数千美元,让数万块连续运转数月的电费——光靠“灵光一现”或“优秀的算法”绝对跨不过去的金钱之墙,就立在前沿的入口处。从这个意义上说,“金钱对决”并非夸张,而是事实。正因如此,能在最前沿作战的只有 OpenAI、Google、Anthropic、Meta、xAI 等筹得巨额资本的少数几家。

7. 但光有钱赢不了——效率的反向潮流

上一章说“烧钱大战是真的”。但故事到此为止,就误读了 2026 年的现实。“只要有足够的钱就能赢”绝非事实——若要说有什么,反倒是一股反向潮流变强了。作为一个诚实的回答,我把这另一面也写出来。

最具象征性的,是中国的 DeepSeek 以相对较小的预算推出逼近前沿的模型,被评价为“重置了成本的底线(floor)”的一系列动作。以低几个数量级的成本做出同等性能的方法——高效架构、混合专家(MoE)、蒸馏(把大模型的知识转移到小模型)、对数据质量的精细打磨——接连得到验证,在“巨额资本 = 胜利”的公式上打进了一根楔子。行业的关注点也在从“一味做大”扩展到“如何以更低成本、更省电的方式实现同等性能”。

所以准确的图景是这样的:“刷新前沿'巅峰性能'的竞赛是烧钱大战。但交付'够用性能'的竞赛,则是一场智慧与效率的比拼。”我们日常使用的大多数模型都受益于后者,逐年变得更便宜、更快、更省电。正如 免费版能走多远中所写,到 2026 年,连免费版都已达到实用水平——这是效率反向潮流交到用户手中的果实。

8. 接下来呢——烧钱之后的“电力与物理”之墙

那么,只要不断堆钱就能无限扩展吗?不——这正是 2026 年开始显现的新墙。Epoch AI 的分析(2024 年 8 月)认为,到 2030 年约 2×10²⁹ FLOP 规模的训练很可能可行,但最先构成约束的可能是电力,其次是芯片的制造能力。瓶颈不再只是“买 GPU 的预算”。取而代之挡在路上的,是——

  • 电力:你能否在一个地方持续供应千兆瓦级别的电力?这如今是发电厂和电网的问题
  • 互连:在没有延迟的情况下同步数万到数十万块 GPU所需的带宽。单个超大训练任务能承受的规模存在物理上限
  • 数据:高质量的训练文本本身正在枯竭(人类写出的好文字总有个限度)

“烧钱大战”之后到来的,是“电力、物理与智慧之战”。这也是为什么各公司如今正转向投资核电、研发自家专用芯片、利用合成数据、研究高效架构。能用砸钱取胜的时代,讽刺地,正在变成光靠钱赢不了的时代。

总结

LLM 的真正本质是“一台巨型预测装置,其中数千亿到一万亿以上的'权重'不停地计算下一个词的概率。”Transformer 的 Attention 负责“依赖上下文的加权”,而预训练(吃掉大部分算力、电力和金钱)加上后训练(RLHF、推理训练)让旋钮变聪明。这份聪明绝非魔法——它是把“猜下一个词”在海量文本上钻研到极致的副产物。

电力方面:一次查询按 Google 的实测为 0.24Wh(中位数),按第三方估算简短查询为 0.42Wh,向最重的模型发出长提示则超过 29Wh(最高效模型的 65 倍以上);仅 GPT-3 的训练就耗电 1,287MWh。从全社会看,推理侧的消耗在大量累积,据 IEA 估算,全球数据中心用电到 2030 年将翻倍至约 945TWh。“什么都用顶级模型”在电力和成本上都是奢侈,按任务轻重选择模型才是聪明做法。

然后是核心问题——“LLM 开发是金钱对决吗?”答案是“仅限前沿的预训练,基本属实”(GPT-4 的算力成本约 $78M,预计到 2027 年单次超过 $1B)。但“光有钱赢不了”的逆流同样强劲(DeepSeek 的 floor reset、效率化、蒸馏)。刷新最高性能是金钱之战,低价交付实用性能是智慧之战——这种双层结构就是 2026 年的现实。而接下来到来的,是电力、互连和数据枯竭这堵物理之墙。把 LLM 理解为“靠电力运转的概率机器”而非“魔法盒子”,就不会被过度的期待或过度的恐惧所左右。想进一步了解,请看什么是 LLM(入门)、上下文窗口和免费版对比。

常见问题

Q. 参数(权重)越多就一定越聪明吗?
A. “越大越聪明”曾经几乎是普遍规律,但在 2026 年事情没那么简单了。即便参数量相同,性能也会因数据质量、后训练和架构上的巧思而大相径庭。又小又聪明的模型(蒸馏与高效设计的产物)大量涌现,“参数量 = 智能”已不再成立。我们已进入一个“怎么训练”重于“有多少参数”的时代。

Q. LLM 是真的“理解”,还是死记硬背?
A. 连专家都意见不一——这是个难题。可以确定的是,“它展现出死记硬背无法解释的泛化能力”(它能解决训练数据里没有的问题)。至于那是不是“与人类相同的意义理解”,则是另一个没有明确答案的问题。从实用角度,可以把它当作“一台行为表现得仿佛理解了的极其先进的预测装置”。这也正是它为何会如此自信地犯错(幻觉)。

Q. 我能自己造一个 LLM 吗?
A. “前沿级别”对个人而言是不可能的(它需要数亿美元和数万块 GPU)。但训练一个小模型,或对现有开源模型进行微调,对个人来说也是可行的。而且,大多数实用需求都可以通过 API 调用现有模型来满足。几乎没有必要“什么都自己从头造”。

Q. AI 的电力消耗对地球来说是个严重问题吗?
A. 规模正变得不容忽视,这是事实(数据中心电力约占全球的 1.5%,预计到 2030 年翻倍;IEA)。但效率也在同步飞速提升;“每 token 的电力”正逐年下降。问题与其说在于“单次查询的能效”,不如说在于“总量 × 频率的爆炸式增长”。可再生能源、核能和专用芯片能在多大程度上抵消这一点,是未来的焦点。

Q. 归根结底,作为用户值得知道的是什么?
A. 三件事。(1)模型是“概率预测器”,所以哪怕语气自信也会犯错(重要信息要核实)。(2)重度问题在电力和金钱上都昂贵,所以按任务的轻重挑模型(轻活儿交给轻量模型)。(3)“巅峰性能”是烧钱大战,但“实用性能”每年都在变得更便宜、更省电(等待免费/低价模型进化也是一种聪明做法)。你越懂机制,就越能既省钱又聪明地用 AI。