O poder de cálculo investido no treinamento do GPT-4, lançado em 2023, foi de aproximadamente 2,1×10²⁵ operações de ponto flutuante (FLOP) segundo o instituto de pesquisa Epoch AI, e o Stanford HAI estimou o custo dessa computação em cerca de US$ 78 milhões. Mesmo o treinamento do antigo GPT-3 sozinho usou cerca de 1.287 MWh de eletricidade (estimativa de pesquisadores do Google em 2021) — mais de um século da eletricidade de uma casa média, gasto para construir um único modelo. Por trás do casual "ei, resume isso" que digitamos existe um mundo de física e de pilhas de dinheiro.

Este artigo investiga a fundo "como um LLM (modelo de linguagem de grande porte) realmente funciona", a partir de três direções: mecanismo, energia e dinheiro. Especificamente — (1) por que um LLM consegue produzir linguagem a partir de um conjunto de botões chamados "pesos (parâmetros)", (2) quanta eletricidade uma pergunta ou um treinamento consome, e (3) é verdade a afirmação de que "o desenvolvimento de LLMs de fronteira é uma briga de dinheiro"? A resposta curta para a terceira: "Para a fronteira absoluta, é essencialmente verdade — mas uma contracorrente em que 'dinheiro sozinho não vence' se fortaleceu em 2026." Esse é o quadro preciso.

Minha posição, de cara: a "inteligência" de um LLM não é nem mágica nem consciência — é o resultado de moldar à força uma gigantesca máquina de previsão de probabilidades com eletricidade. Entender o mecanismo dissolve tanto o entusiasmo excessivo quanto o medo excessivo. Este artigo vai a uma profundidade de nível intermediário. Se você está começando do "o que é afinal um LLM", leia primeiro o que é um LLM (introdução); para o comprimento de contexto veja a janela de contexto; para preços veja API de IA para iniciantes.

COMO OS LLMs FUNCIONAM · PESOS × ENERGIA × DINHEIRO

Dissecando um LLM a partir de três direções

— Do que a inteligência é feita, a energia que ela queima, o dinheiro que ela custa

Mecanismo
Os pesos preveem a próxima palavra
Centenas de bilhões a mais de 1 trilhão de botões apenas calculando probabilidades
Energia
Uma consulta ≈ 0,2–29 Wh
Um treinamento = mais de 100 anos-residência de energia
Dinheiro
US$ 78–191 mi em 2023
Até 2027, projetam-se treinamentos de mais de US$ 1 bi

A esperteza de um LLM não é mágica. É o resultado de moldar à força uma gigantesca máquina de probabilidades com energia e dinheiro.
Conheça o mecanismo, e tanto o hype quanto o medo se dissolvem.

1. Um LLM apenas fica adivinhando "a próxima palavra"

Pode soar surpreendente, mas ChatGPT, Claude e Gemini fazem, em essência, uma única coisa. "Dado o texto até agora, calcular a probabilidade da próxima palavra mais provável (mais precisamente, 'token') como continuação, escolher uma e enfileirá-las." É isso. Dê a ele "o gato está sobre o ___" e ele atribui probabilidades a candidatos como "tapete", "sofá", "chão" e emite o mais alto (ou um amostrado por probabilidade). Ele repete isso um token de cada vez até o texto terminar.

Aqui está a questão que confunde muita gente. "Como um mero jogo de adivinhar palavras consegue resumir artigos ou escrever código?" A resposta: "Para realmente adivinhar a próxima palavra com precisão, ele não tem escolha a não ser 'entender' em certo grau a estrutura do mundo." Adivinhar "a capital do Japão é ___" exige geografia; "3 + 5 = ___" exige aritmética; "a causa deste bug é ___" exige conhecimento de programação mantido internamente. Como subproduto de treinar a "adivinhação da próxima palavra" ao extremo sobre uma enorme quantidade de texto, conhecimento e raciocínio emergem. Essa é a natureza estranha e essencial dos LLMs.

Então, o que está calculando essa "probabilidade da próxima palavra"? Como antecipado, o protagonista é uma pilha impressionante de números chamada "pesos (parâmetros)". O próximo capítulo revela o que eles são.

2. O que são os "pesos"? — Um trilhão de botões geram inteligência

Para resumir o interior de um LLM em uma analogia: "um gigantesco dispositivo de cálculo com centenas de bilhões a mais de um trilhão de 'botões'." Cada botão é um "peso (parâmetro)" e, quando o sinal de uma palavra de entrada passa para a próxima camada, ele decide "quais sinais reforçar ou enfraquecer, e em quanto." O GPT-3 tinha cerca de 175 bilhões; diz-se que os modelos de fronteira mais recentes ultrapassam um trilhão. A configuração desses vastos botões é exatamente o "conhecimento" aprendido pelo modelo.

PESOS

Como os "pesos" se transformam em linguagem

① Tokenizar
Dividir o texto em fragmentos de palavra (tokens) e converter em vetores numéricos
② Passar pelos pesos
Dezenas de camadas Transformer transformam os sinais multiplicando pesos
③ Attention
Os pesos julgam em quais palavras da frase focar
④ Emitir probabilidades
Calcular a distribuição de probabilidade do próximo token e escolher um

"Aprender" é o trabalho de girar esses trilhões de botões pouco a pouco em direção à resposta certa.
A configuração final dos botões (pesos) = o próprio "conhecimento" do modelo.

O Transformer, que surgiu em 2017, é a base dos LLMs modernos. Seu coração é o mecanismo de "Attention", que julga dinamicamente, por pesos, "qual palavra na frase importa para a palavra atual." Se "banco" em "vi o rio em frente ao banco" significa uma instituição financeira ou a margem do rio é decidido ponderando sua relação com as outras palavras do contexto — e essa "ponderação dependente do contexto" é exatamente por que um LLM consegue retornar respostas coerentes mesmo em trechos longos. Quando as pessoas dizem "algo sobre ponderação", referem-se precisamente a esse Attention e aos trilhões de multiplicações por trás dele.

O ponto crucial: esses pesos não foram definidos à mão. No início, são um amontoado de números aleatórios, sem sentido. O sentido é instilado por meio do "aprendizado." Então, como esse aprendizado acontece?

3. Dois estágios de aprendizado — pré-treino e pós-treino (RLHF)

O aprendizado de um LLM se divide amplamente em dois estágios — o processo pelo qual os "botões aleatórios" do capítulo anterior se tornam "botões inteligentes."

Estágio 1: Pré-treino. Alimente-o com texto em escala de internet (livros, a web, código) e faça-o "adivinhar a próxima palavra" sem parar. Cada vez que erra, todos os parâmetros são ajustados por uma pequena quantidade na direção que reduz o erro (esse algoritmo de ajuste é a famosa "retropropagação + descida de gradiente"). Repita isso ao longo de trilhões de tokens, e os fundamentos de gramática, conhecimento e raciocínio ficam gravados nos botões. O pré-treino consome a maior parte do poder de cálculo, da energia e do dinheiro. Os astronômicos ~2×10²⁵ FLOPs de um modelo da classe GPT-4 queimam aqui.

Etapa 2: pós-treinamento (post-training). Um modelo apenas pré-treinado é "sabido, mas mal-educado". Por isso, com RLHF (aprendizado por reforço a partir de feedback humano) e técnicas semelhantes, ensinam-se a ele "formas úteis e seguras de responder". Desde cerca de 2025, os laboratórios também vêm investindo pesado no pós-treinamento que exercita raciocínio longo (pensar com calma), uso de ferramentas e comportamento agêntico. O fato de os modelos recentes "pensarem antes de responder" é resultado dessa evolução do pós-treinamento. O comportamento multiagente também é instalado aqui.

4. Inferência — o momento em que sua pergunta vira eletricidade

Se o treinamento é "a obra de construção que define os botões", então a inferência é "a operação de realmente produzir respostas usando os botões prontos." Toda vez que você digita uma pergunta no ChatGPT, trilhões de multiplicações percorrem quase um trilhão de botões, e os tokens são gerados um de cada vez. Vimos o quão pesado é o treinamento — mas na sociedade como um todo, é a inferência, não o treinamento, que consome a energia.

A razão é simples: o treinamento roda basicamente uma vez por modelo, mas a inferência roda centenas de milhões de vezes por dia em todo o mundo. Ao longo da vida útil de um modelo, a demanda de energia e de cálculo se acumula muito mais na inferência do que no treinamento. "Uma pergunta é quase nada de eletricidade" — verdade, uma é minúscula. Mas "minúsculo × centenas de milhões × todo dia" se acumula em um problema de energia em escala nacional. Vejamos números concretos a seguir.

5. Energia — quanta eletricidade um LLM consome?

"A IA consome energia" é dito com frequência, mas quanto exatamente? Aqui estão os números representativos publicados a partir de 2026.

ELETRICIDADE

Consumo de energia de LLMs em números

Uma consulta (curta)
0,42Wh
classe GPT-4o
uma pergunta curta
Um raciocínio pesado
29Wh+
modelo mais pesado, prompt longo
mais de 65x o mais eficiente
Treinar o GPT-3
1.287MWh
550t+ de CO2
(uma geração antiga)
Energia global de DC
415→945
TWh
previsão 2024→2030

Mesmo uma consulta curta (0,42Wh), escalada para 700 mi/dia, equivale à eletricidade de ~35.000 lares dos EUA (estimativa de terceiros).
Os racks de data center têm média abaixo de 8kW (pesquisa do Uptime Institute de 2024), enquanto um rack NVIDIA DGX GB200 para IA consome cerca de 120kW (documentação da NVIDIA); um único data center de IA vai de menos de 50MW a mais de 1GW (dados de acompanhamento da Epoch AI).

O que chama a atenção é que "o consumo de energia varia em ordens de grandeza conforme o modelo e o tamanho do prompt". Em estimativas de terceiros (veja a tabela abaixo), muitos modelos gastam menos de 0,5 Wh numa pergunta curta, mas um prompt longo aos modelos que mais consomem passa de 29 Wh — mais de 65 vezes os mais eficientes. Como comentado em a armadilha de medir trabalho por tokens consumidos, "fazer tudo no modelo mais potente" é um luxo em energia e em custo. Mandar tarefas leves para um modelo leve faz bem ao planeta e ao bolso. Segundo a Agência Internacional de Energia (AIE), o consumo elétrico global dos data centers foi de cerca de 415 TWh em 2024 (cerca de 1,5% do total mundial) e deve dobrar para cerca de 945 TWh até 2030, com a IA como principal motor desse crescimento.

A "energia por consulta" depende de quem mediu e como

Números de "X Wh por consulta" são muito citados, mas são obtidos de formas completamente diferentes conforme a fonte. Vale ler separadamente as medições das próprias empresas e as estimativas externas.

NúmeroA que se refereFonteComo foi obtido
0,24WhUm prompt de texto no app Gemini (mediana)Google (ago. 2025, artigo próprio)Medido nos próprios data centers, incluindo máquinas ociosas e o consumo auxiliar do data center
~0,34WhUma consulta ao ChatGPT (média)Blog de Sam Altman, CEO da OpenAI (jun. 2025)Número da própria empresa; o método não foi divulgado
0,42WhUm prompt curto ao GPT-4oJegham et al. (terceiros, 2025)Estimado a partir do desempenho público da API e de configurações de hardware inferidas
29Wh+Um prompt longo aos modelos que mais consomemIdemIdem; mais de 65 vezes os modelos mais eficientes

As medições das empresas usam condições uniformes, mas não podem ser verificadas de fora; as estimativas de terceiros são mais fáceis de comparar, mas dependem de mais suposições. Ambas são valores para uma única consulta de texto: ler documentos longos, gerar imagens ou vídeo e tarefas longas de agentes consomem mais.

Aplicar isso ao seu próprio uso ajuda a ter noção da escala. Se você faz 50 perguntas curtas por dia, 0,24–0,42 Wh × 50 dá cerca de 12–21 Wh por dia — mais ou menos o mesmo que deixar uma lâmpada LED de 10 W acesa por uma a duas horas. Já um único prompt longo a um modelo pesado pode passar de 29 Wh. O que pesa na eletricidade é menos quantas vezes você pergunta e mais qual modelo usa e quanto o faz pensar.

6. É verdade que "o desenvolvimento é uma briga de dinheiro"?

Aqui está a pergunta que mais despertou sua curiosidade. "O desenvolvimento de LLMs de fronteira é uma briga de dinheiro?" A conclusão verificada primeiro: "Limitado ao pré-treino da fronteira, é essencialmente verdade." Os números confirmam.

BRIGA DE DINHEIRO

Trajetória do custo de treinamento na fronteira

GPT-3 (2020)
~ 3×10²³ FLOPs. Fora da curva para a época
GPT-4 (2023)
~ 2,1×10²⁵ FLOP, computação ~US$ 78 mi
2023 Gemini Ultra
computação ~US$ 191 mi (AI Index 2024)
previsão 2027
os maiores treinamentos passando de US$ 1 bi

A computação de treinamento de fronteira cresce 4–5x ao ano (Epoch AI).
O custo de treinamento sobe 2,4x ao ano — uma verdadeira briga de dinheiro.

Concretamente, o AI Index 2024 do Stanford HAI estimou o custo de computação do treinamento em cerca de US$ 78 milhões para o GPT-4 e cerca de US$ 191 milhões para o Gemini Ultra, do Google (AI Index 2024). Um artigo do instituto de pesquisa Epoch AI conclui que o custo de treinar os maiores modelos cresce 2,4 vezes ao ano desde 2016 e que, se a tendência continuar, os maiores treinamentos custarão mais de US$ 1 bilhão até 2027 (Cottier et al.). E isso é "uma rodada bem-sucedida" — por trás dela há tentativa e erro fracassados, preparação de dados, salários e infraestrutura de inferência. Além disso, cada GPU custa milhares de dólares; rodar dezenas de milhares delas por meses faz a conta de luz disparar. Um muro de dinheiro que "uma ideia brilhante" ou "um algoritmo engenhoso" sozinhos jamais conseguem transpor fica na entrada da fronteira. Nesse sentido, "briga de dinheiro" não é exagero — é fato. Por isso só um punhado que garantiu capital enorme — OpenAI, Google, Anthropic, Meta, xAI — consegue lutar na linha de frente.

7. Mas dinheiro sozinho não vence — o refluxo da eficiência

O capítulo anterior disse que "a briga de dinheiro é real". Mas encerrar a história aí é interpretar mal a realidade de 2026. Não é de forma alguma verdade que "com dinheiro suficiente você vence" — pelo contrário, uma contracorrente se fortaleceu. Como resposta honesta, deixe-me escrever também esse outro lado.

O caso simbólico é a série de movimentos em que a chinesa DeepSeek lançou modelos próximos da fronteira com um orçamento relativamente pequeno e foi descrita como tendo "redefinido o piso de custo". Técnicas para obter o mesmo desempenho ordens de grandeza mais barato — arquiteturas eficientes, mistura de especialistas (MoE), destilação (transferir o conhecimento de um modelo grande para um pequeno) e um trabalho cuidadoso de qualidade de dados — foram demonstradas uma após outra, abrindo uma brecha na fórmula "capital enorme = vitória". A atenção do setor está se ampliando de "simplesmente ficar maior" para "como entregar o mesmo desempenho mais barato e com menos energia".

Então o quadro preciso é este: "A corrida para atualizar o 'desempenho de pico' da fronteira é uma briga de dinheiro. Mas a corrida para entregar 'desempenho bom o suficiente' de forma barata é um embate de astúcia e eficiência." A maioria dos modelos que usamos no dia a dia se beneficia do segundo, ficando mais baratos, mais rápidos e mais eficientes em energia ano após ano. Como escrito em até onde dá para ir no plano gratuito, em 2026 até os planos gratuitos alcançaram um nível prático — fruta entregue aos usuários pelo refluxo da eficiência.

8. O que vem a seguir — a barreira de "energia e física" depois do dinheiro

Então dá para escalar para sempre só empilhando dinheiro? Não — e essa é a nova barreira que começou a surgir em 2026. Uma análise da Epoch AI (agosto de 2024) conclui que treinamentos de cerca de 2×10²⁹ FLOP provavelmente serão viáveis até 2030, mas que a restrição que deve pesar primeiro é a energia, seguida da capacidade de fabricar chips. O gargalo deixa de ser apenas "o orçamento para comprar GPUs." Em vez disso, o que bloqueia o caminho é —

  • Energia: você consegue fornecer continuamente eletricidade em escala de gigawatts em um único lugar? Agora um problema de usinas e redes elétricas
  • Interconexão: a largura de banda para sincronizar dezenas a centenas de milhares de GPUs sem latência. Há um teto físico para o que um único treinamento gigante consegue suportar
  • Dados: o texto de treinamento de alta qualidade está esgotando por si só (há um limite para quanto bom material a humanidade já produziu)

O que vem depois da "briga de dinheiro" é "uma briga de energia, física e astúcia." É por isso que as empresas estão agora migrando para investir em energia nuclear, desenvolver seus próprios chips dedicados, aproveitar dados sintéticos e pesquisar arquiteturas eficientes. A era em que se podia vencer jogando dinheiro está, ironicamente, virando uma era em que não dá para vencer só com dinheiro.

Resumo

A verdadeira natureza de um LLM é "um gigantesco dispositivo de previsão onde centenas de bilhões a mais de um trilhão de 'pesos' ficam calculando a probabilidade da próxima palavra." O Attention do Transformer cuida da "ponderação dependente do contexto", e o pré-treino (que consome a maior parte do poder de cálculo, da energia e do dinheiro) somado ao pós-treino (RLHF, treinamento de raciocínio) torna os botões inteligentes. A esperteza não é mágica — é um subproduto de treinar a "adivinhação da próxima palavra" ao extremo sobre uma enorme quantidade de texto.

Em energia: uma consulta é 0,24 Wh (mediana) pela medição própria do Google, uma consulta curta 0,42 Wh por uma estimativa de terceiros, e um prompt longo aos modelos mais pesados passa de 29 Wh (mais de 65 vezes o mais eficiente); só o treinamento do GPT-3 consumiu 1.287 MWh. Na sociedade como um todo, o consumo do lado da inferência se acumula, e a eletricidade dos data centers do mundo deve dobrar para cerca de 945 TWh até 2030 (AIE). "Fazer tudo no modelo mais potente" é um luxo em energia e em custo; o sensato é escolher o modelo pelo peso da tarefa.

E a pergunta central — "o desenvolvimento de LLMs é uma briga de dinheiro?". A resposta é "essencialmente verdade, limitado ao pré-treinamento da fronteira" (cerca de US$ 78 mi de computação para o GPT-4; mais de US$ 1 bi por treinamento projetado para 2027). Mas a contracorrente do "só dinheiro não vence" também é forte (o reset do piso de custo da DeepSeek, eficiência, destilação). Atualizar o desempenho máximo é briga de dinheiro; entregar desempenho prático barato é briga de engenhosidade — essa estrutura em duas camadas é a realidade de 2026. E o próximo é o muro físico de energia, interconexão e escassez de dados. Entender um LLM não como uma "caixa mágica", mas como uma "máquina probabilística movida a eletricidade", evita que você seja arrastado tanto pela euforia quanto pelo medo. Para saber mais, veja o que é um LLM (introdução), a janela de contexto e a comparação dos planos gratuitos.

FAQ

P. Mais parâmetros (pesos) significam sempre mais inteligência?
R. "Maior era mais inteligente" valeu quase universalmente outrora, mas em 2026 não é tão simples. Mesmo com a mesma contagem de parâmetros, o desempenho varia muito com a qualidade dos dados, o pós-treino e a engenhosidade arquitetônica. Modelos pequenos-mas-inteligentes (produtos de destilação e design eficiente) se multiplicaram, e "contagem de parâmetros = inteligência" já não se sustenta. Entramos numa era de "como é treinado" sobre "quantos".

P. Um LLM realmente "entende", ou é memorização mecânica?
R. Até os especialistas discordam — é uma pergunta difícil. O que é certo é que "ele mostra uma generalização que a memorização mecânica não consegue explicar" (resolve problemas que não estavam em seu treinamento). Se isso é "a mesma compreensão de significado que os humanos" é uma questão separada, sem resposta clara. Na prática, trate-o como "um dispositivo de previsão extremamente avançado que se comporta como se entendesse." É exatamente por isso que ele erra com tanta confiança (alucinação).

P. Posso construir meu próprio LLM?
R. "Classe de fronteira" é impossível para um indivíduo (precisa de centenas de milhões de dólares e dezenas de milhares de GPUs). Mas treinar um modelo pequeno, ou fazer fine-tuning de um modelo aberto existente, é viável até para indivíduos. Além disso, a maioria das necessidades práticas é atendida usando modelos existentes via API. Quase não há necessidade de "construir tudo você mesmo".

P. O consumo de energia da IA é um problema sério para o planeta?
R. É fato que a escala está se tornando não desprezível (a energia de data centers é cerca de 1,5% da mundial, projetada para dobrar até 2030) (IEA). Mas a eficiência também avança furiosamente em paralelo; a "energia por token" cai ano após ano. O problema é menos "a eficiência de uma consulta" do que "o crescimento explosivo do volume total × frequência." Quanto as renováveis, a nuclear e os chips dedicados conseguem compensar isso é o foco futuro.

P. No fim das contas, o que vale a pena saber como usuário?
R. Três coisas. (1) O modelo é um "preditor de probabilidades", então ele erra mesmo num tom confiante (verifique informações importantes). (2) Perguntas pesadas custam caro em energia e dinheiro, então escolha o modelo pelo peso da tarefa (tarefas leves para modelos leves). (3) "Desempenho de pico" é uma briga de dinheiro, mas "desempenho prático" fica mais barato e mais eficiente em energia a cada ano (esperar os modelos gratuitos/baratos evoluírem também é inteligente). Quanto mais você conhece o mecanismo, mais barato e habilmente consegue usar a IA.