Contenidos
- 1. Un LLM solo sigue adivinando "la siguiente palabra"
- 2. ¿Qué son los "pesos"? — Un billón de perillas crean la inteligencia
- 3. Dos etapas de aprendizaje — Preentrenamiento y postentrenamiento (RLHF)
- 4. Inferencia — El momento en que tu pregunta se convierte en electricidad
- 5. Energía — ¿Cuánta electricidad consume un LLM?
- 6. ¿Es cierto que "el desarrollo es una guerra de dinero"?
- 7. Pero el dinero solo no gana — La contracorriente de la eficiencia
- 8. Lo que viene — El muro de "energía y física" después del dinero
- Resumen
- Preguntas frecuentes
El cómputo invertido en entrenar GPT-4, lanzado en 2023, fue de aproximadamente 2,1×10²⁵ operaciones de coma flotante (FLOP) según el centro de investigación Epoch AI, y el Stanford HAI estimó el coste de ese cómputo en unos 78 millones de dólares. Incluso el entrenamiento del antiguo GPT-3 consumió unos 1.287 MWh de electricidad (estimación de investigadores de Google en 2021): más de un siglo de electricidad de un hogar medio para construir un solo modelo. Detrás del casual «oye, resume esto» que escribimos hay un mundo de física y de fajos de billetes.
Este artículo profundiza en "cómo funciona realmente un LLM (modelo de lenguaje grande)", desde tres direcciones: mecanismo, energía y dinero. En concreto: (1) por qué un LLM puede producir lenguaje a partir de un conjunto de perillas llamadas "pesos (parámetros)", (2) cuánta electricidad consume una pregunta o un entrenamiento, y (3) ¿es cierto que "el desarrollo de LLM de frontera es una guerra de dinero"? La respuesta corta a la tercera: "Para la frontera absoluta, es esencialmente cierto, pero en 2026 se ha fortalecido una contracorriente donde 'el dinero solo no gana'." Esa es la imagen precisa.
Mi postura de entrada: la "inteligencia" de un LLM no es ni magia ni conciencia, es el resultado de moldear a golpes una gigantesca máquina de predicción de probabilidades con electricidad. Entender el mecanismo disuelve tanto la exageración excesiva como el miedo excesivo. Este artículo entra en un nivel de profundidad intermedio. Si partes de "qué es siquiera un LLM", lee primero qué es un LLM (introducción); para la longitud de contexto consulta la ventana de contexto; para los precios consulta la API de IA para principiantes.
Diseccionando un LLM desde tres direcciones
— De qué está hecha la inteligencia, la energía que consume, el dinero que cuesta
La astucia de un LLM no es magia. Es el resultado de moldear a golpes una gigantesca máquina de probabilidades con energía y dinero.
Conoce el mecanismo y tanto la exageración como el miedo se disuelven.
1. Un LLM solo sigue adivinando "la siguiente palabra"
Puede sonar sorprendente, pero ChatGPT, Claude y Gemini hacen en esencia una sola cosa. "Dado el texto hasta ahora, calcular la probabilidad de la siguiente palabra más probable (más exactamente, 'token') como continuación, elegir una y alinearlas." Eso es todo. Dale "el gato está sobre la ___" y asigna probabilidades a candidatos como "alfombra", "silla" o "mesa" y emite la más alta (o una muestreada por probabilidad). Repite esto un token a la vez hasta que el texto termina.
Aquí está la pregunta que confunde a muchos. "¿Cómo puede un mero juego de adivinar palabras resumir artículos o escribir código?" La respuesta: "Para adivinar realmente la siguiente palabra con precisión, no tiene más remedio que 'entender' hasta cierto punto la estructura del mundo." Adivinar "la capital de Japón es ___" requiere geografía; "3 + 5 = ___" requiere aritmética; "la causa de este error es ___" requiere conocimiento de programación albergado internamente. Como subproducto de entrenar la "adivinación de la siguiente palabra" hasta el extremo sobre enormes cantidades de texto, emergen el conocimiento y el razonamiento. Esa es la naturaleza extraña y esencial de los LLM.
Entonces, ¿qué es lo que calcula esa "probabilidad de la siguiente palabra"? Como se adelantó, el protagonista es una pila asombrosa de números llamados "pesos (parámetros)". El siguiente capítulo revela qué son.
2. ¿Qué son los "pesos"? — Un billón de perillas crean la inteligencia
Para resumir el interior de un LLM en una analogía: "un gigantesco dispositivo de cómputo con desde cientos de miles de millones hasta más de un billón de 'perillas'." Cada perilla es un "peso (parámetro)", y cuando la señal de una palabra de entrada pasa a la siguiente capa, decide "qué señales reforzar o debilitar, y en qué medida". GPT-3 tenía unos 175.000 millones; se dice que los modelos de frontera más recientes superan el billón. La configuración de estas vastas perillas es exactamente lo que constituye el "conocimiento" aprendido del modelo.
Cómo los "pesos" se convierten en lenguaje
El "aprendizaje" es el trabajo de girar poco a poco ese billón de perillas hacia la respuesta correcta.
La configuración final de las perillas (pesos) = el "conocimiento" mismo del modelo.
El Transformer, que apareció en 2017, es la base de los LLM modernos. Su corazón es el mecanismo de "Attention", que juzga dinámicamente mediante pesos "qué palabra de la frase importa a la palabra actual". Que "banco" en "vi el río frente al banco" signifique una institución financiera o la orilla de un río se decide ponderando su relación con las demás palabras del contexto, y esta "ponderación dependiente del contexto" es exactamente por lo que un LLM puede devolver respuestas coherentes incluso a lo largo de pasajes extensos. Cuando la gente dice "algo sobre ponderación", se refiere precisamente a este Attention y a los billones de multiplicaciones que hay detrás.
El punto crucial: estos pesos no se fijaron a mano. Al principio son una masa de números aleatorios, sin significado. El significado se inculca mediante el "aprendizaje". Entonces, ¿cómo ocurre ese aprendizaje?
3. Dos etapas de aprendizaje — Preentrenamiento y postentrenamiento (RLHF)
El aprendizaje de un LLM se divide a grandes rasgos en dos etapas, el proceso por el cual las "perillas aleatorias" del capítulo anterior se convierten en "perillas inteligentes".
Etapa 1: Preentrenamiento. Aliméntalo con texto a escala de internet (libros, la web, código) y haz que "adivine la siguiente palabra" sin descanso. Cada vez que se equivoca, todos los parámetros se ajustan una cantidad mínima en la dirección que reduce el error (este algoritmo de ajuste es el famoso "retropropagación + descenso de gradiente"). Repite esto a lo largo de billones de tokens y los cimientos de la gramática, el conocimiento y el razonamiento quedan grabados en las perillas. El preentrenamiento consume la mayor parte del cómputo, la mayor parte de la energía y la mayor parte del dinero. Los astronómicos ~2×10²⁵ FLOPs de un modelo de clase GPT-4 se queman aquí.
Etapa 2: posentrenamiento (post-training). Un modelo solo preentrenado es «sabio pero maleducado». Por eso se le enseñan «formas útiles y seguras de responder» con RLHF (aprendizaje por refuerzo a partir de retroalimentación humana) y técnicas similares. Desde aproximadamente 2025, los laboratorios también se esfuerzan mucho en el posentrenamiento que entrena el razonamiento largo (pensar con calma), el uso de herramientas y el comportamiento agéntico. Que los modelos recientes «piensen antes de responder» es fruto de esta evolución del posentrenamiento. El comportamiento multiagente también se inculca aquí.
4. Inferencia — El momento en que tu pregunta se convierte en electricidad
Si el entrenamiento es "la obra de construcción que fija las perillas", entonces la inferencia es "la operación de producir respuestas usando realmente las perillas terminadas". Cada vez que escribes una pregunta en ChatGPT, billones de multiplicaciones recorren cerca de un billón de perillas y se generan tokens uno a uno. Hemos visto lo pesado que es el entrenamiento, pero a escala de toda la sociedad, es la inferencia, no el entrenamiento, lo que consume la energía.
La razón es simple: el entrenamiento se ejecuta básicamente una vez por modelo, pero la inferencia se ejecuta cientos de millones de veces al día en todo el mundo. A lo largo de la vida de un modelo, la demanda de energía y de cómputo se acumula mucho más en el lado de la inferencia que en el del entrenamiento. "Una pregunta es apenas electricidad", cierto, una sola es minúscula. Pero "minúsculo × cientos de millones × cada día" se acumula hasta convertirse en un problema energético a escala nacional. Veamos números concretos a continuación.
5. Energía — ¿Cuánta electricidad consume un LLM?
Se dice a menudo que "la IA consume energía", pero ¿cuánta exactamente? Aquí están las cifras representativas publicadas a fecha de 2026.
El consumo energético de un LLM en cifras
una pregunta corta
más de 65x el más eficiente
(una generación antigua)
previsión 2024→2030
Incluso una consulta corta (0,42Wh), escalada a 700 M/día, equivale a la electricidad de ~35.000 hogares de EE. UU. (estimación de terceros).
Los racks de centros de datos promedian menos de 8kW (encuesta de Uptime Institute 2024), mientras que un rack NVIDIA DGX GB200 para IA consume unos 120kW (documentación de NVIDIA); un solo centro de datos de IA va de menos de 50MW a más de 1GW (datos de seguimiento de Epoch AI).
Lo llamativo es que «el consumo eléctrico varía en órdenes de magnitud según el modelo y la longitud del prompt». En estimaciones de terceros (ver la tabla siguiente), muchos modelos gastan menos de 0,5 Wh en una pregunta corta, pero un prompt largo a los modelos que más consumen supera los 29 Wh, más de 65 veces los más eficientes. Como se comentó en la trampa de medir el trabajo por tokens consumidos, «hacerlo todo con el modelo más potente» es un lujo tanto en electricidad como en coste. Mandar las tareas ligeras a un modelo ligero es bueno para el planeta y para tu bolsillo. Según la Agencia Internacional de la Energía (AIE), el consumo eléctrico mundial de los centros de datos fue de unos 415 TWh en 2024 (alrededor del 1,5 % del total mundial) y se prevé que se duplique hasta unos 945 TWh en 2030, con la IA como principal motor de ese crecimiento.
La «electricidad por consulta» depende de quién la midió y cómo
Las cifras de «X Wh por consulta» se citan mucho, pero se obtienen de formas completamente distintas según la fuente. Conviene leer por separado las mediciones propias de las empresas y las estimaciones externas.
| Cifra | A qué se refiere | Fuente | Cómo se obtuvo |
|---|---|---|---|
| 0,24Wh | Un prompt de texto en la app Gemini (mediana) | Google (ago. 2025, artículo propio) | Medido en sus propios centros de datos, incluidas las máquinas en reposo y el consumo auxiliar del centro de datos |
| ~0,34Wh | Una consulta a ChatGPT (media) | Blog de Sam Altman, CEO de OpenAI (jun. 2025) | Cifra de la propia empresa; no se publicó el método |
| 0,42Wh | Un prompt corto a GPT-4o | Jegham et al. (terceros, 2025) | Estimado a partir del rendimiento público de la API y de configuraciones de hardware inferidas |
| 29Wh+ | Un prompt largo a los modelos que más consumen | Ídem | Ídem; más de 65 veces los modelos más eficientes |
Las mediciones de las empresas usan condiciones homogéneas, pero no se pueden verificar desde fuera; las estimaciones de terceros son más fáciles de comparar, pero se basan en más supuestos. Ambas son valores para una sola consulta de texto: leer documentos largos, generar imágenes o vídeo y las tareas largas de agentes consumen más.
Aplicarlo a tu propio uso da una idea de la escala. Si haces 50 preguntas cortas al día, 0,24–0,42 Wh × 50 da unos 12–21 Wh al día, más o menos lo que gasta una bombilla LED de 10 W encendida entre una y dos horas. En cambio, un solo prompt largo a un modelo pesado puede superar los 29 Wh. Lo que mueve la factura eléctrica no es tanto cuántas veces preguntas como qué modelo usas y cuánto le haces pensar.
6. ¿Es cierto que "el desarrollo es una guerra de dinero"?
Aquí está la pregunta que más te intrigaba. "¿Es el desarrollo de LLM de frontera una guerra de dinero?" La conclusión verificada primero: "Limitado al preentrenamiento de la frontera, es esencialmente cierto." Los números lo respaldan.
Trayectoria del coste de entrenamiento de frontera
El cómputo de entrenamiento de frontera crece 4–5x al año (Epoch AI).
El coste de entrenamiento sube 2,4x al año — una auténtica pelea de dinero.
En concreto, el AI Index 2024 del Stanford HAI estimó el coste de cómputo del entrenamiento en unos 78 millones de dólares para GPT-4 y unos 191 millones para Gemini Ultra de Google (AI Index 2024). Un artículo del centro de investigación Epoch AI concluye que el coste de entrenar los modelos más grandes ha crecido 2,4 veces al año desde 2016 y que, si la tendencia continúa, los mayores entrenamientos costarán más de 1.000 millones de dólares en 2027 (Cottier et al.). Y eso es «un intento exitoso»: detrás hay ensayo y error fallido, preparación de datos, salarios e infraestructura de inferencia. Además, cada GPU cuesta miles de dólares; tener decenas de miles funcionando durante meses dispara la factura eléctrica. Un muro de dinero que «una idea brillante» o «un algoritmo ingenioso» por sí solos nunca podrán saltar se alza a la entrada de la frontera. En este sentido, la «pelea de dinero» no es una exageración: es un hecho. Por eso solo un puñado que ha asegurado un capital enorme —OpenAI, Google, Anthropic, Meta, xAI— puede competir en primera línea.
7. Pero el dinero solo no gana — La contracorriente de la eficiencia
El capítulo anterior decía "la guerra de dinero es real". Pero terminar la historia ahí malinterpreta la realidad de 2026. No es en absoluto cierto que "con suficiente dinero ganas"; si acaso, se ha fortalecido una contracorriente. Como respuesta honesta, déjame escribir también esta otra cara.
El caso simbólico es la serie de movimientos en que la china DeepSeek lanzó modelos que se acercaban a la frontera con un presupuesto relativamente pequeño, y de la que se dijo que había «reiniciado el suelo de costes». Se han demostrado una tras otra técnicas para lograr el mismo rendimiento órdenes de magnitud más barato —arquitecturas eficientes, mezcla de expertos (MoE), destilación (trasladar el conocimiento de un modelo grande a uno pequeño) y un trabajo cuidadoso sobre la calidad de los datos—, que han abierto una brecha en la fórmula «capital enorme = victoria». La atención del sector se amplía de «hacerlo más grande» a «cómo ofrecer el mismo rendimiento más barato y con menos energía».
Así que la imagen precisa es esta: "La carrera por actualizar el 'rendimiento máximo' de la frontera es una guerra de dinero. Pero la carrera por ofrecer un 'rendimiento suficientemente bueno' de forma barata es un concurso de ingenio y eficiencia." La mayoría de los modelos que usamos a diario se benefician de lo segundo, volviéndose más baratos, más rápidos y más eficientes energéticamente año tras año. Como se escribe en hasta dónde puedes llegar con el plan gratuito, para 2026 incluso los planes gratuitos alcanzaron un nivel práctico, fruto entregado a los usuarios por la contracorriente de la eficiencia.
8. Lo que viene — El muro de "energía y física" después del dinero
Entonces, ¿se puede escalar para siempre con solo apilar dinero? No, y ese es el nuevo muro que comenzó a aparecer en 2026. Un análisis de Epoch AI (agosto de 2024) concluye que entrenamientos de unos 2×10²⁹ FLOP probablemente serán factibles para 2030, pero que la restricción que probablemente se impondrá primero es la energía, seguida de la capacidad de fabricar chips. El cuello de botella ya no es solo "el presupuesto para comprar GPU". En cambio, lo que bloquea el camino es:
- Energía: ¿puedes suministrar de forma continua electricidad a escala de gigavatios en un solo lugar? Ahora un problema de centrales eléctricas y redes
- Interconexión: el ancho de banda para sincronizar decenas o cientos de miles de GPU sin latencia. Hay un techo físico para lo que un solo entrenamiento gigante puede manejar
- Datos: el texto de entrenamiento de alta calidad se está agotando por sí mismo (hay un límite a cuánta buena escritura ha producido la humanidad)
Lo que viene después de "la guerra de dinero" es "una guerra de energía, física e ingenio". Por eso las empresas se están desplazando ahora hacia invertir en energía nuclear, desarrollar sus propios chips dedicados, aprovechar datos sintéticos e investigar arquitecturas eficientes. La era en la que podías ganar tirando dinero se está convirtiendo, irónicamente, en una era en la que no puedes ganar solo con dinero.
Resumen
La verdadera naturaleza de un LLM es "un gigantesco dispositivo de predicción donde desde cientos de miles de millones hasta más de un billón de 'pesos' siguen calculando la probabilidad de la siguiente palabra". El Attention del Transformer maneja la "ponderación dependiente del contexto", y el preentrenamiento (que consume la mayor parte del cómputo, la energía y el dinero) más el postentrenamiento (RLHF, entrenamiento de razonamiento) hacen inteligentes a las perillas. La astucia no es magia, es un subproducto de ejercitar la "adivinación de la siguiente palabra" hasta el extremo sobre enormes cantidades de texto.
En electricidad: una consulta son 0,24 Wh (mediana) según la medición propia de Google, una consulta corta 0,42 Wh según una estimación de terceros, y un prompt largo a los modelos más pesados supera los 29 Wh (más de 65 veces el más eficiente); solo el entrenamiento de GPT-3 consumió 1.287 MWh. En el conjunto de la sociedad, el consumo de la inferencia se acumula, y se prevé que la electricidad de los centros de datos del mundo se duplique hasta unos 945 TWh en 2030 (AIE). «Hacerlo todo con el modelo más potente» es un lujo en electricidad y en coste; lo sensato es elegir el modelo según el peso de la tarea.
Y la pregunta central: «¿Es el desarrollo de LLM una pelea de dinero?». La respuesta es «esencialmente cierto, limitado al preentrenamiento de la frontera» (unos 78 M$ de cómputo para GPT-4; más de 1.000 M$ por entrenamiento previstos para 2027). Pero la contracorriente de «el dinero solo no basta para ganar» también es fuerte (el reinicio del suelo de costes de DeepSeek, la eficiencia, la destilación). Actualizar el rendimiento máximo es una pelea de dinero; ofrecer un rendimiento práctico a bajo coste es una pelea de ingenio: esta estructura de dos capas es la realidad de 2026. Y lo siguiente es el muro físico de la energía, la interconexión y la escasez de datos. Entender un LLM no como una «caja mágica», sino como una «máquina probabilística que funciona con electricidad», evita dejarse arrastrar tanto por la euforia como por el miedo. Para saber más, consulta qué es un LLM (introducción), la ventana de contexto y la comparativa de planes gratuitos.
Preguntas frecuentes
P. ¿Más parámetros (pesos) significan siempre más inteligencia?
R. "Más grande era más inteligente" se cumplía casi universalmente en su momento, pero en 2026 no es tan simple. Incluso con el mismo número de parámetros, el rendimiento varía mucho según la calidad de los datos, el postentrenamiento y el ingenio arquitectónico. Los modelos pequeños pero inteligentes (productos de la destilación y el diseño eficiente) se han multiplicado, y "número de parámetros = inteligencia" ya no se sostiene. Hemos entrado en una era de "cómo se entrena" por encima de "cuántos".
P. ¿Un LLM realmente "entiende", o es memorización mecánica?
R. Incluso los expertos no se ponen de acuerdo, es una pregunta difícil. Lo cierto es que "muestra una generalización que la memorización mecánica no puede explicar" (resuelve problemas que no estaban en su entrenamiento). Si eso es "la misma comprensión de significado que los humanos" es una cuestión aparte sin respuesta clara. En la práctica, trátalo como "un dispositivo de predicción extremadamente avanzado que se comporta como si entendiera". Por eso precisamente se equivoca con tanta seguridad (alucinación).
P. ¿Puedo construir mi propio LLM?
R. "De clase frontera" es imposible para un individuo (requiere cientos de millones de dólares y decenas de miles de GPU). Pero entrenar un modelo pequeño, o ajustar finamente (fine-tuning) un modelo abierto existente, es factible incluso para individuos. Además, la mayoría de las necesidades prácticas se satisfacen usando modelos existentes a través de la API. Casi no hay necesidad de "construirlo todo uno mismo".
P. ¿Es el consumo energético de la IA un problema serio para el planeta?
R. Es un hecho que la escala se está volviendo no despreciable (la energía de los centros de datos es alrededor del 1,5% de la mundial, con proyección de duplicarse para 2030) (IEA). Pero la eficiencia también avanza furiosamente en paralelo; "la energía por token" baja año tras año. El problema es menos "la eficiencia de una consulta" que "el crecimiento explosivo del volumen total × frecuencia". Cuánto puedan compensar eso las renovables, la energía nuclear y los chips dedicados es el foco del futuro.
P. Al final, ¿qué vale la pena saber como usuario?
R. Tres cosas. (1) El modelo es un "predictor de probabilidades", así que se equivoca incluso en un tono seguro (verifica la información importante). (2) Las preguntas pesadas cuestan en energía y dinero, así que elige el modelo según el peso de la tarea (encargos ligeros a modelos ligeros). (3) El "rendimiento máximo" es una guerra de dinero, pero el "rendimiento práctico" se vuelve más barato y eficiente energéticamente cada año (esperar a que evolucionen los modelos gratuitos/baratos también es inteligente). Cuanto más conozcas el mecanismo, más barata e inteligentemente podrás usar la IA.