En 2023, una ventana de contexto de 32K tokens parecía "amplia". Hoy, una ventana de la clase de 1 millón de tokens (1M) se da por hecha en los modelos de gama alta. A septiembre de 2026, Anthropic, OpenAI y Google publican en las especificaciones oficiales de sus modelos superiores un límite de entrada de alrededor de un millón de tokens. Los nombres y cifras concretos cambian con cada lanzamiento, así que los dejo en manos de la lista de modelos actuales y fechas de corte y de las páginas oficiales de cada proveedor. Este artículo se centra en lo que sobrevive a un cambio de generación: cómo leer los números y cómo trabajar con ellos.

"Un millón de tokens" equivale aproximadamente a entre 8 y 10 libros de bolsillo en inglés, o decenas de miles de líneas de código fuente. Ahora podemos mantener todo eso "a la vista" dentro de una sola sesión. Pero que un documento quepa en el contenedor no significa que el modelo lo lea entero. Las puntuaciones que OpenAI publica en su benchmark multi-aguja de contexto largo (MRCR) muestran que un mismo modelo puntúa menos cuanto más larga es la entrada, y cuánto baja varía mucho según el modelo y la generación (lo vemos en §1 y §4).

Adelanto mi opinión: la época de elegir un modelo solo por el tamaño del contenedor ha terminado. Lo que importa es el trío "contexto efectivo × coste × forma de alimentarlo". Este artículo recorre qué es realmente el contexto, cómo leer una ficha técnica, por qué el tamaño no basta, cómo medir el rango efectivo en tu propio caso de uso, cómo se disparan los precios con entradas largas y cinco tácticas de ahorro que desarrolladores en solitario y equipos pequeños pueden aplicar hoy, con cifras oficiales y datos de benchmarks publicados.

CONTEXT WINDOW · 2023→2026

En tres años, el contenedor creció 250 veces

— Cronología de cómo 1M pasó de lujo a punto de partida

2023
4K–200K
GPT-3.5 y el primer GPT-4 tenían 4K–32K: un solo artículo científico la llenaba. En noviembre, Claude 2.1 llegó a 200K.
2024
128K–2M
GPT-4 Turbo (128K) y Claude 3 (200K) se volvieron lo normal. En junio, Gemini 1.5 Pro abrió 2M a los desarrolladores.
2025
1M se extiende
GPT-4.1 en abril y Claude Sonnet 4 (beta) en agosto pasaron a admitir 1M.
2026
1M = estándar
Los modelos superiores de Claude, GPT y Gemini están todos en la clase de 1M tokens (a septiembre).

Pero "compatible" y "leído hasta el final" no son lo mismo. En MRCR (8 agujas), el benchmark de contexto largo de OpenAI, GPT-5.5 pasa del 98,1% en 4K–8K al 74,0% en 512K–1M.
Cuánto cae depende del modelo y la generación (tabla de evaluación de "Introducing GPT-5.5" de OpenAI, 23 de abril de 2026; detalles en §1 y §4).

1. El soporte de 1M ya es general, pero "leer hasta el final" es otra cosa

El soporte de 1M se extendió rápido en los dos últimos años. En abril de 2025, GPT-4.1 de OpenAI salió con unos 1,05 millones de tokens; en agosto de 2025, Claude Sonnet 4 de Anthropic llegó a 1 millón (en beta), y a septiembre de 2026 los modelos superiores de Anthropic, OpenAI y Google publican alrededor de un millón de tokens en sus especificaciones oficiales. En 2023, 32K parecía amplio: son más de 30 veces en solo tres años. La carrera por el tamaño del contenedor parecía terminada.

Pero si miras las puntuaciones de contexto largo que publican los propios fabricantes, el panorama se complica. El benchmark con resultados completos por longitud es MRCR v2 (8 agujas) de OpenAI. Esconde ocho peticiones del mismo tipo —por ejemplo, "escribe un poema sobre tapires"— dentro de una conversación larga con una IA y luego pide exactamente una de ellas, como "devuelve el 2.º poema". Como el modelo tiene que distinguir elementos casi idénticos, incluido su orden, es una prueba de needle-in-a-haystack multi-aguja. La puntuación mide cuánto se parece el texto devuelto al correcto. Estos son los resultados por longitud:

  • GPT-5.5: 98,1% en 4K–8K, 87,5% en 128K–256K y 74,0% en 512K–1M
  • GPT-5.4 (la generación anterior, en la misma tabla): 97,3% → 79,3% → 36,6% en esas mismas tres franjas
  • Claude Opus 4.7 (cifras que OpenAI incluyó en la misma tabla): 59,2% en 128K–256K y 32,2% en 512K–1M
  • GPT-6 Astra (anunciado en septiembre de 2026): 100,0% en 256K–512K y 96,3% en 512K–1M (GPT-5.6 Sol, en la misma tabla: 91,5% y 73,8%)

Fuentes (consultadas el 26 de septiembre de 2026): tablas de evaluación de "Introducing GPT-5.5" (23 de abril de 2026) y "GPT-6 Astra" (3 de septiembre de 2026), de OpenAI. Cómo funciona el benchmark: descripción del conjunto de datos OpenAI MRCR. Los nombres de los modelos son los de cada anuncio.

Destacan dos cosas. La primera: un mismo modelo puntúa menos cuanto más larga es la entrada. La segunda: lo pronunciada que es la caída varía mucho según el modelo y la generación; en la franja más cercana a 1M, GPT-5.4 bajó del 40%, mientras que GPT-6 Astra, anunciado en septiembre de 2026, se mantuvo por encima del 90%. La clasificación cambia con cada generación, así que estas cifras caducan pronto. Lo que perdura es la lección: el límite anunciado y el rango donde la precisión se mantiene de verdad son dos números distintos.

No lo malinterpretes. No se trata de que "Claude o GPT sean malos". Los casos de uso que de verdad necesitan todo el 1M son menos de lo que parece. Si un modelo lee de forma estable hasta 300K (unos 2–3 libros), casi cualquier tarea de programación, investigación o resumen cabe. El problema es elegir solo por la cifra "compatible con 1M": así acabas con criterios de decisión equivocados.

2. ¿Qué es el contexto? — Separa el contenedor de su contenido

Terminología rápida. En este ámbito tres palabras se mezclan.

Tres términos

Token, Ventana, Contexto

① TOKEN — Unidad de texto
La unidad mínima con la que la IA procesa texto. ~4 caracteres en inglés por token (o ~0,75 palabras); en idiomas CJK, alrededor de 1 a 1,5 tokens por carácter.
② VENTANA — Tamaño del contenedor
El número máximo de tokens que un modelo puede manejar en un solo intercambio. Suma de entrada y salida (incluido el razonamiento). En la API, si la entrada por sí sola lo supera, devuelve un error; las apps de chat y los agentes suelen hacer sitio resumiendo o eliminando las partes antiguas.
③ CONTEXTO — El contenido
Lo que está cargado actualmente en la ventana. Incluye el prompt de sistema, el historial de la conversación, los adjuntos y las salidas de herramientas: todo ello.

En resumen: "ventana = tamaño del contenedor", "contexto = contenido", "token = unidad".
Un contenedor grande con un contenido desordenado seguirá dándote respuestas desordenadas.

Además: no confundas "contexto" con "memoria". El contexto vive dentro de la sesión: cierras el chat y desaparece. Funciones como ChatGPT Memory o Claude Memory son, en cambio, un mecanismo de retención entre sesiones distinto. El contenido de la memoria acaba inyectándose en la ventana de contexto, pero desde el punto de vista del usuario es almacenamiento persistente frente a espacio de trabajo efímero.

Error común: "Una ventana de contexto más grande = una IA más inteligente" es falso. El tamaño de la ventana es solo el límite superior de lo que puede estar a la vista. La capacidad de razonamiento, la profundidad del conocimiento y la precisión al seguir instrucciones se miden por separado. Cada lanzamiento de modelo abre con "¡1M de contexto!" como titular, pero esa es solo una faceta de la capacidad.

3. El tamaño del contenedor se lee con tres números

Al mirar la ficha técnica de un modelo, en lo relativo al contexto solo hay que revisar tres cosas. Con esto claro, puedes comparar cualquier modelo con el mismo procedimiento.

① Límite de entrada

Es el número más visible del catálogo. Pero indica lo que cabe, no lo que de verdad se lee: como veremos en el capítulo siguiente, la cifra efectiva queda muy por debajo.

② Límite de salida

Se pasa por alto a menudo, pero es un orden de magnitud menor que el límite de entrada. Incluso en los principales modelos a septiembre de 2026, puedes enviar 1 millón de tokens pero solo recibir unos 65K–128K. En tareas como "reescribe entero este documento largo", este es el límite con el que chocas primero.

③ Modelo de tarificación

Tarifa plana en toda la ventana, o un umbral a partir del cual el precio unitario se dispara. Es lo que más pesa en producción y, precisamente, lo que más falta en las fichas técnicas. En el §5 lo calculamos.

A continuación, las cifras de las páginas oficiales de cada proveedor a 29 de septiembre de 2026. Los números cambian con cada generación, así que léelo como un ejemplo práctico de cómo los tres ejes anteriores se traducen en diferencias reales. Para los nombres concretos de hoy, consulta la lista de modelos actuales y fechas de corte; para las cifras, las páginas oficiales de cada proveedor.

Familia (ejemplos a sept. de 2026)Límite de entradaLímite de salidaPrecio con entradas largas
Anthropic, gama alta (Claude Fable 5.1, Opus 5.5, Sonnet 5.5)1.000.000128.000La misma tarifa hasta el límite
Anthropic, ligero (Claude Haiku 4.5)200.00064.000—
OpenAI (GPT-6 Astra, Sol)1.050.000128.000Entradas de más de 272K: toda la solicitud a 2x en entrada y 1,5x en salida
Google (Gemini 3.1 Pro, preview)1.048.57665.536Por encima de 200K: entrada 2 $→4 $, salida 12 $→18 $

Fuentes (consultadas el 29 de septiembre de 2026): Anthropic Models overview y Pricing / páginas de modelo de OpenAI para GPT-6 Astra y GPT-6 Sol / Google Gemini 3.1 Pro Preview y Gemini API pricing

En la tabla, los límites de entrada son casi idénticos entre proveedores; las diferencias están en los límites de salida y la forma del precio. Si los límites coinciden, el tamaño de la ventana deja de ser un motivo para elegir. Lo que sí cambia: Anthropic mantiene la misma tarifa hasta el límite, mientras que OpenAI y Google la suben a partir de cierta longitud. Con la misma etiqueta "compatible con 1M", la libertad con la que puedes enviar entradas largas es distinta. No es un simple detalle de precios: refleja enfoques diferentes ante las cargas de contexto largo. El capítulo de costes hace las cuentas.

En la práctica, la elección funciona así. Decide según el tamaño de los documentos que manejas habitualmente. Si caben por debajo de unos 200K, elige por la estabilidad de la precisión en esa franja y por si te mantienes por debajo de un umbral de precio, no por el tamaño de la ventana. Solo si trabajas a diario con documentos enormes de más de 300K pasan a ser decisivos la amplitud del rango efectivo y la tarifa para entradas largas. No te cases con un solo modelo: repártelos por caso de uso. Esta forma de decidir sirve sea cual sea la generación vigente.

Dónde comprobar los límites

Comprueba las cifras en las páginas oficiales de cada proveedor, no en webs recopilatorias ni en tablas de artículos (esta incluida). Dónde mirar es bastante constante:

  • Anthropic: la tabla comparativa de la página de resumen de modelos tiene las filas "Context window" y "Max output". El precio para entradas largas está en la sección "Long context pricing" de la página de precios
  • OpenAI: la página de cada modelo en la documentación de la API indica "context window" y "max output tokens", además de una nota sobre el precio de los prompts largos
  • Google: la página del modelo en la Gemini API indica "Input token limit" y "Output token limit", y la página de precios tiene un tramo "prompts > 200k tokens"

Otra cosa fácil de pasar por alto: un mismo límite admite cantidades de texto distintas según el modelo. Los límites se cuentan en tokens, así que cuando cambia el tokenizador (el sistema que divide el texto en tokens), cambia también el número de tokens de un mismo documento (ver la nota de §5). Al cambiar de modelo, vuelve a contar con tus propios documentos para confirmar que sigues teniendo margen.

4. Tres razones por las que "más grande es mejor" no se sostiene

La tabla del capítulo anterior solo muestra el tamaño físico del contenedor. ¿Aprovecha de verdad el modelo el contenedor que anuncia? En resumen: no des por hecho que lee con la misma precisión hasta el límite. Hay tres razones.

Razón ①: Lost in the Middle

Es el fenómeno que investigadores de Stanford y otras instituciones (Liu et al.) describieron en 2023 en el artículo "Lost in the Middle". En tareas como buscar una respuesta entre varios documentos, los modelos acertaban más cuando la respuesta estaba al principio o al final de la entrada y perdían bastante precisión cuando estaba en el medio; incluso los modelos diseñados para contexto largo mostraban el mismo patrón.

En la práctica se nota así: "Pegas un PDF largo entero, preguntas '¿Cuál es la cifra de X?' y confunde un número justo por la mitad." Eso es Lost in the Middle. La gravedad varía según el modelo, pero lo prudente es asumir que la información situada en medio del documento se pierde con más facilidad y ajustar cómo se la entregas.

Razón ②: Context Rot

Cuanto más se alarga una conversación, más se diluyen las instrucciones iniciales. Pediste un tono formal al principio y, 20 turnos después, el modelo ha vuelto a un tono informal: eso es Context Rot.

Dos causas. ① Las instrucciones iniciales pasan a tratarse como relativamente antiguas y ligeras dentro del historial. ② El historial largo dispersa la atención y dificulta referirse a tokens concretos. En su documentación para desarrolladores, Anthropic llama "context rot" a la caída de precisión y de recuerdo a medida que crece el número de tokens, y escribe que elegir qué entra en el contexto importa tanto como cuánto cabe. En septiembre de 2025 explicó cómo abordar el problema como una habilidad deliberada en un artículo técnico titulado "Effective context engineering for AI agents".

Razón ③: Contexto anunciado ≠ Contexto efectivo

Si tomamos de las cifras de §1 solo la franja más cercana a 1M (512K–1M), queda así. Todas salen de las tablas de evaluación de los anuncios de OpenAI y usan el mismo benchmark, OpenAI MRCR v2 (8 agujas).

OpenAI MRCR v2 (8 agujas) × 512K–1M

Cerca de 1M, ¿devuelve el modelo justo el elemento pedido?

GPT-6 Astra sept. 2026 96,3%
GPT-5.5 abr. 2026 74,0%
GPT-5.6 Sol sept. 2026 73,8%
GPT-5.4 abr. 2026 36,6%
Claude Opus 4.7 abr. 2026 · tabla de OpenAI 32,2%

Fuentes: tablas de evaluación de "Introducing GPT-5.5" (23 de abril de 2026; GPT-5.5, GPT-5.4, Claude Opus 4.7) y "GPT-6 Astra" (3 de septiembre de 2026; GPT-6 Astra, GPT-5.6 Sol), de OpenAI. Los nombres de los modelos son los de cada anuncio.
En la franja corta de la misma tabla (4K–8K), GPT-5.5 obtuvo un 98,1% y GPT-5.4 un 97,3%. Son cifras que OpenAI publicó en sus propios anuncios, no mediciones de terceros.

Esto no significa que "los modelos con puntuación baja sean malos". En la franja corta de la misma tabla, GPT-5.5 y GPT-5.4 superan ambos el 97%, y la mayor parte del trabajo real —revisión de código, redacción larga, resúmenes de actas, síntesis de investigación— termina mucho antes de 1M. El problema es el enfoque de "tiene 1M, así que le meto 1M". Ten en cuenta, además, que son cifras que OpenAI publicó en sus propios anuncios, y solo son comparables dentro de una misma tabla. Google también recoge resultados de MRCR v2 (8 agujas) en la ficha del modelo Gemini 3.1 Pro (febrero de 2026) —84,9% en 128K (media) frente a 26,3% en 1M—, pero divide las longitudes de otra forma, así que no está entre las barras de arriba. Las páginas de anuncio de Anthropic para Claude Opus 5.5 y sus otros modelos actuales no incluyen puntuaciones de este tipo por longitud. Para saber de qué es capaz el modelo que usas hoy, compruébalo en tu propio caso de uso con el método siguiente.

Mide el "rango efectivo" en tu propio caso de uso

Las cifras de los benchmarks salen de tipos de documento y formas de preguntar distintos de los tuyos. Lo más fiable es montar un pequeño needle-in-a-haystack con tus propios documentos.

  1. Toma el tipo de documento que usas de verdad (código, actas, contratos, etc.) y coloca 3–5 datos con respuesta clara al principio, en medio y al final (también sirven datos que ya estén en el documento)
  2. Pide que "los enumere todos e indique dónde aparece cada uno", para que tenga que recuperar varios datos a la vez. Preguntar por uno solo hace que el modelo parezca mejor de lo que es (la diferencia entre una aguja y varias)
  3. Repite la misma pregunta con longitudes distintas —por ejemplo 50K, 200K y 500K— y anota la longitud en la que las respuestas empiezan a fallar
  4. Incluye preguntas que combinen datos, no solo que los recuperen ("compara A y B"). Las preguntas que exigen síntesis suelen fallar antes

Justo por debajo de la longitud donde empiezan los fallos está el "contexto efectivo" de ese modelo para ese caso de uso. Vuelve a medir cuando cambies de modelo. Lleva unas decenas de minutos y orienta las decisiones reales mejor que cualquier cifra de la ficha técnica.

5. La trampa del coste — Modelos cuya tarifa se dispara con entradas largas y modelos cuya tarifa no cambia

El capítulo anterior decía que el rango efectivo queda por debajo del límite. A eso se suma una segunda trampa: enviar entradas largas puede disparar el precio. Cada proveedor lo ha diseñado de forma distinta.

Modelo (a sept. de 2026)Tarifa estándar (entrada / salida, por 1M de tokens)Entradas largas
Claude Opus 5.54 $ / 20 $Misma tarifa en todo el 1M
GPT-6 Sol2 $ / 10 $Entradas de más de 272K: toda la solicitud a 2x en entrada y 1,5x en salida
GPT-6 Astra10 $ / 50 $Igual que el anterior
Gemini 3.1 Pro (preview)2 $ / 12 $Por encima de 200K: entrada 4 $, salida 18 $

Hagamos las cuentas. Supongamos que envías un documento de 500K tokens y recibes una respuesta de 50K: el caso típico de "resumir de una vez un gran repositorio de código o un informe anual".

  • Claude Opus 5.5 (tarifa plana): 4 $ × 0,5 + 20 $ × 0,05 = 3,00 $
  • GPT-6 Sol (recargo por encima de 272K): 4 $ × 0,5 + 15 $ × 0,05 = 2,75 $ (1,50 $ sin el recargo)
  • Gemini 3.1 Pro (tarifa por encima de 200K): 4 $ × 0,5 + 18 $ × 0,05 = 2,90 $ (1,60 $ con la tarifa de hasta 200K)
  • GPT-6 Astra (recargo por encima de 272K): 20 $ × 0,5 + 75 $ × 0,05 = 13,75 $

Hay dos lecturas. Primera: en cuanto cruzas el umbral, el mismo modelo cuesta unas 1,8 veces más. GPT-6 Sol cuesta la mitad que Claude Opus 5.5 con entradas cortas, pero a 500K la diferencia casi desaparece: cuál es "más barato" se invierte según la longitud de la entrada. Segunda: cuando el recargo se suma a un modelo insignia de precio alto, el coste cambia de escala (GPT-6 Astra sale a más de 4 veces lo de Opus 5.5). Recalcula con los modelos que comparas y tu longitud de entrada habitual antes de elegir.

Con precios por umbral, divide el trabajo que se pueda dividir para que cada parte quede por debajo del umbral. Si envías los 500K como dos solicitudes de 250K, GPT-6 Sol no aplica recargo: 1,50 $ en total (aunque no sirve para tareas que necesitan verlo todo a la vez). Es la misma estructura que traté en "Ahorro de coste en tokens y sesiones de IA".

Nota: un mismo documento puede tener un número de tokens distinto en otro modelo. Los límites y los precios se cuentan en tokens, así que un tokenizador nuevo cambia tanto el coste de un documento como el margen disponible. En su resumen oficial de modelos, Anthropic indica que con el tokenizador actual, usado desde Claude Opus 4.7, 1M de tokens equivale a unas 555.000 palabras, frente a unas 750.000 en los modelos anteriores: aproximadamente 1,35 veces más tokens para el mismo texto en inglés. Aunque la tarifa por token no cambie, compara las facturas reales tras cambiar de modelo.

6. Cinco tácticas de ahorro — Ordenadas por impacto real para devs en solitario

"El contenedor es de 1M, pero lo efectivo termina bastante antes, y usarlo a fondo sale caro". Eso ya lo hemos cubierto. Entonces, ¿qué puedes hacer realmente sobre el terreno? Aquí van cinco tácticas que uso día a día, ordenadas por la que da mayor rendimiento.

Cinco consejos prácticos

Ahorro de contexto — Orden de prioridad

① Corta la sesión
Cuando cambia el tema, abre un chat nuevo. Solo con impedir que el contexto antiguo se arrastre eliminas el Context Rot. En Claude Code, usa /compact o inicia una sesión nueva.
② Envía extractos, no textos completos
Pegar un PDF de 100 páginas entero es la peor jugada. Usa grep / búsqueda para extraer las secciones relevantes, comprime a 3–5 páginas y luego envía. La mentalidad RAG, aplicada en solitario.
③ Repite las instrucciones clave al final
Contramedida frente a Lost-in-the-Middle. Reitera la regla del principio en una línea al final: "Dado lo anterior, devuelve la salida con el formato X".
④ Prompt Caching
Si reutilizas el mismo prompt de sistema o el mismo material, la caché de prompts de Anthropic/OpenAI deja la tarifa de entrada de la parte leída de caché en un 10% de la base o menos (precios oficiales a septiembre de 2026). Si usas la API, configúralo lo primero.
⑤ Haz explícitas las direcciones de archivo
Especificar "archivo N, línea X" mejora la precisión de recuperación en contextos largos. Piénsalo como entregarle a la IA un índice con entradas indexadas.

De las cinco, la táctica ① "Corta la sesión" da la mayor mejora visible. Solo con cortar el chat se reducen notablemente las alucinaciones.
La táctica ④ es para desarrolladores de API: las interfaces (claude.ai / ChatGPT) gestionan la caché automáticamente.

Mi mejor práctica personal: solo con aplicar ① y ② de forma consistente, la precisión percibida cambia notablemente. Incluso con Claude Code, en lugar de empujar una única sesión larga, pulsar /compact o iniciar una sesión nueva en cada cambio de tema mantiene estable la calidad del resultado final.

Resumen

Los puntos clave de este artículo:

  • Ventana de contexto = el número máximo de tokens que una IA puede manejar en un intercambio. El tamaño del contenedor
  • A septiembre de 2026, los modelos superiores de Anthropic, OpenAI y Google están todos en la clase de 1M tokens. Los límites de entrada apenas difieren; las diferencias están en los límites de salida y en el precio de las entradas largas
  • El límite anunciado y el rango efectivo son cosas distintas. En MRCR (8 agujas), el benchmark multi-aguja que publica OpenAI, un mismo modelo puntúa menos cuanto más larga es la entrada, y cerca de 1M las cifras iban del 32,2% de Claude Opus 4.7 (en la tabla de OpenAI) al 96,3% de GPT-6 Astra
  • La forma más fiable de encontrar el rango efectivo es repartir datos por tus propios documentos y probar con distintas longitudes. Vuelve a medir al cambiar de modelo
  • El precio de las entradas largas tiene dos formas: la misma tarifa hasta el límite (Anthropic) o un recargo a partir de un umbral (272K en OpenAI, 200K en Google). Cuál es más barato se invierte según la longitud de la entrada
  • El ahorro se resume en cinco movimientos: cortar sesiones, enviar extractos, repetir instrucciones al final, usar caché y explicitar direcciones; ① y ② son los que más cuentan

El contenedor creció, pero lo que hacemos en realidad sigue siendo elegir qué entregar y qué dejar fuera. La habilidad clave con la IA ya no es "la capacidad de meterlo todo". Es el criterio para entregar exactamente lo necesario, y bien: una habilidad que sigue sirviendo por muchas generaciones de modelos que pasen. Esa es mi conclusión ahora que 1M se ha vuelto lo normal.

Preguntas frecuentes

P1. ¿Cómo puedo medir el número de tokens de antemano?

OpenAI tiene la biblioteca tiktoken, y la API de Anthropic tiene una función de recuento de tokens (token counting). Como referencia aproximada: 1 carácter japonés ≈ 1–1,5 tokens, 1 palabra en inglés ≈ 1,3–1,8 tokens, aunque cambia con la generación del tokenizador (ver la nota de §5). El código también varía mucho según el tipo, así que lo prudente es medir antes de enviar una entrada larga.

P2. ¿En qué se diferencia la "memoria" del contexto?

El contexto vive solo dentro de la sesión: cierras el chat y desaparece. La memoria (ChatGPT Memory / Claude Memory) es un mecanismo distinto de retención entre sesiones. El contenido de la memoria acaba inyectándose en la ventana de contexto, pero desde el punto de vista del usuario es persistente frente a efímero.

P3. ¿Cómo se relaciona RAG con la ventana de contexto?

RAG es el patrón de "traer dinámicamente al contexto solo la información necesaria". Incluso con una ventana de 1M, volcarlo todo lo vuelve lento, pesado y caro, así que recuperar y luego cargar (RAG) sigue siendo el enfoque dominante. Más en Qué es RAG.

P4. ¿Por qué cae la precisión mucho antes de llenar una ventana de 1M?

Se suman varios factores: el desajuste entre las longitudes de secuencia más vistas en el entrenamiento y las usadas en la inferencia, los límites de la codificación posicional del mecanismo de atención y el fuerte aumento del cómputo necesario para combinar varias piezas de información. "Compatible" y "preciso en toda la ventana" son problemas distintos. Dónde empieza la caída depende del modelo y de la tarea, así que lo fiable es medirlo con tus propios documentos usando el método de §4.

P5. ¿Los servidores MCP ahorran contexto?

Sí. MCP es un mecanismo de obtención bajo demanda mediante herramientas, así que no necesitas cargar todo en el contexto desde el principio. Cambia el modelo mental de "pegar el archivo entero" a "deja que vaya a leer el archivo".

P6. ¿Cómo divido o resumo un documento demasiado largo para el rango efectivo?

Decide según el objetivo. ① Si quieres un resumen del conjunto, resume primero cada capítulo y luego combina esos resúmenes en una segunda pasada. ② Si buscas una respuesta concreta, no envíes el texto completo: extrae solo las partes relevantes con búsqueda (RAG). ③ Solo cuando necesites comparar a lo largo de todo el documento conviene enviarlo de una vez, con una longitud que quepa en el rango efectivo. Al dividir, corta por encabezados y solapa unos párrafos a cada lado para que el hilo no se rompa en las juntas.