Contenidos
- 1. Por qué tu factura de IA se infla en silencio
- 2. Desglose del coste — entrada, salida, caché y batch
- 3. Elección de plan y su impacto en el ahorro
- 4. Prompt caching — la palanca que más rinde
- 5. Gestión del contexto — /compact y división
- 6. Selección de modelo — enrutamiento por tarea
- 7. Gestionar tu presupuesto de salida
- 8. Procesamiento por lotes — mitad de precio para lo que puede esperar
- 9. La trampa multiagente — 15× tokens
- 10. Monitorización y alertas de facturación
- 11. Siete patrones de despilfarro habituales
- Resumen
- FAQ
- Correcciones a la versión anterior
Actualizado el 26 de septiembre de 2026: hemos retirado las cifras del título y del gráfico inicial —«comprimir al 20-30 % del coste sin optimizar», «-60 a 90 % con la caché», «de 30 000 $/mes a 6 000-9 000 $», «ocho de cada diez trabajos van bien con un modelo más barato»— porque no podíamos indicar su fuente. En su lugar hay ejemplos que se pueden calcular con los precios unitarios y multiplicadores de las páginas oficiales de precios de Anthropic y OpenAI, con la fórmula a la vista. También corregimos el punto de equilibrio de la caché (con 5 minutos basta una lectura; con 1 hora, dos) y el precio de la salida (5× la entrada), y añadimos un capítulo sobre el procesamiento por lotes. Los cambios están resumidos al final del artículo.
Si pasas de una tarifa plana como ChatGPT Plus (20 $ al mes) a la facturación por token —Claude Code con clave de API, o una app de IA hecha por ti—, tu factura puede cambiar de orden de magnitud según cómo la uses. La facturación por uso no tiene techo.
La buena noticia es que las medidas que más pesan se reducen a tres: prompt caching, elección de modelo y presupuesto de salida. El efecto de cada una lo fijan multiplicadores publicados en las listas de precios oficiales, así que puedes calcularlo para tu propio uso. Este artículo recorre esos multiplicadores y cómo hacer las cuentas a partir de la documentación oficial de Anthropic y OpenAI.
El ahorro se calcula con los precios oficiales
— según las listas de precios oficiales de Anthropic y OpenAI a 26 de septiembre de 2026
Ejemplo: envía a Opus 5.5 el mismo prefijo de 100 000 tokens diez veces, con menos de 5 minutos entre una y otra, y el coste de entrada pasa de 4,00 $ sin caché a 0,68 $ con la caché de 5 minutos (una escritura, 0,50 $, más nueve lecturas, 0,18 $).
Lo que puede esperar cuesta la mitad, en entrada y en salida, con la API de lotes, y los multiplicadores de la caché se suman encima.
Fuentes: Claude Platform Docs, «Pricing» y OpenAI API Pricing (consultado el 26 de septiembre de 2026; cálculos propios)
1. Por qué tu factura de IA se infla en silencio
Las herramientas de IA tienen dos modelos de facturación: planes personales (tarifa plana) y facturación por API (basada en uso). La factura que se dispara es, sobre todo, la segunda.
- Planes personales: ChatGPT Plus 20 $/mes, Claude Pro 20 $/mes (17 $/mes con pago anual), Max desde 100 $/mes. Coste fijo, así que incluso un uso intensivo tiene un techo (con límites de uso).
- Facturación por API: por token, basada en uso. Aquí entran Claude Code con clave de API y las apps de IA que desarrollas tú. El total del mes puede variar mucho según cómo las uses.
La facturación por uso se infla porque (1) los tokens de salida cuestan 5× los de entrada, (2) cuanto más crece el contexto, más reenvías completo en cada petición, (3) los subagentes se invocan una y otra vez entre bambalinas y (4) cuando algo entra en bucle, no se detiene, y todo se acumula. Una vez entiendes la mecánica, todo eso tiene solución.
2. Desglose del coste — entrada, salida, caché y batch
Tomando como ejemplo los precios de la API de Claude Opus (Opus 5.5 a septiembre de 2026; está por debajo de Fable, el modelo superior, y es el nivel que Anthropic recomienda como punto de partida), aquí va a parar el dinero.
| Concepto | Precio unitario (por 1M tokens) | Descripción |
|---|---|---|
| Tokens de entrada | $4 | Lo que envías: prompt + historial de conversación + ficheros, etc. |
| Tokens de salida | $20 | Lo que devuelve la IA. 5× la entrada. |
| Escritura en caché (5 min) | $5 (1,25× la entrada) | Guardar un prefijo en la caché. Cada lectura dentro de los 5 minutos la prolonga sin coste adicional. |
| Escritura en caché (1 h) | $8 (2× la entrada) | Aguanta pausas de más de 5 minutos, a cambio de una escritura más cara. |
| Lectura de caché | $0.20 (0,05× la entrada) | 0,1× en la mayoría de los modelos, 0,05× en Opus 5.5. Esta es la estrella del ahorro. |
| Procesamiento por lotes | Entrada $2, salida $10 (mitad de precio) | Procesa de forma asíncrona las peticiones que pueden esperar. Se suma a los multiplicadores de la caché. |
| Llamadas a herramientas | Cuentan como entrada | Las definiciones de herramientas forman parte del contexto. Pasar cualquier herramienta añade además un system prompt de uso de herramientas (286 tokens en Opus 5.5). |
En resumen, un prefijo que está en la caché se lee a una décima parte del precio de entrada o menos. Los multiplicadores de escritura (1,25× para 5 minutos, 2× para 1 hora) y la salida a 5× la entrada son iguales en todos los modelos actuales de Claude; solo el multiplicador de lectura cambia según el modelo (0,025× en Fable 5.1). Ten en cuenta también que Claude Opus 4.7 y posteriores usan un tokenizador nuevo que, según Anthropic, genera alrededor de un 30 % más de tokens para el mismo texto; conviene recordarlo al comparar precios entre generaciones. Fuente: Claude Platform Docs, «Pricing» (consultado el 26 de septiembre de 2026).
3. Elección de plan y su impacto en el ahorro
En cuanto puedas anticipar cómo lo vas a usar, cambia primero al plan adecuado.
| Uso | Plan recomendado | Objetivo mensual | Advertencias |
|---|---|---|---|
| Hobby, aprendizaje, unas pocas veces por semana | Claude Free / ChatGPT Free | $0 | Con límites de uso; no para datos de trabajo. |
| Personal, varias horas al día | Claude Pro / ChatGPT Plus | $20 | Plan personal; no para datos de trabajo. |
| Uso personal intensivo | Claude Max | Desde $100 | 5× o 20× el uso de Pro; para quien usa Claude Code durante horas. |
| Trabajo en equipo | Claude Team / ChatGPT Business | Puesto estándar de Claude Team: $20 (anual) a $25/usuario | OK para datos de trabajo; los datos no se usan para entrenamiento. |
| Gran organización | Enterprise | Presupuesto comercial | SSO, registros de auditoría, SLA. |
| Desarrollo con IA integrada | API directa (Anthropic / OpenAI) | Por uso | Usa caché y batch. |
Fuentes: página de precios de Claude y OpenAI Help, «What is ChatGPT Plus?» (consultado el 26 de septiembre de 2026).
Si usas Claude Code muchas horas al día y chocas a menudo con los límites de Pro, plantéate el plan Max. Al ser tarifa plana, la factura no se desboca como puede ocurrir con una clave de API. Cursor empieza en 20 $ al mes con el plan individual Pro, y por encima tiene Pro+ y Ultra.
4. Prompt caching — la palanca que más rinde
Si llamas directamente a la API y reenvías una y otra vez el mismo prefijo, casi no hay razón para no usar prompt caching. Lo que se lee de la caché se factura a una pequeña fracción del precio base de entrada.
Cómo funciona
Cuando reutilizas el mismo system prompt o los mismos documentos en varias peticiones, la primera llamada los escribe en la caché (1,25× la entrada con la caché de 5 minutos). Cada llamada posterior lee de la caché a 0,1× la entrada (0,05× en Opus 5.5 y 0,025× en Fable 5.1). Eso sí, un prefijo demasiado corto no se cachea: el mínimo es de 512 tokens en Opus 5.5, 1024 en Sonnet 5 y 4096 en Haiku 4.5 (Claude Platform Docs, «Prompt caching»).
Punto de equilibrio: una lectura con la caché de 5 minutos, dos con la de 1 hora
Tomando el precio de entrada como 1, compara el coste de enviar el mismo prefijo (calculado con los multiplicadores oficiales de Anthropic):
- Caché de 5 minutos: escritura 1,25 + una lectura 0,1 = 1,35. Enviarlo dos veces sin caché cuesta 2, así que con una sola lectura ya compensa.
- Caché de 1 hora: escritura 2 + dos lecturas 0,2 = 2,2. Enviarlo tres veces sin caché cuesta 3, así que con dos lecturas compensa (con una sola lectura sale 2,1, algo por encima de los 2 sin caché).
La página de precios de Anthropic dice lo mismo: la caché compensa tras una lectura con la duración de 5 minutos y tras dos con la de 1 hora. Opus 5.5 lee a 0,05×, así que con el mismo número de lecturas la diferencia es aún mayor.
Ejemplo — un prefijo de 100 000 tokens enviado 10 veces
| Modelo | Sin caché | Caché de 5 minutos | Diferencia |
|---|---|---|---|
| Claude Opus 5.5 (entrada $4, escritura $5, lectura $0.20) | 0,1 × 4 $ × 10 = 4,00 $ | 0,1 × 5 $ + 0,1 × 0,20 $ × 9 = 0,68 $ | Alrededor de un 83 % menos |
| Claude Sonnet 5 (entrada $2, escritura $2.50, lectura $0.20) | 0,1 × 2 $ × 10 = 2,00 $ | 0,1 × 2,50 $ + 0,1 × 0,20 $ × 9 = 0,43 $ | Alrededor de un 79 % menos |
Solo se cuenta la entrada del prefijo (system prompt, documentos de referencia, etc.); 100 000 tokens = 0,1 en unidades de un millón. Se supone que las diez peticiones llegan con menos de 5 minutos entre sí, que la primera escribe la caché y las otras nueve la leen. Precios de Claude Platform Docs, «Pricing» (consultado el 26 de septiembre de 2026). No incluye la salida ni la parte de cada petición que cambia.
Los modelos GPT-6 de OpenAI funcionan de forma parecida. La entrada en caché cuesta 0,1× y la escritura 1,25×, y la guía de OpenAI hace la misma cuenta: escribir un prefijo una vez y reutilizarlo una vez cuesta 1,35×, frente a 2× si se procesa dos veces sin caché. La caché dura 30 minutos desde su último uso y viene activada por defecto en los modelos compatibles (OpenAI, «Prompt caching»).
La vida útil por defecto es de 5 minutos
En la API de Anthropic, la vida útil (TTL) de la caché de prompts es de 5 minutos por defecto. Cada lectura la renueva sin coste adicional, pero si pasan más de 5 minutos sin uso, caduca y la siguiente petición vuelve a escribirla (1,25× la entrada). Puedes elegir una vida útil de 1 hora, pero entonces la escritura cuesta 2× la entrada (fuente: Claude Platform Docs, «Prompt caching»).
Claude Code funciona sobre el mismo mecanismo. Dentro del uso incluido en una suscripción de Claude, da a la conversación principal la vida útil de 1 hora, pero con una clave de API, o cuando superas el límite de tu plan y pasas a los créditos de uso, baja a 5 minutos. Desde la v2.1.242 puedes elegir tú 5m o 1h con el ajuste promptCacheTtl (fuente: Claude Code Docs, «Prompt caching», consultado el 26 de septiembre de 2026). Si trabajas con pausas, cuál de las dos se aplica cambia cuántas veces se reescribe la caché.
Cómo elegir entre 5 minutos y 1 hora
La pauta de la documentación oficial:
- Un prefijo que se reutiliza con más frecuencia que cada 5 minutos: quédate con la caché de 5 minutos. Cada lectura la renueva gratis, así que no necesitas la escritura más cara de 1 hora.
- Un prefijo que se reutiliza con pausas de entre 5 minutos y una hora (esperar la respuesta de un usuario, una llamada que sigue a una tarea de más de 5 minutos): encaja la caché de 1 hora.
- Si mezclas las dos: coloca la caché de 1 hora antes que la de 5 minutos, el mismo orden que poner primero el system prompt y las definiciones de herramientas, que no cambian.
Para comprobar que la caché funciona, mira cache_read_input_tokens (lecturas) y cache_creation_input_tokens (escrituras) en el usage de la respuesta. Si las lecturas siguen en cero, el prefijo cambia en algún punto en cada petición o no llega al mínimo de tokens.
5. Gestión del contexto — /compact y división
Usa Claude Code o Cursor un rato y, en mitad de una conversación larga, te encontrarás reenviando en cada turno una gran cantidad de conversación pasada. No es la salida lo que se hincha: es la entrada (= conversación pasada).
Táctica 1: usa /compact de forma activa
Claude Code dispone del comando /compact. Resume la conversación hasta ese punto para liberar contexto (Claude Code Docs, «Commands»), y puedes indicarle qué debe conservar el resumen. Úsalo en las pausas naturales del trabajo.
Táctica 2: divide las sesiones por tarea
No hagas «implementar la funcionalidad A», «arreglar el bug B» y «generar el documento C» en una única conversación larga: arranca sesiones nuevas. Cierra la sesión cuando termines cada tarea. Si necesitas memoria a largo plazo, escríbela en un fichero de memoria.
Táctica 3: recorta el ruido con Hooks
Claude Agent SDK / Claude Code ofrecen Hooks, que permiten transformar la salida de las herramientas antes de que llegue a la IA. Ejemplo: comprimir un log largo de npm install a un simple «éxito/fallo» mediante un Hook. Cuanto más largo el log, más ligera queda la entrada de cada turno.
6. Selección de modelo — enrutamiento por tarea
«Siempre Opus» es la estrategia del millonario. El trabajo rutinario, como clasificar o extraer, suele ir bien con Sonnet o Haiku. El precio depende del nivel del modelo (alto, medio, ligero); los precios oficiales a 26 de septiembre de 2026 (por millón de tokens) son los siguientes. Entre versiones, la relación —cuanto más alto el nivel, más caro, y el nivel ligero cuesta una fracción del alto— no ha cambiado.
| Modelo | Entrada | Salida | Mejor para |
|---|---|---|---|
| Claude Opus 5.5 (alto) | $4 | $20 | Diseño complejo, razonamiento, tareas autónomas largas |
| Claude Sonnet 5 (medio) | $2 | $10 | Codificación diaria, análisis, resumen |
| Claude Haiku 4.5 (ligero) | $1 | $5 | Clasificación, extracción, conversión corta, respuesta en tiempo real |
| GPT-6 Sol (modelo equilibrado de OpenAI) | $2 | $10 | Programación compleja y trabajo agéntico |
| GPT-6 Luna (modelo de bajo coste de OpenAI) | $0.10 | $0.50 | Trabajo ligero, acotado y en gran volumen |
Fuentes: Claude Platform Docs, «Pricing» y OpenAI API Pricing (consultado el 26 de septiembre de 2026; precios de OpenAI para contexto corto). Por encima están Fable 5.1 de Anthropic ($10 / $50) y el buque insignia de OpenAI, GPT-6 Astra ($10 / $50). Los modelos actuales de cada empresa están en la lista de modelos actuales y fechas de corte.
Pasar del Opus de gama alta al ligero Haiku reduce el precio por token a una cuarta parte (a septiembre de 2026). Para un trabajo de clasificación que consume 2 millones de tokens de entrada y 200 000 de salida al día, los precios oficiales dan:
- Opus 5.5: 2 × 4 $ + 0,2 × 20 $ = 12 $
- Sonnet 5: 2 × 2 $ + 0,2 × 10 $ = 6 $
- Haiku 4.5: 2 × 1 $ + 0,2 × 5 $ = 3 $
- Haiku 4.5 por lotes: 3 $ × 0,5 = 1,50 $ (capítulo 8)
Que la calidad aguante depende del trabajo, así que compara los resultados con la misma entrada antes de pasar a un modelo más barato (FAQ, Q4). Criterios orientativos:
- Usa Opus para: refactorizaciones complejas, diseños que abarcan muchos ficheros, razonamiento profundo, exploración de un dominio desconocido
- Usa Sonnet para: codificación diaria, análisis, resumen, revisión, añadir tests
- Usa Haiku para: clasificación, extracción, conversión de formato, sugerencias en tiempo real, generación de mensajes de commit
7. Gestionar tu presupuesto de salida
Los tokens de salida cuestan 5× los de entrada, tanto en los modelos actuales de Claude como en GPT-6 Astra, Sol y Luna. Una respuesta de Opus 5.5 con 2000 tokens de entrada y 1000 de salida cuesta 0,008 $ + 0,020 $ = 0,028 $. Si limitas la salida a 500 tokens, queda en 0,018 $, alrededor de un 36 % menos (calculado con los precios oficiales).
Tres enfoques
- Ajusta
max_tokensa la tarea: en la Messages API de Anthropic,max_tokenses un parámetro obligatorio y el número que pongas es el techo de la salida (referencia de la API, «Messages»). No dejes un valor grande por inercia; pon uno acorde al uso, comomax_tokens: 1000. - Añade «responde brevemente» o «cinco bullets» al prompt: la IA hace caso. Suprime introducciones, resúmenes y despedidas redundantes.
- Salida estructurada (modo JSON): el JSON es más corto que la prosa. Si tu app consume el resultado, es el camino.
Para situaciones en las que no necesitas una «respuesta larga y bonita» (clasificación, extracción, decisiones), recortar a fondo acaba siendo más eficiente en coste.
8. Procesamiento por lotes — mitad de precio para lo que puede esperar
El trabajo que no necesita respuesta inmediata —clasificación masiva nocturna, resúmenes en bloque, ejecuciones de evaluación— cuesta la mitad, en entrada y en salida, a través de una API de lotes. La Message Batches API de Anthropic acepta hasta 100 000 peticiones por lote; la mayoría termina en menos de una hora, pero un lote puede tardar hasta 24 horas (Claude Platform Docs, «Batch processing»). La Batch API de OpenAI también descuenta un 50 %, con un plazo de finalización de 24 horas (OpenAI, «Batch API»).
Según la página de precios de Anthropic, los multiplicadores de la caché se suman al descuento por lotes. Una lectura de caché con Haiku 4.5 dentro de un lote, por ejemplo, sale a 1 $ × 0,1 × 0,5 = 0,05 $ por millón de tokens.
9. La trampa multiagente — 15× tokens
La tendencia de 2026, los montajes multiagente (orquestador + subagentes en paralelo), es potente, pero Anthropic ha publicado datos de su propia función Research: los agentes usan unas 4× más tokens que un chat normal, y los sistemas multiagente unas 15× (Anthropic, «How we built our multi-agent research system», junio de 2025). El 15× se mide frente al chat, no frente a un único agente.
Criterios de decisión para ahorrar
- Tareas claras y secuenciales (edición de un único fichero, resumen, revisión de código) → basta con un único agente
- Paralelismo que reduce de forma significativa el tiempo de reloj → multiagente está justificado
- «Multiagente por defecto» es económicamente erróneo. Empieza con un único agente y divide solo los cuellos de botella que veas de verdad.
Detalles: véase ¿Qué es un sistema multiagente?
10. Monitorización y alertas de facturación
Para que una factura por uso no te dé un susto, la monitorización rutinaria + alertas son imprescindibles.
Usuarios de API
- Revisa el consumo diario de tokens en la Claude Console / OpenAI Dashboard
- Fija un límite de uso: parar al superar 200 $/mes, por ejemplo. Sin límite = peligro.
- Alertas de facturación: email a 50 $, Slack a 100 $ — umbrales escalonados.
Usuarios de Claude Code
- Usa
/usagepara revisar el coste de la sesión actual y el uso de tu plan (/costes ahora un alias de/usage) - Convierte en hábito comprobar
/usageal final de cada día
Administradores de organización
- Informes de uso por usuario (consola de admin de Anthropic Team / Enterprise)
- Detección de anomalías (señalar a quien consume mucho más de lo habitual)
- Difusión trimestral en toda la empresa de los «patrones de despilfarro»
11. Siete patrones de despilfarro habituales
| Patrón | Qué falla | Solución |
|---|---|---|
| Reenviar todos los ficheros en cada turno | La caché no entra; la entrada se infla | Pon los documentos invariables en el prefijo y cachéalos |
| Hacer la misma pregunta en ChatGPT y Claude | Pagas dos veces la misma entrada en planes distintos | Elige uno |
Continuar una conversación larga sin /compact | Se envía el historial completo en cada turno | /compact en las pausas naturales |
| Usar Opus para clasificación o extracción simple | Pagas 4× lo que cuesta Haiku para el mismo resultado | Casa el modelo con la tarea |
| Repetir «más pulido» / «un poco más largo» | Los tokens de salida se acumulan | Indica la longitud deseada desde el principio |
| Definir muchas herramientas innecesarias | Las definiciones de herramientas viajan en el contexto | Define solo lo que vayas a usar |
| Recurrir a multiagente a la ligera | Unas 15× los tokens de un chat (un agente solo, unas 4×) | Solo cuando haya una necesidad clara |
Resumen
- Las tres palancas de la optimización de coste de IA: prompt caching, elección de modelo y presupuesto de salida. El efecto de cada una lo fijan multiplicadores oficiales, y los multiplicadores se combinan.
- Lectura de caché = 0,1× la entrada (0,05× en Opus 5.5). La caché de 5 minutos compensa tras una lectura; la de 1 hora, tras dos. Un prefijo de 100 000 tokens enviado diez veces a Opus 5.5 pasa de 4,00 $ a 0,68 $.
- Elección de modelo: de Opus 5.5 a Haiku 4.5, el precio por token baja a una cuarta parte; con Sonnet 5, a la mitad (a septiembre de 2026).
- Presupuesto de salida: la salida cuesta 5× la entrada. Fija
max_tokensde forma explícita y pide «brevedad». - Procesamiento por lotes: lo que puede esperar cuesta la mitad en entrada y salida, y se suma al descuento de la caché.
- Gestión del contexto:
/compacten las pausas naturales, divide por tarea, comprime la salida con Hooks. - Trampa multiagente: unas 15× los tokens de un chat. Úsalo solo con una necesidad clara.
- Monitorización: límites de uso, alertas de facturación y comprobar
/usagedeben ser hábitos.
FAQ
Q1. Uso Claude Code a diario — ¿me sale más a cuenta Pro (20 $) o Max?
Si chocas a menudo con los límites de Pro, plantéate Max. El centro de ayuda de Anthropic aconseja a los usuarios de Pro que chocan a menudo con los límites y necesitan más capacidad para repositorios grandes que consideren pasar a Max 5x (Claude Help Center, «Using Claude Code with your Pro or Max plan»). Si no llegas a los límites, quédate en Pro.
Q2. ¿Necesito una configuración especial para usar prompt caching?
En la API de Anthropic hay que indicar cache_control: una sola vez en el nivel superior de la petición (caché automática) o en bloques concretos (puntos de corte explícitos). En OpenAI viene activado por defecto en los modelos compatibles. Claude Code usa la caché de forma automática. Consulta la documentación oficial de Anthropic para más detalle.
Q3. ChatGPT vs. Claude — ¿cuál es más eficiente en coste?
Depende del caso de uso. Solo por precio unitario, el Claude Sonnet 5 de gama media y GPT-6 Sol están igualados: 2 $ de entrada y 10 $ de salida. Para preguntas y respuestas cortas y tareas rutinarias en gran volumen, el modelo de bajo coste de OpenAI (GPT-6 Luna a septiembre de 2026, 0,10 $ de entrada) cuesta una décima parte que Haiku 4.5 (1 $ de entrada). En trabajos largos que reenvían el mismo prefijo, las lecturas de caché pesan, y eso pone también en liza a Opus 5.5 (0,05×). «Suscríbete a ambos y elige la herramienta adecuada» también es práctico.
Q4. ¿Cómo decido si «con Haiku me basta»?
Haz un experimento en tres pasos. (1) Que funcione con Opus. (2) Envía el mismo prompt a Sonnet y compara la calidad. (3) Si Sonnet parece comparable, prueba también Haiku. Cuanto más rutinaria es la tarea, menor suele ser la diferencia. Reserva Opus para casos que de verdad requieran juicio o razonamiento profundo.
Q5. ¿Los usuarios particulares deberían atacar la API directamente?
Depende. Si lo tuyo es sobre todo programar de forma interactiva, el plan Max mantiene la factura fija y es más cómodo. Para integrar IA en tu propia app, procesamiento por lotes o automatización, necesitas la API directa. Mucha gente hace las dos cosas.
Q6. ¿Qué umbral debería poner para las alertas de facturación?
No hay una respuesta única, pero una forma de escalonarlo es una primera alerta a 1,5× tu gasto mensual habitual y una parada a 3×. Si sueles gastar 30 $/mes, alerta a 50 $ y para a 100 $. Al principio, pon alertas diarias pequeñas para hacerte una idea de tu consumo y luego aflójalas.
Q7. Nos han dicho «el presupuesto de IA de la empresa se ha disparado». ¿Por dónde empezamos?
Tres cosas en orden. (1) Mira el uso por usuario y localiza dónde se concentra el consumo. (2) Habla con quienes más consumen sobre su flujo de trabajo e identifica patrones de despilfarro. (3) Distribuye una guía interna sobre «caché, elección de modelo y presupuesto de salida» a toda la empresa y reporta mensualmente el progreso.
Correcciones a la versión anterior
El 26 de septiembre de 2026 corregimos lo siguiente.
| Versión anterior | Ahora |
|---|---|
| Tres palancas comprimen el coste al 20-30 % del coste sin optimizar (título, inicio, imagen) | Retirado por no poder citar una fuente. Sustituido por ejemplos calculados con precios y multiplicadores oficiales. |
| -60 a 90 % con la caché, -50 a 80 % con la elección de modelo, -30 a 60 % con el presupuesto de salida, de 30 000 $/mes a 6 000-9 000 $ | Igual que arriba. Sustituido por ejemplos como «un prefijo de 100 000 tokens enviado diez veces: 4,00 $ → 0,68 $». |
| Ocho de cada diez trabajos van bien con un modelo más barato | Retirado; sin fuente. |
| La caché de 5 minutos compensa con dos lecturas | Compensa con una lectura (escritura 1,25 + lectura 0,1 = 1,35 < 2). |
| La caché de 1 hora compensa con cinco lecturas | Compensa con dos lecturas (2 + 0,2 = 2,2 < 3). |
| Los tokens de salida cuestan 5-6× más que los de entrada | 5× (en todos los modelos actuales de Claude y en los tres de GPT-6). |
| Una tasa de aciertos de caché inferior al 60 % deja margen; en producción, apunta al 80 % o más | Retirado; sin fuente. Sustituido por comprobar los tokens de lectura y escritura en usage. |
/compact reduce 200 000 tokens a 5000 | Cifras retiradas; sin fuente. |