El 3 de septiembre de 2026, OpenAI presentó su nuevo modelo insignia, «GPT-6 Astra» (documentación de la API de OpenAI). La API está disponible de forma general y sin listas de acceso, el identificador del modelo es gpt-6-astra y el contexto es de 1,050,000 tokens.

Ahora bien, «ya se ha lanzado» y «tu plan puede usarlo» resultaron ser dos cosas distintas. La propia OpenAI anunció un despliegue escalonado que empezaba por un conjunto limitado de organizaciones, y en ChatGPT Plus no aparece en la pantalla de chat habitual. La sección 2 de este artículo funciona por sí sola, pensada para quien solo haya venido a resolver esa duda.

Y hay algo más que separa a este artículo de otros análisis: no incluye una tabla de puntuaciones de benchmarks. Damos los nombres de las métricas que citó OpenAI, pero solo publicamos los valores que hemos podido rastrear hasta la página que los publicó. El motivo está en la sección 4, y adelantamos la conclusión: las comparaciones que circulan estos días, del tipo «GPT-6 Astra 74.1% frente a Claude Opus 5 96%», ponen en fila cifras medidas de entrada con varas distintas.

G6

GPT-6 Astra

Publicado el 3 de septiembre de 2026 / API disponible de forma general

Contexto
1,050,000
Tope de entrada 922,000 / salida 128,000
Precio de API (por millón de tokens)
$10 / $50
Entrada en caché $1 / escritura $12.50
Corte de conocimiento
30 de abril de 2026
El de Opus 5 es mayo de 2026
Capacidad ciber
Critical
Primer modelo que llega a este nivel

Fuentes: OpenAI

1. Resumen del lanzamiento: fecha, especificaciones y a quién llega

OpenAI sitúa a GPT-6 Astra como «el modelo más inteligente hasta la fecha» y afirma que rinde al máximo nivel en uso del ordenador, navegación, ingeniería de software, ciencia y trabajo profesional. La formulación oficial dice que destaca al ejecutar flujos de trabajo de varios pasos que atraviesan el código, el navegador y el software de gestión: una descripción que pone el acento en el trabajo que se prolonga en el tiempo más que en el turno de pregunta y respuesta (guía de modelos de OpenAI).

ConceptoGPT-6 AstraNotas
Fecha de publicación3 de septiembre de 2026Despliegue progresivo desde un grupo limitado de organizaciones
Identificador del modelogpt-6-astraLa API no tiene lista de acceso
Contexto1,050,000 tokensTope de entrada 922,000
Salida máxima128,000 tokens
Corte de conocimiento30 de abril de 2026Detalles en nuestra lista de fechas de corte
Esfuerzo de razonamientolow / medium / high / xhigh / maxnone no está admitido
Funciones admitidasStreaming, salidas estructuradas, llamada a funciones, búsqueda en archivos, entrada de imágenes, búsqueda web, caché de prompts
Límites de uso500-15,000 RPM / 500K-40M TPMSegún tu nivel de uso

Las entradas de más de 272,000 tokens llevan recargo. La entrada y la caché se duplican, y la salida sube 1.5 veces. Una ventana de un millón de tokens está tarificada de forma que cuanto más la usas, más sube el precio unitario, así que conviene tratar «lo que cabe» y «lo que compensa» como dos preguntas distintas.

2. «Tengo Plus y no me aparece»: disponibilidad por plan

Esta fue con diferencia la queja más repetida en los días posteriores al lanzamiento. La respuesta corta: con Plus sí tienes Astra, pero no en la pantalla de chat habitual.

Lo que sigue se basa en el anuncio oficial en la comunidad de desarrolladores de OpenAI y en las publicaciones de la cuenta oficial de OpenAI.

OpenAI anunció en su cuenta oficial que el primer día llegaría a un conjunto limitado de organizaciones y que en los días siguientes se ampliaría a Plus, Pro, Business y Enterprise, además de la API y AWS. Al día siguiente añadió que Pro, Enterprise y Business Premium pueden usarlo en ChatGPT Work y Codex, que ya funciona en la API y que el despliegue en Plus y Business puede tardar unos días.

API

Disponible de forma general. Sin restricciones ni lista de espera: indica gpt-6-astra y funciona. Hoy por hoy es el único sitio donde llegas a él con seguridad.

Pro / Enterprise / Business Premium

Disponible en ChatGPT Work y Codex. Es el alcance que OpenAI describe explícitamente como ya entregado a todos los usuarios.

Plus / Business Standard

Solo en ChatGPT Work y Codex. No aparece en la lista de modelos de la pantalla de chat habitual. Búscalo en el selector de modelos de Work o de Codex.

En resumen: la gente lo está buscando donde no está. Mucha gente abre ChatGPT, repasa la lista de modelos, no ve nada y ahí se detiene; pero en Plus la puerta de entrada son Work y Codex.

🟡 No podemos decirte que aparecerá en el chat normal si esperas unos días. El anuncio inicial de OpenAI hablaba de todos los usuarios de Plus en cuestión de días, pero a 8 de septiembre de 2026, cinco días después del lanzamiento, sigue sin llegar al chat normal de Plus. En el foro de desarrolladores de OpenAI hay abierto un hilo pidiendo explicaciones que señala que se anunció para todos los usuarios de Plus mientras el acceso de Plus se limita a Work y Codex, y hay informaciones que apuntan a que hace falta Pro para usarlo en el chat normal.
El anuncio original era un plan, no una fecha de disponibilidad confirmada: lo que Plus te da hoy con seguridad son Work y Codex. (Datos a 8 de septiembre de 2026. Actualizaremos el artículo si la situación cambia).

3. Precios: cómo plantear bien la pregunta de si $10/$50 es caro

El precio de la API es de $10 de entrada y $50 de salida por millón de tokens. Es exactamente el doble que Claude Opus 5, que cuesta $5 / $25, así que por precio unitario está en la franja cara.

Sin embargo, en esa misma documentación OpenAI sostiene que «como obtiene mejores resultados con menos tokens de salida, el coste estimado de API por tarea es en realidad menor». Lo que factura un modelo de razonamiento es el precio unitario multiplicado por los tokens que realmente emitió, de modo que un precio unitario del doble sale más barato si la salida no llega a la mitad.

No te lo creas sin más. Eso de «es más barato porque escribe menos» es una estimación de la propia OpenAI, no una medición independiente. Además se da la vuelta con facilidad según el tipo de tarea: si lanzas muchísimas respuestas cortas, el precio unitario te golpea de lleno, y los ajustes que le hacen pensar más rato (xhigh / max) disparan los tokens de salida.
Pasa diez tareas representativas tuyas y mira la factura: no hay otra forma de saberlo.

4. Benchmarks: por qué las tablas comparativas no se sostienen

Estas son las métricas en las que OpenAI describió a Astra como referencia del sector (anuncio oficial en la comunidad de desarrolladores de OpenAI). Los nombres de las métricas son públicos, pero ese anuncio no lleva ninguna tabla de puntuaciones.

Agents' Last Exam
AutomationBench
ScreenSpot Pro
FrontierMath Tier 4
ARC-AGI 3
TerminalBench-4.0
Terminal-Bench Science 0.1
HealthBench Pro

De esa lista salta algo a la vista. Dominan las métricas de uso del ordenador, de terminal y de corte agéntico, y apenas hay nada de la familia clásica de preguntas de conocimiento. Encaja con la descripción de la sección 1 sobre el trabajo que se prolonga en el tiempo.

Por qué no publicamos las cifras

Otros análisis llevan tablas del estilo «Astra 74.1% frente a Claude Opus 5 96%». Este artículo no la lleva, porque esa comparación no se sostiene.

① Varas de medir distintas

En programación, OpenAI cita la familia DeepSWE y Anthropic cita SWE-bench Verified. Son pruebas diferentes que solo suenan parecido, con otra dificultad y otro sistema de puntuación. En cuanto colocas la cifra de una junto a la de la otra, la tabla ha dejado de significar algo.

② No se llega a la fuente

Buena parte de las cifras que circulan son recopilaciones que copian a otras recopilaciones, y de algunas no se encuentra el mismo valor al abrir la página de quien lo publicó. Nuestra norma es no publicar una cifra que no podamos rastrear hasta su editor.

③ Se cuelan métricas saturadas

En métricas donde todos los modelos punteros están clavados en el noventa y tantos por ciento, una diferencia de uno o dos puntos no significa nada. Es una distancia que se puede titular como victoria, pero que no se nota en el trabajo diario.

¿Con qué se puede comparar entonces? Solo con aquello para lo que ambos modelos han publicado valores medidos con la misma vara. Por ejemplo, en DeepSWE v1.1, que tratamos en nuestro artículo sobre Opus 5, Opus 5 saca 68.8% y GPT-5.6 Sol saca 72.7%: dos valores de la misma prueba, así que la comparación se sostiene. Añadiremos la cifra de Astra en esa métrica en cuanto podamos confirmarla en la página de quien la publique.

5. El primer modelo que alcanza capacidad ciber «Critical»

Puede que esta sea la noticia más grande de las dos. OpenAI ha clasificado a GPT-6 Astra como el primer modelo que alcanza el nivel Critical de capacidad en ciberseguridad dentro de su propio Preparedness Framework (Deployment Safety Hub de OpenAI, tarjeta de sistema publicada el 3 de septiembre de 2026).

Según la propia explicación oficial, Astra está en condiciones de encontrar vulnerabilidades aún desconocidas e idear formas nuevas de explotarlas contra sistemas endurecidos sin que una persona le vaya dictando cada paso. En las evaluaciones realizadas con las salvaguardas desactivadas se documenta que logró una vía de ejecución de código arbitrario en un navegador endurecido y una escalada de privilegios en un sistema operativo endurecido.

Valores publicados por OpenAIGPT-6 AstraGPT-5.6 Sol
ExploitBench (éxito al primer intento)88.0%55.9%
ExploitBench (éxito en cuatro intentos o menos)99.2%68.7%
Tasa de éxito de ataques en Gray Swan IPI Arena
(cuanto más baja, mejor defendido)
8.5%27.0%
HealthBench Professional (ajustado por longitud)63.4
Desviaciones de gravedad 3 o superior en simulaciones de Codex0.063% (34 de 54,218)

La capacidad ofensiva ha subido, pero como objetivo se ha vuelto más difícil de romper. La tasa de éxito de la inyección indirecta de prompts bajó del 27.0% de Sol al 8.5%. Si pones agentes a leer páginas web externas, esa es una mejora que se nota en producción.

La respuesta de OpenAI no fue rebajar la capacidad, sino trazar una línea por caso de uso. Colabora en el trabajo defensivo, como la revisión segura de código o la aplicación de parches, y rechaza las peticiones de corte ofensivo, como escribir una prueba de concepto para una vulnerabilidad conocida. A eso se suman una supervisión más amplia de todo el razonamiento con herramientas, la confirmación del usuario para acciones de consecuencias serias y unos límites de seguridad ajustados para menores de 18 años, además de una vía aparte de acceso limitado con verificación previa para la investigación en biología y en ciberseguridad.

Esa forma de trazar la línea recorre también los otros modelos nuevos de septiembre. Todas las empresas han vallado sus capacidades más peligrosas y solo abren la puerta a quien acredita para qué la quiere. Se está acabando la época de repartir todo a todo el mundo: de los tres lanzamientos seguidos, creo que ese es el cambio que más se está pasando por alto.

6. Para desarrolladores: qué se rompe al migrar

Si vas a cambiar código existente, hay partes que darán error tal como están escritas. Estos son los cambios que la guía de modelos de OpenAI detalla de forma explícita.

Quita los parámetros de muestreo

No pases temperature, top_p, top_logprobs ni similares. En los modelos de razonamiento no solo no hacen nada, sino que pueden ser rechazados.

Usa la Responses API

El soporte de herramientas en Chat Completions es limitado. Para trabajo con agentes es prácticamente obligatoria.

No existe el esfuerzo none

Si usabas none o minimal, la indicación oficial es empezar por low y comparar resultados.

El ajuste de caché cambió de nombre

prompt_cache_retention pasó a ser prompt_cache_options.ttl. Es solo un cambio de nombre, pero si se ignora en silencio la caché deja de funcionar y lo único que sube es la factura.

En cuanto al comportamiento, OpenAI señala expresamente que Astra devuelve preguntas al usuario con más facilidad que antes. Es una cualidad que se agradece cuando hay una persona al otro lado de la conversación, pero se convierte en un motivo de bloqueo en los procesos por lotes que corren sin nadie mirando. Si quieres ejecución autónoma, dilo explícitamente en el prompt.

Un apunte más: el modo Fast no está disponible en entornos de residencia de datos en la UE, y tampoco lleva SLA de latencia. Tenlo en cuenta si diseñas contando con una velocidad de respuesta determinada.

7. Comparación con Claude Opus 5 y Gemini 3.8 Flash

Entre el 1 y el 3 de septiembre de 2026, Anthropic, Google y OpenAI sacaron modelos nuevos tres días seguidos. Aquí está el elenco actual, limitado a los apartados cuyos valores publicados se pueden confirmar.

ModeloPublicaciónEntrada/salida (por millón de tokens)CorteContexto
GPT-6 Astra3 de septiembre de 2026$10 / $5030 de abril de 20261,050,000
Claude Opus 524 de julio de 2026$5 / $25Mayo de 20261,000,000
Claude Fable 5.11 de septiembre de 2026$10 / $50Junio de 20261,000,000
Gemini 3.8 Flash2 de septiembre de 2026$0.75 / $3.75 (precio de lanzamiento, hasta el 31 de diciembre de 2026)Marzo de 20261,000,000

Se leen tres cosas.

① La gama alta ha convergido en $10/$50. Astra y Fable 5.1 cuestan lo mismo. Mientras tanto, Anthropic no ha cambiado su recomendación de empezar por Opus 5 en casi todos los casos, así que sigue en pie el cuadro en el que el verdadero campo de batalla es el Opus 5 de $5/$25.

② El conocimiento más fresco es el de Fable 5.1. Junio de 2026, seguido de Opus 5 (mayo), Astra (30 de abril) y Gemini 3.8 Flash (marzo). Dicho esto, si combinas el modelo con búsqueda web esa diferencia apenas se nota en la práctica. El corte muerde cuando desconectas la búsqueda.

③ Lo único separado por un orden de magnitud es el precio. Con su tarifa de lanzamiento, Gemini 3.8 Flash cuesta en entrada alrededor de una decimotercera parte que Astra. Si ordenas los modelos por inteligencia quedan apelotonados; si los ordenas por coste se separan por un orden de magnitud: ese es el retrato del otoño de 2026, y la distancia es más nítida que en nuestra comparación de la generación anterior.

8. Advertencias: las cifras que este artículo no publica

Lo decimos con franqueza: hay cifras en otros análisis que aquí no vas a encontrar.

🟡 Las puntuaciones destacadas de programación y matemáticas

Los valores concretos de DeepSWE, FrontierMath y ARC-AGI no aparecen porque no hemos podido llegar a la página que los publicó. Los añadiremos en cuanto queden confirmados.

🟡 El número de mensajes por plan

Circulan cifras del tipo «tantos mensajes cada cinco horas», pero no hemos podido confirmarlas en las páginas oficiales de ayuda. Además son valores que se mueven durante un despliegue.

✅ Lo que sí publicamos

Las especificaciones, los precios y los cambios de migración salen de la documentación de la API y la guía de modelos; las cifras de seguridad, del Deployment Safety Hub. Todas están comprobadas en la página de quien las publicó.

Y una cosa más. La información recién salido un modelo se mueve. La disponibilidad cambia en cuestión de días, y los precios y los límites pueden revisarse. Este artículo refleja la situación de septiembre de 2026.

9. Recomendaciones por caso de uso: cuándo elegir Astra

Astra encaja cuando

El trabajo corre solo durante mucho rato. Tareas de varios pasos que cruzan el navegador y el software de gestión, trabajo de terminal y agentes que leen páginas web externas (gracias a su mayor resistencia a la inyección de prompts).

Para empezar basta con Opus 5

Cuando quieres reducir el precio unitario a la mitad. En calidad de redacción y en programación corriente, lo publicado hasta ahora no muestra una diferencia decisiva. Si Opus 5 te vale, es la respuesta barata.

Para volumen, un modelo tipo Flash

Lo que se mueve por órdenes de magnitud es el precio. Para pasar resúmenes, clasificaciones y borradores en masa, la tarifa de lanzamiento de Gemini 3.8 Flash es aplastante. Consulta también nuestra panorámica de Gemini.

Prueba primero lo gratuito

Cógeles el tacto antes de pagar. No pasa nada por recorrer los planes gratuitos de cada empresa antes de decidir. Aquí tienes nuestra comparación de los tres planes gratuitos.

Cierro con la forma más fiable de decidir. Antes que estudiar tablas de benchmarks, sale más rápido pasar diez tareas representativas tuyas por dos o tres modelos con la misma entrada. El tiempo que tardan, lo que facturan y la calidad de lo que devuelven. Mira esas tres cosas con tus propios ojos y tendrás una respuesta más precisa que la de cualquier tabla.

Preguntas frecuentes

Q1. ¿Ya se puede usar GPT-6 Astra?

La API está disponible de forma general desde el 3 de septiembre de 2026, sin restricciones de acceso ni lista de espera. En ChatGPT el despliegue es progresivo: Pro, Enterprise y Business Premium pueden usarlo en ChatGPT Work y Codex. Plus y Business Standard también están incluidos, pero OpenAI ha avisado de que su despliegue puede tardar unos días.

Q2. Tengo ChatGPT Plus y no aparece en la lista de modelos.

Lo más probable es que lo estés buscando donde no está. En Plus se puede usar en ChatGPT Work y Codex, y no aparece en la lista de modelos de la pantalla de chat habitual. Revisa el selector de modelos de esos dos. Ten en cuenta que el anuncio inicial de OpenAI hablaba de todos los usuarios de Plus en cuestión de días, pero a 8 de septiembre de 2026, cinco días después del lanzamiento, aún no había llegado al chat normal, y en el foro de desarrolladores de OpenAI hay abierto un hilo pidiendo explicaciones. Hay informaciones que apuntan a que hace falta Pro para usarlo en el chat normal, así que no podemos afirmar que llegará si esperas.

Q3. ¿Cuál es mejor, este o Claude Opus 5?

Depende del uso. Y a día de hoy las cifras publicadas no permiten zanjarlo, porque OpenAI y Anthropic usan benchmarks de programación distintos (la familia DeepSWE frente a SWE-bench Verified), de modo que cualquier tabla que alinee los números de ambas empresas no se sostiene. En precio, Astra cuesta $10/$50 y Opus 5 cuesta $5/$25, así que Opus 5 es el más barato de los dos.

Q4. Cuesta el doble que Opus 5. ¿De verdad va a salir más caro?

Depende de la tarea. OpenAI explica que el coste estimado por tarea es en realidad menor porque emite bastantes menos tokens de salida, pero esa es la estimación de la propia empresa. Los usos que lanzan muchísimas respuestas cortas notan el precio unitario de lleno, y si le haces pensar más rato con xhigh o max la salida crece. Mide la factura con tus propias tareas representativas.

Q5. ¿Qué se rompe al migrar desde código existente?

Cuatro cosas, sobre todo. Quitar los parámetros de muestreo como temperature o top_p; usar la Responses API en lugar de Chat Completions; tener en cuenta que el esfuerzo de razonamiento none ya no existe (la indicación oficial es empezar por low y comparar); y renombrar prompt_cache_retention a prompt_cache_options.ttl. Ojo sobre todo con lo último, porque si se ignora en silencio la caché deja de funcionar y lo único que sube es la factura.

Q6. ¿«Capacidad ciber Critical» significa que el modelo es peligroso?

Se refiere a un nivel de capacidad dentro del Preparedness Framework de OpenAI, no a un veredicto sobre su peligrosidad. Astra es el primer modelo que alcanza ese nivel, y por eso OpenAI está trazando una línea por caso de uso. Colabora en el trabajo defensivo, como la revisión segura de código o la aplicación de parches, pero rechaza las peticiones de corte ofensivo, como escribir una prueba de concepto. Más bien al contrario, cuesta más atacarlo que antes: la tasa de éxito de la inyección indirecta de prompts bajó del 27.0% de GPT-5.6 Sol al 8.5%.

Q7. ¿Un contexto de un millón de tokens compensa más cuanto más se usa?

No. Las entradas de más de 272,000 tokens llevan recargo: la entrada y la caché se duplican y la salida sube 1.5 veces. En muchas situaciones sale más barato seleccionar las partes que de verdad necesitas que volcar un contexto enorme de golpe.

Fuentes

Todas las cifras de este artículo están comprobadas en las páginas de sus editores, listadas abajo. No hay nada copiado de artículos recopilatorios.