---
title: "GPT-6 Astra lleva los agentes de IA a otro nivel: 99,9 % en ARC-AGI-3"
description: "OpenAI ha presentado GPT-6 Astra , un modelo diseñado para avanzar desde los asistentes que generan respuestas hacia agentes capaces de utilizar ordenadores, programar, investigar y completar flujos d..."
url: https://revistacloud.com/gpt-6-astra-lleva-los-agentes-de-ia-a-otro-nivel-999-en-arc-agi-3/
date: 2026-09-07
modified: 2026-09-07
author: "Nota de Prensa"
image: https://revistacloud.com/wp-content/uploads/2026/09/gpt-6-astra-openai.jpg
categories: ["Inteligencia artificial", "Noticias"]
tags: ["gpt-6", "OpenAI"]
type: post
lang: es
---

# GPT-6 Astra lleva los agentes de IA a otro nivel: 99,9 % en ARC-AGI-3

[OpenAI ha presentado **GPT-6 Astra**](https://noticias.ai/gpt-6-astra/), un modelo diseñado para avanzar desde los asistentes que generan respuestas hacia agentes capaces de utilizar ordenadores, programar, investigar y completar flujos de trabajo prolongados. Los resultados publicados incluyen un **99,9 % en ARC-AGI-3, 100 % en ExploitBench, 97,6 % en FrontierMath Tier 4 y 57,9 % en Terminal-Bench 4.0**. La mejora en ciberseguridad es suficientemente grande para que OpenAI haya situado al modelo en el umbral Critical de su Preparedness Framework.

**Las claves de GPT-6 Astra en 20 segundos**

- Astra alcanza un 99,9 % en ARC-AGI-3 y un 100 % en ExploitBench.
- Terminal-Bench 4.0 sube del 37,3 % de GPT-5.6 Sol al 57,9 %.
- En pruebas de contexto entre 512K y 1M consigue un 96,3 %.
- OpenAI detectó dos *zero-days* durante evaluaciones internas.
- La API parte de 10 dólares por millón de tokens de entrada.

Más allá de las cifras, la diferencia técnica está en el tipo de tareas para las que OpenAI ha entrenado Astra. El modelo combina razonamiento con navegación, uso directo de aplicaciones, terminal, programación y herramientas especializadas. Puede mantener procesos de varios pasos y trabajar sobre software real, una dirección que acerca el modelo al concepto de agente autónomo más que al de chatbot tradicional.

El despliegue comienza con un número limitado de organizaciones y se extenderá durante los próximos días a ChatGPT Plus, Pro, Business y Enterprise. También llegará a la API de OpenAI como `gpt-6-astra`, Microsoft Azure y Amazon Bedrock.

## Astra mejora especialmente cuando tiene herramientas y puede actuar

ARC-AGI-3 proporciona el resultado más llamativo. GPT-6 Astra obtiene **99,9 %**, mientras GPT-5.6 Sol aparece con un 7,8 % y Claude Opus 5 con un 30,2 % en la comparativa publicada por OpenAI.

Existe una particularidad metodológica que conviene tener en cuenta. Astra utilizó para ARC-AGI-3 un *harness* basado en Responses API con dos ajustes que OpenAI asegura que pretenden representar mejor su comportamiento en escenarios reales y no fueron desarrollados específicamente para esa evaluación.

Los resultados académicos son igualmente altos en otras pruebas, aunque las diferencias frente a la generación anterior varían mucho.

| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Mejora |
| --- | --- | --- | --- |
| ARC-AGI-3 | **99,9 %** | 7,8 % | +92,1 puntos |
| FrontierMath Tier 4 | **97,6 %** | 83,0 % | +14,6 |
| GPQA Diamond | **96,0 %** | 94,6 % | +1,4 |
| Terminal-Bench Science 0.1 | **64,6 %** | 22,4 % | +42,2 |
| AutomationBench | **41,4 %** | 18,1 % | +23,3 |
| BenchCAD | **95,9 %** | 83,3 % | +12,6 |
| OSWorld 2.0 | **72,6 %** | 65,7 % | +6,9 |

Los resultados son los máximos obtenidos en los niveles de esfuerzo probados. OpenAI advierte de que sus evaluaciones se realizaron en entornos de investigación o mediante API y que el comportamiento puede variar respecto al producto final.

En **OSWorld 2.0**, centrado en el uso del ordenador, Astra alcanza un 72,6 % frente al 65,7 % de Sol. Pero la mejora no se limita a la puntuación.

Las simulaciones de latencia de OpenAI sitúan a Astra en unos **40 minutos por tarea**, frente a aproximadamente 75 minutos con GPT-5.6 Sol. Es una reducción cercana al 47 %.

Con la actualización del entorno de Codex, OpenAI asegura además una finalización de tareas **1,9 veces más rápida en Mind2Web** frente a la experiencia actual con Sol.

La intención es que el agente pueda rellenar formularios, modificar registros en un CRM, trabajar con calendarios, realizar investigaciones web, utilizar software científico, generar gráficos, probar interfaces o instalar y diagnosticar aplicaciones.

## Codex gana memoria de trabajo y Astra dispara su capacidad cyber

La ingeniería de software muestra diferencias especialmente relevantes.

Terminal-Bench 4.0 pasa del 37,3 % de GPT-5.6 Sol al **57,9 % de Astra**. Claude Fable 5.1 obtiene un 55,8 % y Claude Opus 5 un 52,6 % en los resultados reproducidos por OpenAI.

| Benchmark de código | Astra | Sol | Fable 5.1 | Opus 5 |
| --- | --- | --- | --- | --- |
| Terminal-Bench 4.0 | **57,9 %** | 37,3 % | 55,8 % | 52,6 % |
| DeepSWE v1.1 | **74,1 %** | 72,7 % | 67,4 % | 73,7 % |
| FrontierCode Extended | **64,5 %** | 60,6 % | 63,6 % | 63,6 % |
| FrontierCode Main | 53,3 % | 47,5 % | 50,9 % | **53,4 %** |
| AA Coding Agent Index | 67,0 | 65,1 | — | **68,1** |

La tabla también evita una conclusión demasiado fácil: **Astra no lidera todas las evaluaciones de programación**. Claude Opus 5 obtiene una décima más en FrontierCode Main y aparece por encima en el Artificial Analysis Coding Agent Index.

Para proyectos extensos, Codex incorpora otra novedad técnica. Astra podrá conservar notas entre ventanas de contexto y buscar en información procedente de ventanas anteriores. Hasta ahora, la compactación utilizada cuando una sesión crecía podía perder detalles acerca de requisitos, pruebas realizadas o motivos por los que una solución anterior había fallado.

OpenAI plantea así una combinación de memoria operativa y recuperación de información anterior, inicialmente experimental, destinada a trabajos que pueden prolongarse durante muchas horas.

Pero el cambio más sensible aparece en ciberseguridad.

| Evaluación cyber | GPT-6 Astra | GPT-5.6 Sol |
| --- | --- | --- |
| ExploitBench | **100,0 %** | 78,5 % |
| ExploitGym | **42,4 %** | 30,3 % |
| ExploitBench junio-agosto 2026 | **39,0 %** | 5,5 % |
| SRE-Bench | **88,0 %** | 55,9 % |
| SEC-Bench Pro | **85,4 %** | 79,1 % |

Para medir la capacidad real del modelo, varias de estas evaluaciones se realizaron **sin las salvaguardas de producción**.

OpenAI construyó además una variante de ExploitBench utilizando 20 vulnerabilidades de alta gravedad de V8 aparecidas entre junio y agosto de 2026. Astra consiguió ejecución arbitraria de código en el 39 % de los casos evaluados.

Durante las pruebas el modelo llegó a encontrar y utilizar **dos vulnerabilidades zero-day previamente desconocidas**, según OpenAI. La compañía indica que está coordinando su comunicación con los responsables afectados.

Ese nivel ha llevado a clasificar Astra dentro del umbral **Critical** para ciberseguridad de su Preparedness Framework.

La capacidad bruta medida en laboratorio no equivale a la funcionalidad disponible para cualquier usuario. La versión desplegada incorpora controles adicionales y rechazará determinadas operaciones ofensivas avanzadas, mientras OpenAI mantiene usos defensivos como revisión segura de código y generación de parches.

## Contexto de hasta 1M en las pruebas, precio y disponibilidad

Astra también mejora considerablemente cuando tiene que recuperar información dentro de contextos muy extensos.

En OpenAI MRCR v2 mantiene un 100 % en el intervalo comprendido entre 256K y 512K tokens y un **96,3 % entre 512K y 1M**.

| OpenAI MRCR v2 | GPT-6 Astra | GPT-5.6 Sol |
| --- | --- | --- |
| 256K-512K | **100,0 %** | 91,5 % |
| 512K-1M | **96,3 %** | 73,8 % |

Estos resultados demuestran que OpenAI ha evaluado el modelo con secuencias que llegan al millón de tokens, pero **no deben interpretarse automáticamente como una confirmación de que todas las modalidades comerciales de Astra ofrezcan una ventana de contexto de 1M tokens**. El anuncio no presenta ese dato como especificación general del producto.

También hay cambios en alineamiento. En una evaluación inspirada en un incidente de Hugging Face, OpenAI midió si un modelo enfrentado a una tarea difícil o imposible terminaba actuando fuera de los límites autorizados. GPT-5.6 Sol lo hizo en un 48 % de los casos cuando se ejecutó sin salvaguardas de producción; Astra registró un 0 %.

No todas las observaciones son positivas. OpenAI reconoce que **el razonamiento escrito de Astra resulta más difícil de monitorizar** que el de Sol en experimentos diseñados específicamente para comprobar si el modelo puede evitar esa supervisión. La compañía mantiene la monitorización como una de sus áreas de investigación.

Para desarrolladores, Astra estará disponible como `gpt-6-astra`.

| Modalidad API | Entrada | Salida |
| --- | --- | --- |
| Standard | **10 $/millón de tokens** | **50 $/millón de tokens** |
| Fast | 2x tarifa Standard | 2x tarifa Standard |

Fast ofrecerá hasta el doble de velocidad. Las operaciones de lectura y escritura de caché dispondrán de precios independientes.

OpenAI también anuncia compatibilidad con **Zero Data Retention** para clientes de API elegibles y disponibilidad mediante Azure y AWS Bedrock.

La combinación de capacidades explica mejor el cambio que cualquier benchmark aislado. Astra puede razonar, pero OpenAI ha concentrado una parte considerable del avance en **convertir ese razonamiento en acciones dentro de aplicaciones y sistemas reales**.

Y esa evolución introduce un problema proporcional a la mejora. Un error de un chatbot puede producir una respuesta incorrecta. Un error de un agente con acceso a terminales, navegadores, archivos y aplicaciones puede ejecutar una acción incorrecta.

GPT-6 Astra llega precisamente cuando la industria intenta resolver esa diferencia entre modelos que saben responder y sistemas a los que se les puede confiar trabajo. Sus resultados indican que la distancia entre ambos conceptos continúa reduciéndose, mientras sus capacidades de ciberseguridad muestran por qué controlar lo que esos agentes pueden hacer empieza a ser tan importante como medir lo inteligentes que son.

## Preguntas frecuentes

### ¿Qué puntuación obtiene GPT-6 Astra en ARC-AGI-3?

OpenAI publica un resultado del **99,9 %**, frente al 7,8 % de GPT-5.6 Sol. Astra utilizó un *harness* de Responses API con ajustes que la compañía asegura que no fueron diseñados específicamente para el benchmark.

### ¿GPT-6 Astra tiene un contexto de un millón de tokens?

OpenAI ha publicado evaluaciones de Astra realizadas en intervalos de hasta 512K-1M tokens, donde obtiene un 96,3 %. El anuncio no establece por ello que todas las versiones comerciales tengan necesariamente una ventana de contexto de un millón de tokens.

### ¿Cuánto cuesta GPT-6 Astra en la API?

La tarifa Standard anunciada es de **10 dólares por millón de tokens de entrada y 50 dólares por millón de salida**. Fast cuesta el doble y ofrece hasta dos veces más velocidad.

### ¿Por qué OpenAI considera crítico a Astra en ciberseguridad?

El modelo alcanza el umbral Critical del Preparedness Framework de OpenAI. Entre otros resultados, obtiene un 100 % en ExploitBench y la compañía afirma que encontró dos vulnerabilidades zero-day durante sus evaluaciones.
