GPT-6 Astra enciende el debate sobre la inteligencia general
Un mismo modelo marca 62,71% en una prueba y 99,9% en otra; la diferencia está en cómo se mide.
El 3 de septiembre de 2026 OpenAI presentó GPT-6 Astra, un modelo que, según la compañía, mejora razonamiento, programación, investigación, uso de computadores y trabajo profesional. El anuncio reavivó una discusión que mezcla lo medible con lo interpretable: cuándo un sistema merece el nombre de inteligencia artificial general (AGI), una máquina capaz de aprender y desempeñarse en distintos ámbitos, no solo en una tarea específica.
Greg Brockman, presidente de OpenAI, dijo en una entrevista con Stratechery que las definiciones de AGI difieren y que no ha llegado ese momento de acuerdo general que imaginaban al principio. Su enfoque, agregó, se centra en el comportamiento del sistema y en su capacidad para aprender y adaptarse, más que en una arquitectura determinada.
Una misma evidencia, diferentes criterios
La disparidad de lecturas se ve en los resultados verificados de ARC Prize. En la prueba ARC-AGI-3, que exige explorar entornos desconocidos, inferir sus reglas y planificar acciones, GPT-6 Astra alcanza 62,71% con el entorno estándar y razonamiento máximo. Con el adaptador del proveedor y razonamiento alto, la tabla marca 99,95%, que la fundación resume como 99,9%.
No son cifras equivalentes. El entorno estándar permite conservar notas elegidas por el modelo; el adaptador, en cambio, preserva el estado interno de razonamiento entre solicitudes y usa compactación para conversaciones prolongadas. Por eso los máximos corresponden a condiciones de evaluación distintas.
ARC Prize también advierte que la prueba se desarrolla en escenarios acotados, con mecanismos y objetivos definidos, que no reflejan toda la complejidad del mundo real. Para la organización, saturar el benchmark, o prueba estandarizada, no constituye una prueba de AGI.
Forrester, en tanto, clasifica a Astra como una forma inicial de AGI competente. Brian Hopkins y Mike Gualtieri basan esa lectura en tres criterios: aprendizaje, colaboración y construcción de herramientas. Pero reconocen que el aprendizaje se limita a una sesión y que la colaboración sigue siendo poco fiable. Su clasificación contempla supervisión estrecha y la distingue de una AGI independiente o de una superinteligencia; es una conclusión válida dentro del marco de Forrester, no un acuerdo general.
La AGI Society llega a una conclusión más cauta: la evidencia publicada no permite afirmar que Astra haya alcanzado AGI. Su revisión separa evaluaciones directas del modelo, resultados de sistemas anteriores, estimaciones y capacidades sin pruebas comparables. Así evita confundir falta de evaluación con incapacidad demostrada y también impide atribuir a Astra logros de otros modelos.
Generalidad, rendimiento y seguridad
El estudio Levels of AGI, de Google DeepMind, propone clasificar los sistemas según la amplitud de sus capacidades y su nivel de rendimiento, y ver cómo eso se relaciona con la autonomía y los riesgos del despliegue. Ese enfoque lleva a preguntas más precisas: qué tareas puede hacer un sistema, con qué fiabilidad, bajo qué condiciones y con cuánta intervención humana. Un resultado sobresaliente en un ámbito no resuelve esas preguntas para todos los demás.
La propia OpenAI advierte que sus evaluaciones se hicieron en entornos de investigación o mediante la API (interfaz de programación de aplicaciones), y que pueden diferir del comportamiento en ChatGPT por las instrucciones y herramientas disponibles. Esa salvedad importa al trasladar una puntuación de laboratorio al uso cotidiano.
En seguridad, OpenAI identifica a Astra como su primer modelo con nivel Critical (crítico) de ciberseguridad dentro de su Preparedness Framework (marco de preparación para riesgos). Según la empresa, con las herramientas y el acceso adecuados puede encontrar vulnerabilidades desconocidas y explotarlas sin supervisión humana en cada paso. Esa capacidad evaluada es distinta de las funciones habilitadas al público: la versión lanzada rechaza tareas como crear pruebas de concepto para explotar fallas, aunque permite revisar código y corregir errores. La compañía también dice que monitorea el razonamiento y las acciones para detectar conductas no autorizadas, pero esa clasificación no determina por sí misma si el sistema es AGI.
Para Chile, el hito ocurre fuera del país y los materiales citados no informan plazos de disponibilidad local. Su relevancia, por ahora, es conceptual: ayuda a distinguir entre un buen resultado en una prueba y la inteligencia general. La conclusión más prudente es que Astra aporta datos relevantes al debate, pero presentarla como AGI demostrada excedería lo que permiten concluir las fuentes.
Con información de DiarioTI