AI News

OpenAI ha publicado una nota de benchmark muy seguida que sostiene que el rendimiento de un modelo en pruebas difíciles de agentes puede depender tanto del diseño del harness como del propio modelo. En una publicación sobre ARC-AGI-3, la compañía dijo que activar dos ajustes en su Responses API — retained reasoning y compaction — elevó la puntuación de GPT-5.6 Sol en el conjunto público de tareas del 13,3 % al 38,3 %, al tiempo que reducía los tokens de salida en aproximadamente seis veces.

El resultado importa más allá de un único benchmark de rompecabezas. ARC-AGI-3 está diseñado para probar si los agentes de IA pueden aprender juegos 2D desconocidos mediante la interacción y no mediante instrucciones explícitas. La afirmación de OpenAI es que la configuración predeterminada del benchmark estaba suprimiendo el rendimiento al descartar el razonamiento interno entre acciones y recortar el contexto antiguo a medida que crecían las sesiones. Para desarrolladores y compradores de IA, eso convierte una historia de benchmark en una historia de despliegue: la forma en que se envuelve, se le da prompt y se le permite gestionar la memoria a un modelo puede cambiar de forma material lo que puede hacer.

Qué cambió OpenAI en la configuración de ARC-AGI-3

Según OpenAI, la compañía inicialmente vio resultados sorprendentemente débiles de GPT-5.6 Sol en ARC-AGI-3. El modelo obtuvo un 7,8 % en un encuadre anterior comentado por la empresa, y OpenAI dijo que GPT-5.5 era aún más bajo. En el conjunto público usando el harness oficial, OpenAI informa ahora que GPT-5.6 Sol alcanzó un 13,3 %.

La empresa dice que investigó por qué un modelo que había mostrado un fuerte desempeño en otras tareas tipo juego parecía ineficaz aquí. Su conclusión fue que el harness ARC-AGI-3 predeterminado no preservaba el razonamiento privado del modelo entre turnos y utilizaba un esquema de truncamiento rodante que eliminaba gradualmente de la vista las interacciones antiguas.

La implementación alternativa de OpenAI utilizó la Responses API de una manera que, según afirma, refleja cómo se despliegan los modelos en ChatGPT y Codex. El primer ajuste, retained reasoning, mantiene disponible el razonamiento privado previo a través de llamadas a herramientas y turnos cuando se pasa hacia adelante el ID de la respuesta anterior. El segundo, compaction, resume y comprime el historial en lugar de simplemente descartar el contexto antiguo cuando se alcanzan los límites.

Con esos dos cambios activados, OpenAI dice que GPT-5.6 Sol alcanzó el 38,3 % en el conjunto público de ARC-AGI-3. La empresa también afirma que el uso de tokens de salida cayó 6x, lo que atribuye a que el modelo dedicó menos tiempo a re-derivar el estado del juego en cada movimiento.

Por qué ARC-AGI-3 expuso un problema más amplio de los benchmarks

ARC-AGI-3 está pensado para medir el razonamiento adaptativo en entornos desconocidos. Los modelos reciben representaciones en texto de fotogramas del juego e información del nivel, y luego deben inferir reglas mediante prueba y error. OpenAI señala que los mantenedores del benchmark eligieron a propósito un harness genérico, con el objetivo de hacer más visibles las debilidades de los modelos y más justas las comparaciones entre sistemas.

Ese objetivo de diseño crea una tensión ya común en la evaluación de IA. Un harness genérico puede estandarizar las pruebas, pero también puede divergir de cómo los principales proveedores de modelos entrenan y prestan realmente sus sistemas. El argumento de OpenAI es que ARC-AGI-3 estaba probando en la práctica no solo el modelo, sino un patrón de interacción con memoria restringida que difiere del uso en producción en ChatGPT y Codex.

No es una distinción trivial. Muchos agentes de IA actuales dependen de estado persistente, planificación a largo plazo y gestión del contexto para rendir de forma fiable. Si un benchmark elimina esas capacidades para todos los participantes, puede mejorar la comparabilidad. Pero si una familia de modelos está entrenada explícitamente para usar retained reasoning y contexto resumido, el benchmark puede infravalorar cómo se comporta ese sistema en herramientas reales.

Al mismo tiempo, la publicación de OpenAI también subraya el riesgo contrario: que las mejoras de benchmark logradas mediante decisiones de harness difuminen la línea entre medir el modelo y medir la pila de software circundante. Para las empresas que comparan modelos, eso significa que las cifras del leaderboard pueden decir menos de lo esperado si las condiciones de evaluación no coinciden con el despliegue previsto.

Evidencia, matices y qué está reportado por el proveedor

Las afirmaciones más sólidas de esta historia están reportadas por el proveedor. OpenAI es la fuente principal del aumento de puntuación del 13,3 % al 38,3 %, de la reducción 6x de tokens de salida y de la explicación de que retained reasoning y compaction causaron la mejora.

OpenAI también dice que las puntuaciones de ARC-AGI-3 se miden mediante Relative Human Action Efficiency, o RHAE, y cita registros oficiales de juego para estimar que el evaluador humano promedio obtuvo un 48 %. Esa estimación humana se presenta por OpenAI como una estimación y no como un resultado nuevo de benchmark.

La empresa además sostiene que, con su harness, GPT-5.6 Sol resuelve los seis niveles de un juego mostrado en el leaderboard, mientras que “ningún modelo frontier” resuelve ningún nivel más allá del primero en el encuadre predeterminado del leaderboard. Dado que el artículo es el análisis propio de OpenAI sobre el benchmark y el harness, los lectores deberían tratar esas comparaciones como afirmaciones del proveedor salvo que se reproduzcan de forma independiente.

Hay otras limitaciones. El artículo no ofrece una replicación externa, ni una nueva puntuación neutral en varios laboratorios, ni una comparación cara a cara que muestre si cambios similares de preservación de memoria también elevarían a modelos rivales en cantidades comparables. Tampoco resuelve la cuestión normativa de qué debería medir ARC-AGI-3: el comportamiento bruto del modelo en una interfaz genérica restringida, o el rendimiento en una pila de agentes optimizada por el proveedor.

Aun así, incluso con esos matices, el punto de fondo es creíble y cada vez más importante. Los ajustes de la API, la retención de contexto, la política de truncamiento y la orquestación de herramientas pueden cambiar de forma medible el comportamiento de los agentes. OpenAI es inusual aquí principalmente porque cuantificó el efecto en una nota pública de benchmark.

Qué significa esto para desarrolladores de IA y equipos empresariales

Para los equipos de producto que construyen agentes de IA, la lección práctica es que la arquitectura de memoria ya no es un detalle de implementación de back-office. Si un sistema pierde repetidamente planes, observaciones o hipótesis previas, el rendimiento puede colapsar en tareas de varios pasos incluso cuando el modelo base es fuerte. La explicación de OpenAI sugiere que retained reasoning es especialmente importante cuando las acciones se desarrollan a lo largo de secuencias largas y el modelo debe aprender de intentos anteriores.

Para los equipos que usan la Responses API, OpenAI está planteando en la práctica un argumento de producto: la compañía dice que estos ajustes no son retoques exóticos, sino parte del patrón operativo normal detrás de ChatGPT y Codex. Si eso es cierto, los desarrolladores que hacen benchmarks de modelos en bucles simplificados podrían estar probando una configuración que el proveedor no considera representativa.

La afirmación sobre eficiencia de tokens puede importar tanto como la mejora de puntuación. Una reducción 6x de los tokens de salida, si se reproduce en otras cargas de trabajo de agentes, afectaría tanto a la latencia como al coste. En despliegues de IA empresarial, los flujos de trabajo de larga duración a menudo fallan no solo por la calidad del razonamiento, sino porque se vuelven lentos, caros o frágiles a medida que crece el contexto. En la versión de OpenAI, compaction mejora tanto la continuidad como la eficiencia al evitar la pérdida brusca propia del truncamiento rodante.

La historia también tiene implicaciones para la práctica de evaluación. Los compradores que comparan sistemas para uso empresarial de IA deberían preguntar a los proveedores no solo qué modelo se probó, sino qué harness, qué ajustes de memoria, qué protocolo de herramientas y qué política de contexto se utilizaron. Los benchmarks que no especifiquen claramente esas capas pueden ser menos portables a decisiones reales de adquisición de lo que parecen.

Competencia y la política de benchmarks detrás de la publicación

La publicación de OpenAI llega en medio de una presión creciente sobre los laboratorios de modelos frontier para explicar no solo cómo puntúan los modelos, sino por qué puntúan de esa manera. Los benchmarks moldean cada vez más las narrativas en torno al liderazgo de los modelos, pero muchos benchmarks de agentes dependen de envoltorios y decisiones operativas fuera del modelo central.

Al destacar retained reasoning y compaction, OpenAI también adopta una posición más amplia: que el rendimiento moderno de la IA debería evaluarse como una propiedad del sistema, no solo como una propiedad de los pesos. Ese enfoque beneficia a proveedores con productos estrechamente integrados como ChatGPT, Codex y pilas de serving propietarias, porque pueden argumentar que el cliente compra un comportamiento de extremo a extremo, no un modelo base abstracto.

Esa postura no será aceptada universalmente. Algunos investigadores prefieren benchmarks austeros precisamente porque exponen debilidades que el ajuste del producto puede ocultar. Otros argumentarán que si los usuarios despliegan modelos con memoria, resúmenes y bucles de herramientas, las evaluaciones deberían reflejar esa realidad. El debate de ARC-AGI-3 probablemente será uno de varios puntos de fricción donde esas filosofías colisionen.

Qué vigilar a continuación

La señal de seguimiento más importante es la replicación independiente. Si terceros reproducen las ganancias de OpenAI en ARC-AGI-3 usando los mismos ajustes de la Responses API, el hallazgo parecerá menos un blog puntual del proveedor y más una lección de metodología de benchmark.

Una segunda señal es si los mantenedores de ARC-AGI-3 responden añadiendo pistas de harness alternativas, como una base genérica y una pista de agente optimizada para producción. Eso preservaría comparaciones homogéneas a la vez que reconocería que los sistemas del mundo real dependen de la gestión de memoria.

En tercer lugar, conviene observar si OpenAI extiende el mismo argumento a otras evaluaciones. Si retained reasoning y compaction mejoran de forma material otras tareas de largo horizonte, las implicaciones para los agentes de IA, los productos de asistente de programación y la automatización del trabajo podrían ser más amplias que este único benchmark.

Por último, los equipos empresariales deberían vigilar una documentación más clara de los proveedores sobre el manejo del contexto. Si los proveedores de modelos empiezan a publicar recetas estándar de benchmark para ChatGPT, Codex, GPT-5.6 Sol y sistemas relacionados, podría ser más fácil comparar el comportamiento de la IA empresarial de una manera que se ajuste al despliegue.

Perspectiva de Creati.ai

La publicación de OpenAI es interesada, pero pone de relieve un problema real en la evaluación de IA: las puntuaciones de los benchmarks a menudo se tratan como si provinieran solo del modelo cuando en realidad reflejan una pila de decisiones de diseño. Para cualquiera que construya agentes de IA, la conclusión es sencilla. La retención de memoria, la política de resumen y la estructura del bucle de herramientas pueden ser decisiones de producto de primer orden, no adornos de implementación.

La conclusión más estratégica es para los compradores de IA empresarial. No adquiera basándose en una puntuación llamativa de un modelo sin entender el harness que hay detrás. Si OpenAI tiene razón, un wrapper mal ajustado puede hacer que un modelo capaz parezca débil, y uno bien ajustado puede desbloquear grandes mejoras tanto en fiabilidad como en coste. Eso desplaza la ventaja competitiva hacia los proveedores y equipos que pueden alinear el comportamiento del modelo, la infraestructura de serving y el diseño de la aplicación en un sistema coherente.

Destacados

OpenAI dice que dos ajustes de la Responses API mejoraron drásticamente GPT-5.6 Sol en ARC-AGI-3

OpenAI afirma que el razonamiento retenido y la compaction elevaron casi 3x la puntuación de GPT-5.6 Sol en ARC-AGI-3, destacando cómo el diseño del harness da forma a los benchmarks de IA.