AI News

OpenAI afirma que una versión interna de su próximo modelo principal, Astra, ha producido nuevos resultados sobre diez problemas de larga data en matemáticas y ciencias de la computación teórica. La empresa dice que el trabajo abarca geometría, teoría de la codificación, teoría de grupos, complejidad, criptografía y combinatoria, y que posteriormente cada argumento fue formalizado en Lean.

El anuncio importa menos como una afirmación de que la IA haya resuelto de forma independiente un amplio conjunto de problemas famosos que como una prueba de si los modelos de lenguaje pueden generar argumentos matemáticos de nivel de investigación que los expertos puedan inspeccionar y verificar. OpenAI dijo que los problemas no habían visto avances en sus resultados principales durante al menos una década y, en muchos casos, durante mucho más tiempo. La empresa también reconoció que el trabajo sigue sujeto al compromiso y al escrutinio de las comunidades matemáticas pertinentes.

Diez problemas, en varios campos

La lista de OpenAI incluye nuevos cotas superiores para el empaquetamiento de esferas en alta dimensión, llegando hasta el umbral de Cohn–Elkies, así como cotas mejoradas para el tamaño de códigos binarios y esféricos a distancias mínimas especificadas. Estas son cuestiones centrales en geometría de alta dimensión y teoría de la codificación.

En teoría de grupos y álgebras de operadores, la empresa informa de una construcción que muestra que existen grupos no sofic y dice haber refutado la conjetura de rigidez de Connes. Esa conjetura se refiere a si ciertos grupos quedan determinados de forma única por sus álgebras de von Neumann.

Los resultados también incluyen nuevas cotas inferiores para circuitos aritméticos y fórmulas que calculan el permanente. OpenAI da una cota inferior para fórmulas aritméticas del orden de n^4/log n. En teoría de la complejidad, la empresa informa de un teorema exponencial de repetición paralela para juegos cuánticos generales de dos jugadores, ampliando un principio más asentado en entornos clásicos.

Otros resultados informados se refieren al problema del vector más cercano, un problema de retículas vinculado a la criptografía poscuántica; la conjetura de volumen de Ehrhart sobre cuerpos convexos con un único punto interior de retícula; números de Ramsey monocromáticos de triángulos; y cuestiones de compactitud y degeneración en teoría extrema de grafos. OpenAI dice que los últimos resultados resuelven los problemas 146 y 180 de Erdős, mientras que el resultado de Ramsey resuelve el problema 183 de Erdős.

El anuncio sigue a la divulgación anterior de OpenAI de una refutación generada por IA de la conjetura de distancia unitaria de Erdős. La empresa dice que ese resultado ayudó a impulsar investigaciones posteriores de matemáticos externos sobre problemas relacionados en combinatoria aditiva, geometría computacional y complejidad.

Cómo se produjeron los resultados

Según OpenAI, los diez resultados fueron generados por una versión interna de Astra y no por un modelo disponible públicamente. La empresa dice que el uso total de tokens necesario para encontrar las soluciones habría costado aproximadamente 2.000 dólares a precios de la API de Sol. Esa es una estimación del proveedor, no una medida auditada de forma independiente del coste de reproducir la investigación.

Después, personas prepararon los argumentos en manuscritos con el mismo modelo, dijo OpenAI. Posteriormente, el modelo formalizó cada argumento en un certificado Lean. OpenAI también está publicando una narración generada por el modelo del proceso de pensamiento del sistema para cada solución, aunque esa narración no debe considerarse automáticamente como un registro completo o fiel del cálculo interno del modelo.

Las formalizaciones en Lean son importantes porque proporcionan una representación verificable por máquina de las pruebas. Sin embargo, por sí solas no establecen que las afirmaciones subyacentes sean matemáticamente importantes, novedosas en cada detalle o interpretadas correctamente en su contexto de investigación más amplio. Esas cuestiones siguen requiriendo examen por especialistas y comparación con la literatura existente.

Evidencia, atribución e incertidumbre

La evidencia disponible para las afirmaciones procede del anuncio oficial de OpenAI. Un listado separado de estilo agencia lleva el mismo titular, pero el material proporcionado no incluye información independiente ni el texto completo de un artículo de terceros. Como resultado, las afirmaciones más sólidas sobre el rendimiento, el coste y el impacto de investigación del modelo son las reportadas por OpenAI.

OpenAI dice que asume la responsabilidad por la corrección de los manuscritos preparados y de las pruebas formalizadas, mientras atribuye los argumentos matemáticos en sí al sistema. Esa distinción es inusualmente explícita para un anuncio de investigación en IA. Refleja una disputa creciente sobre cómo deben asignarse la autoría y el crédito cuando un modelo propone un argumento, los humanos lo editan y los sistemas formales comprueban partes del resultado.

La empresa no presenta el anuncio como un sustituto de la revisión por pares. En cambio, pide a los matemáticos que sitúen los resultados en contexto y desarrollen las ideas mediante más investigación. Hasta que ese proceso ocurra, el anuncio debe leerse como un informe de argumentos potencialmente significativos generados por máquinas, no como evidencia concluyente de que Astra haya sustituido la investigación matemática experta.

OpenAI también vincula el trabajo con ChatGPT for Academic Researchers, una iniciativa que, según dice, proporcionará a 100.000 científicos y matemáticos acceso gratuito a sus mejores modelos de ChatGPT. Ese programa de acceso es independiente de los resultados de Astra, y el anuncio no muestra que los avances informados puedan reproducirse con las herramientas distribuidas públicamente.

Qué significa para los equipos de investigación y los creadores de IA

Para los investigadores matemáticos, la señal más práctica es la combinación de generación y verificación formal. Un modelo que puede sugerir una prueba plausible pero no puede expresarla en un sistema como Lean sigue siendo difícil de confiar a gran escala. La formalización crea una vía más estrecha para comprobar la corrección, aunque no elimina la necesidad de juicio humano sobre definiciones, novedad y significado.

Para los creadores de IA, el anuncio apunta hacia suites de evaluación basadas en problemas de investigación abiertos en lugar de los puntos de referencia convencionales de preguntas y respuestas. OpenAI dice que ha estado evaluando modelos en esos problemas durante el desarrollo. Este enfoque prueba si un sistema puede sostener el razonamiento multietapa, identificar estructuras intermedias útiles y producir artefactos que otras herramientas puedan verificar.

La economía también es relevante. El coste de inferencia estimado por OpenAI de 2.000 dólares para diez resultados sugiere que el uso de modelos a nivel de investigación puede ser viable para equipos bien financiados, pero la cifra aún no puede generalizarse. Excluye el valor de la revisión experta, la preparación de manuscritos, el trabajo de formalización y la infraestructura necesaria para reproducir o ampliar los resultados. Por tanto, los compradores empresariales deberían distinguir entre el coste bruto de modelo y cómputo y el coste total de un flujo de trabajo de investigación fiable.

Para fundadores y equipos de producto, la oportunidad a corto plazo probablemente esté en sistemas estrechos y conectados con herramientas, más que en matemáticos automatizados de propósito general. Los flujos de trabajo que combinan modelos con demostradores de teoremas, ejecución de código, búsqueda bibliográfica y revisión especializada pueden ser más fiables que los sistemas juzgados solo por explicaciones fluidas.

Qué observar a continuación

La primera señal será la verificación externa de las diez afirmaciones, en particular la supuesta refutación de la conjetura de rigidez de Connes, la construcción de grupos no sofic y el resultado de repetición paralela cuántica. La publicación, las comprobaciones formales independientes y las respuestas detalladas de especialistas mostrarán si los argumentos resisten el escrutinio y cuánto es realmente nuevo.

Los investigadores también deberían vigilar si los certificados Lean son completos, accesibles y utilizables por otros, en lugar de acompañar únicamente manuscritos pulidos. La reproducción por equipos sin acceso al sistema interno Astra de OpenAI proporcionaría una prueba más sólida del valor práctico del trabajo.

Otra pregunta es si surgen resultados similares de modelos disponibles públicamente a un coste materialmente menor. Eso indicaría que la capacidad se está extendiendo por el campo en lugar de seguir siendo una ventaja interna ligada a un único sistema no publicado.

Perspectiva de Creati.ai

El anuncio de OpenAI es significativo porque presenta la IA como generadora de posibles investigaciones matemáticas, al tiempo que expone los límites de esa afirmación. La parte más creíble del flujo de trabajo no es la narración del modelo ni la amplitud de la lista; es el intento de convertir cada argumento en un certificado Lean verificable por máquina y declarar abiertamente cómo se divide la responsabilidad.

La siguiente etapa se decidirá fuera de OpenAI. Si matemáticos independientes validan, simplifican y amplían los resultados, el anuncio podría marcar un cambio relevante en las herramientas de investigación. Si las afirmaciones resultan difíciles de reproducir o de contextualizar, demostrará en cambio por qué la salida del modelo, la verificación formal y el juicio matemático humano deben seguir siendo capas separadas de un mismo proceso.

Destacados

OpenAI informa de diez avances generados por IA en matemáticas y ciencias de la computación teórica

OpenAI dice que su modelo Astra generó diez avances en problemas de larga data de matemáticas y ciencias de la computación teórica, con formalización en Lean para su revisión.