
OpenAI утверждает, что внутренняя версия её следующей крупной модели Astra получила новые результаты по десяти давно стоявшим задачам в математике и теоретической информатике. Компания говорит, что работа охватывает геометрию, теорию кодирования, теорию групп, теорию сложности, криптографию и комбинаторику, а каждый аргумент позднее был формализован в Lean.
Значение объявления состоит не столько в утверждении, что ИИ самостоятельно решил широкий набор известных задач, сколько в проверке того, могут ли языковые модели генерировать математические аргументы исследовательского уровня, которые эксперты способны изучить и верифицировать. OpenAI заявила, что по основным результатам по этим задачам не было прогресса как минимум десять лет, а во многих случаях — значительно дольше. Компания также признала, что эта работа по-прежнему подлежит обсуждению и проверке со стороны соответствующих математических сообществ.
OpenAI’s list includes new upper bounds for high-dimensional sphere packing, reaching down to the Cohn–Elkies threshold, as well as improved bounds for the size of binary and spherical codes at specified minimum distances. These are central questions in high-dimensional geometry and coding theory.
В теории групп и алгебрах операторов компания сообщает о конструкции, показывающей существование не-sofic групп, и говорит, что опровергла гипотезу жёсткости Конна. Эта гипотеза касается того, однозначно ли определяются некоторые группы их алгебрами фон Неймана.
Результаты также включают новые нижние оценки для арифметических схем и формул, вычисляющих перманент. OpenAI приводит нижнюю оценку для арифметических формул порядка n^4/log n. В теории сложности компания сообщает об экспоненциальной теореме о параллельном повторении для общих квантовых игр с двумя игроками, расширяющей принцип, лучше установленный в классических условиях.
Другие сообщаемые результаты касаются задачи ближайшего вектора, задачи о решётках, связанной с постквантовой криптографией; гипотезы Эрдёша о объёме Эрхарта для выпуклых тел с одной внутренней точкой решётки; многокрасочных чисел Рамсея для треугольников; а также вопросов компактности и вырожденности в экстремальной теории графов. OpenAI говорит, что последние результаты решают задачи Эрдёша 146 и 180, а результат по Рамсею решает задачу Эрдёша 183.
Это объявление следует за предыдущим сообщением OpenAI об опровержении гипотезы о единичном расстоянии Эрдёша, сгенерированном ИИ. Компания утверждает, что этот результат помог стимулировать последующие исследования внешних математиков по связанным задачам в аддитивной комбинаторике, вычислительной геометрии и теории сложности.
По словам OpenAI, десять результатов были сгенерированы внутренней версией Astra, а не общедоступной моделью. Компания утверждает, что суммарное использование токенов, необходимое для нахождения решений, стоило бы примерно 2 000 долларов по тарифам Sol API. Это оценка поставщика, а не независимо аудированное измерение стоимости воспроизведения исследования.
Затем люди подготовили аргументы в виде рукописей с той же моделью, заявила OpenAI. После этого модель формализовала каждый аргумент в сертификат Lean. OpenAI также публикует сгенерированное моделью изложение процесса рассуждения системы для каждого решения, хотя такое изложение не следует автоматически считать полным или точным отчётом о внутреннем вычислении модели.
Формализации Lean важны, потому что они предоставляют машинно-проверяемое представление доказательств. Однако сами по себе они не доказывают, что лежащие в основе утверждения математически значимы, новы во всех деталях или правильно интерпретированы в более широком исследовательском контексте. Эти вопросы по-прежнему требуют изучения специалистами и сопоставления с существующей литературой.
Доступные доказательства для этих утверждений исходят из официального объявления OpenAI. Отдельный сводочный материал в стиле wire service содержит тот же заголовок, но предоставленные материалы не включают независимого репортажа или полного текста статьи третьей стороны. В результате наиболее сильные заявления о производительности модели, стоимости и влиянии на исследования исходят из сообщения OpenAI.
OpenAI говорит, что берёт на себя ответственность за корректность подготовленных рукописей и формализованных доказательств, при этом сами математические аргументы приписывает системе. Такое различение необычно явно для объявления об исследовании ИИ. Оно отражает растущий спор о том, как распределять авторство и заслуги, когда модель предлагает аргумент, люди его редактируют, а формальные системы проверяют части результата.
Компания не представляет это объявление как замену рецензирования. Вместо этого она просит математиков поместить результаты в контекст и развивать идеи в дальнейших исследованиях. Пока этот процесс не завершён, объявление следует читать как сообщение о потенциально значимых машинно-сгенерированных аргументах, а не как окончательное доказательство того, что Astra заменила экспертные математические исследования.
OpenAI также связывает эту работу с ChatGPT for Academic Researchers — инициативой, которая, по словам компании, предоставит 100 000 учёных и математиков бесплатный доступ к её лучшим моделям ChatGPT. Эта программа доступа отделена от результатов Astra, и объявление не показывает, что сообщённые прорывы можно воспроизвести с помощью публично распространяемых инструментов.
Для математических исследователей самый практичный сигнал — сочетание генерации и формальной верификации. Модель, которая может предложить правдоподобное доказательство, но не способна выразить его в системе вроде Lean, остаётся трудной для доверия в масштабе. Формализация создаёт более узкий путь проверки корректности, хотя и не устраняет необходимости в человеческом суждении о определениях, новизне и значимости.
Для разработчиков ИИ это объявление указывает на наборы оценки, основанные на открытых исследовательских задачах, а не на обычных бенчмарках вопрос-ответ. OpenAI заявляет, что в ходе разработки оценивала модели именно на таких задачах. Этот подход проверяет, может ли система сохранять многошаговое рассуждение, выявлять полезные промежуточные структуры и создавать артефакты, которые могут быть проверены другими инструментами.
Экономика тоже важна. Оценка OpenAI в 2 000 долларов за инференс для десяти результатов предполагает, что использование модели на исследовательском уровне может быть доступным для хорошо финансируемых команд, но пока этот показатель нельзя обобщать. Он не включает ценность экспертной проверки, подготовки рукописи, работы по формализации и инфраструктуры, необходимой для воспроизведения или расширения результатов. Поэтому корпоративным покупателям следует различать чистую стоимость вычислений модели и полную стоимость надёжного исследовательского процесса.
Для основателей и продуктовых команд краткосрочная возможность, вероятно, заключается в узкоспециализированных, связанных с инструментами системах, а не в универсальных автоматизированных математиках. Рабочие процессы, объединяющие модели с доказателями теорем, выполнением кода, поиском по литературе и экспертной проверкой, могут быть надёжнее систем, оцениваемых только по беглым объяснениям.
Первым сигналом станет внешняя проверка десяти утверждений, особенно заявленного опровержения гипотезы жёсткости Конна, конструкции не-sofic групп и результата по квантовому параллельному повторению. Публикация, независимые формальные проверки и подробные ответы специалистов покажут, выдержат ли аргументы scrutiny и насколько они действительно новы.
Исследователям также следует следить за тем, являются ли сертификаты Lean полными, доступными и пригодными для использования другими, а не просто приложениями к отполированным рукописям. Воспроизведение результатов командами без доступа к внутренней системе Astra от OpenAI дало бы более сильную проверку практической ценности работы.
Ещё один вопрос — появятся ли похожие результаты у публично доступных моделей при существенно меньшей стоимости. Это указало бы на то, что способность распространяется по отрасли, а не остаётся внутренним преимуществом, связанным с одной не выпущенной системой.
Объявление OpenAI значимо потому, что оно представляет ИИ как генератор кандидатов на математические исследования, одновременно показывая пределы этого утверждения. Самая убедительная часть процесса — не повествование модели и не широта списка, а попытка перевести каждый аргумент в машинно-проверяемый Lean-сертификат и открыто указать, как распределяется ответственность.
Следующий этап будет определяться вне OpenAI. Если независимые математики подтвердят, упростят и расширят результаты, объявление может обозначить существенный сдвиг в инструментах исследования. Если же утверждения окажутся трудными для воспроизведения или для помещения в контекст, это покажет, почему вывод модели, формальная верификация и человеческое математическое суждение должны оставаться отдельными слоями одного процесса.
OpenAI заявляет, что её модель Astra сгенерировала десять прорывов в давно стоявших математических и теоретико-информатических задачах, с формализацией в Lean для проверки.