AI News

A OpenAI afirma que uma versão interna de seu próximo grande modelo, Astra, produziu novos resultados em dez problemas de longa data da matemática e da ciência da computação teórica. A empresa diz que o trabalho abrange geometria, teoria da codificação, teoria dos grupos, complexidade, criptografia e combinatória, com cada argumento posteriormente formalizado em Lean.

O anúncio importa menos como uma afirmação de que a IA resolveu de forma independente um amplo conjunto de problemas famosos e mais como um teste de se modelos de linguagem podem gerar argumentos matemáticos de nível de pesquisa que especialistas possam inspecionar e verificar. A OpenAI disse que os problemas não viam progresso em seus principais resultados há pelo menos uma década e, em muitos casos, há muito mais tempo. A empresa também reconheceu que o trabalho continua sujeito ao engajamento e ao escrutínio das comunidades matemáticas relevantes.

Dez problemas, em várias áreas

OpenAI’s list includes new upper bounds for high-dimensional sphere packing, reaching down to the Cohn–Elkies threshold, as well as improved bounds for the size of binary and spherical codes at specified minimum distances. These are central questions in high-dimensional geometry and coding theory.

Na teoria dos grupos e em álgebras de operadores, a empresa relata uma construção que mostra que existem grupos não-soficos e diz ter refutado a conjectura de rigidez de Connes. Essa conjectura diz respeito a se certos grupos são determinados de forma única por suas álgebras de von Neumann.

Os resultados também incluem novos limites inferiores para circuitos aritméticos e fórmulas que computam o permanente. A OpenAI fornece um limite inferior para fórmulas aritméticas da ordem de n^4/log n. Na teoria da complexidade, a empresa relata um teorema de repetição paralela exponencial para jogos quânticos gerais de dois jogadores, estendendo um princípio mais bem estabelecido em contextos clássicos.

Outros resultados relatados dizem respeito ao problema do vetor mais próximo, um problema de reticulados ligado à criptografia pós-quântica; à conjectura de volume de Ehrhart sobre corpos convexos com um único ponto de reticulado interior; aos números de Ramsey multicoloridos de triângulos; e a questões de compacidade e degenerescência na teoria extremal dos grafos. A OpenAI diz que os últimos resultados resolvem os problemas 146 e 180 de Erdős, enquanto o resultado de Ramsey resolve o problema 183 de Erdős.

O anúncio segue a divulgação anterior da OpenAI de uma refutação gerada por IA da conjectura da distância unitária de Erdős. A empresa diz que esse resultado ajudou a motivar pesquisas subsequentes de matemáticos externos sobre problemas relacionados em combinatória aditiva, geometria computacional e complexidade.

Como os resultados foram produzidos

De acordo com a OpenAI, os dez resultados foram gerados por uma versão interna de Astra, e não por um modelo publicamente disponível. A empresa diz que o uso total de tokens necessário para encontrar as soluções teria custado aproximadamente US$ 2.000 nas tarifas da Sol API. Trata-se de uma estimativa do fornecedor, não de uma medida auditada de forma independente do custo para reproduzir a pesquisa.

Os humanos então prepararam os argumentos em manuscritos com o mesmo modelo, disse a OpenAI. Em seguida, o modelo formalizou cada argumento em um certificado Lean. A OpenAI também está divulgando uma narração gerada pelo modelo do processo de raciocínio do sistema para cada solução, embora tal narração não deva ser automaticamente tratada como um registro completo ou fiel do cálculo interno do modelo.

As formalizações em Lean são importantes porque fornecem uma representação verificável por máquina das provas. Elas não estabelecem, por si sós, que as alegações subjacentes sejam matematicamente importantes, novas em todos os detalhes ou corretamente interpretadas em seu contexto mais amplo de pesquisa. Essas questões ainda exigem exame por especialistas e comparação com a literatura existente.

Evidência, atribuição e incerteza

A evidência disponível para as alegações vem do anúncio oficial da OpenAI. Uma listagem separada em estilo de wire service traz a mesma manchete, mas o material fornecido não inclui reportagem independente nem o texto completo de um artigo de terceiros. Como resultado, as alegações mais fortes sobre o desempenho do modelo, o custo e o impacto na pesquisa são reportadas pela OpenAI.

A OpenAI diz assumir a responsabilidade pela correção dos manuscritos preparados e das provas formalizadas, ao mesmo tempo em que atribui os argumentos matemáticos propriamente ditos ao sistema. Essa distinção é explicitamente incomum para um anúncio de pesquisa em IA. Ela reflete uma disputa crescente sobre como autoria e crédito devem ser atribuídos quando um modelo propõe um argumento, humanos o editam e sistemas formais verificam partes do resultado.

A empresa não está apresentando o anúncio como substituto da revisão por pares. Em vez disso, pede que matemáticos situem os resultados no contexto e desenvolvam as ideias por meio de pesquisas adicionais. Até que esse processo ocorra, o anúncio deve ser lido como um relato de argumentos potencialmente significativos gerados por máquina, e não como prova definitiva de que Astra substituiu a pesquisa matemática especializada.

A OpenAI também vincula o trabalho ao ChatGPT for Academic Researchers, uma iniciativa que, segundo a empresa, fornecerá a 100.000 cientistas e matemáticos acesso gratuito aos seus melhores modelos do ChatGPT. Esse programa de acesso é separado dos resultados do Astra, e o anúncio não mostra que os avanços relatados possam ser reproduzidos usando as ferramentas distribuídas publicamente.

O que isso significa para equipes de pesquisa e construtores de IA

Para pesquisadores matemáticos, o sinal mais prático é a combinação entre geração e verificação formal. Um modelo que pode sugerir uma prova plausível, mas não consegue expressá-la em um sistema como o Lean, continua difícil de confiar em escala. A formalização cria um caminho mais estreito para verificar a correção, embora não elimine a necessidade de julgamento humano sobre definições, novidade e relevância.

Para os construtores de IA, o anúncio aponta para suítes de avaliação baseadas em problemas de pesquisa abertos, em vez de benchmarks convencionais de pergunta e resposta. A OpenAI diz ter avaliado modelos com tais problemas durante o desenvolvimento. Essa abordagem testa se um sistema consegue sustentar raciocínio em múltiplas etapas, identificar estruturas intermediárias úteis e produzir artefatos que outras ferramentas possam verificar.

A economia também é relevante. O custo estimado pela OpenAI de US$ 2.000 em inferência para dez resultados sugere que o uso de modelo em nível de pesquisa pode ser viável para equipes bem financiadas, mas o número ainda não pode ser generalizado. Ele exclui o valor da revisão de especialistas, da preparação do manuscrito, do trabalho de formalização e da infraestrutura necessária para reproduzir ou ampliar os resultados. Compradores corporativos, portanto, devem distinguir o custo bruto de computação do modelo do custo total de um fluxo de trabalho de pesquisa confiável.

Para fundadores e equipes de produto, a oportunidade de curto prazo provavelmente está em sistemas estreitamente conectados a ferramentas, e não em matemáticos automatizados de uso geral. Fluxos de trabalho que combinam modelos com demonstradores de teoremas, execução de código, busca bibliográfica e revisão especializada podem ser mais confiáveis do que sistemas julgados apenas por explicações fluentes.

O que observar a seguir

O primeiro sinal será a verificação externa das dez alegações, especialmente a suposta refutação da conjectura de rigidez de Connes, a construção de grupos não-soficos e o resultado de repetição paralela quântica. Publicação, verificações formais independentes e respostas detalhadas de especialistas mostrarão se os argumentos resistem ao escrutínio e quanta novidade realmente há.

Os pesquisadores também devem observar se os certificados Lean são completos, acessíveis e utilizáveis por outras pessoas, em vez de apenas acompanharem manuscritos polidos. A reprodução por equipes sem acesso ao sistema interno Astra da OpenAI forneceria um teste mais forte do valor prático do trabalho.

Outra questão é se resultados semelhantes surgem de modelos publicamente disponíveis a um custo materialmente menor. Isso indicaria que a capacidade está se espalhando pelo campo, em vez de permanecer uma vantagem interna ligada a um único sistema não lançado.

Perspectiva da Creati.ai

O anúncio da OpenAI é significativo porque apresenta a IA como geradora de candidatos a pesquisa matemática, ao mesmo tempo em que expõe os limites dessa afirmação. A parte mais crível do fluxo de trabalho não é a narração do modelo nem a amplitude da lista; é a tentativa de converter cada argumento em um certificado Lean verificável por máquina e de declarar abertamente como a responsabilidade é dividida.

A próxima etapa será decidida fora da OpenAI. Se matemáticos independentes validarem, simplificarem e estenderem os resultados, o anúncio poderá marcar uma mudança relevante nas ferramentas de pesquisa. Se as alegações se mostrarem difíceis de reproduzir ou de contextualizar, ele demonstrará por que a saída do modelo, a verificação formal e o julgamento matemático humano devem permanecer em camadas separadas do mesmo processo.

Em Destaque

OpenAI relata dez avanços gerados por IA em matemática e ciência da computação teórica

A OpenAI afirma que seu modelo Astra gerou dez avanços em problemas de longa data de matemática e ciência da computação teórica, com formalização em Lean para revisão.