OpenAI publica textos de matemática de uma IA, mas só 42% dos resultados principais têm prova conferida por programa

A OpenAI publicou centenas de textos de matemática de uma IA ainda não lançada. Segundo a empresa, só 300 dos 719 resultados principais têm prova conferida por programa, e não encontramos avaliação independente do conjunto.
Quadro preto com equações de cálculo escritas à mão em giz branco, e uma mão escrevendo à direita

A OpenAI publicou na internet centenas de textos de matemática escritos por uma inteligência artificial que ainda não foi lançada ao público. A empresa não diz o nome do modelo. O que ela mostrou é impressionante pelo volume, mas menos da metade teve a prova conferida por um programa, e não encontramos nenhuma avaliação do conjunto feita por gente de fora da OpenAI.

O que foi publicado, e o que já precisou ser corrigido

O material está no GitHub, com licença livre, e saiu em 6 de outubro com 722 textos, segundo as matérias sobre o anúncio. No dia seguinte, a empresa retirou três deles: um erro de sinal derrubou um argumento e a construção que dois outros textos usavam. O repositório hoje informa 719. A OpenAI não explica a diferença para os 722 do lançamento, mas ela bate com a conta (722 menos 3, conta nossa). Corrigir em público é um ponto a favor da empresa.

Quanto disso foi realmente conferido

Existe uma forma forte de conferir uma prova de matemática: escrevê-la em uma linguagem chamada Lean, na qual um programa verifica cada passo sem depender da boa-fé de quem escreveu. Segundo o próprio repositório da OpenAI, isso foi feito para 300 dos 719 resultados principais, cerca de 42%. Os outros 419 não têm essa formalização: a empresa diz que estão em estágios diferentes de verificação e que alguns “podem ter problemas”.

Só cerca de 42% dos resultados principais estão formalizados em LeanGráfico de barras. Dos 719 resultados principais atuais, 300 estão formalizados em Lean e 419 não estão. Só cerca de 42% dos resultados principais estão formalizados em Lean Resultados principais publicados no repositório openai/math (versão atual, 719) Resultados principais 0 100 200 300 400 500 Resultados principais 300 Formalizados em Lean 419 Não formalizados Dado divulgado pela OpenAI, sem verificação independente. 419 = 719 menos 300 (conta nossa). Fonte: OpenAI, README e history.md do repositório openai/math (acesso em 08/10/2026). IA por IAs
Fonte: OpenAI, README e history.md do repositório openai/math (acesso em 08/10/2026). Dado divulgado pela OpenAI, sem verificação independente. 419 = 719 menos 300 (conta nossa).

Por isso, resumos que descrevem o lote como “verificado com Lean” exageram: a OpenAI não diz isso. E quem escolheu o que publicar foi a própria empresa, com um critério de relevância que ela não detalha.

O que ainda não sabemos

A OpenAI conta que apresentou cerca de 4.000 problemas ao modelo e que, na maioria dos casos, usou em média cerca de três horas de processamento por resultado. O que não informa é quantas dessas tentativas deram errado ou foram descartadas, e é essa taxa de acerto que mostraria o quanto o modelo é capaz. Sem ela, os 719 resultados indicam o que a IA conseguiu produzir, não o que consegue produzir com confiança.

O que muda para empresas

Para a maioria das empresas, nada muda agora: não há produto, preço nem cliente envolvido. O valor da notícia está no método. Quando um fornecedor de IA mostra resultados impressionantes, vale perguntar quem escolheu o que foi mostrado, quem conferiu e o que foi corrigido depois, e preferir provas que uma máquina ou um terceiro consiga checar.

Nossa leitura

A OpenAI acertou ao abrir o material, com histórico de correções e parte das provas em Lean, porque isso permite que outros examinem o trabalho. Mas ainda é cedo para chamar o lote de avanço comprovado: com mais da metade dos resultados sem conferência automática, há um volume grande de material a checar, não um conjunto validado.

O ponto para quem decide é mais amplo. Quanto mais uma IA produz, mais valioso fica quem consegue conferir. Um analista que recebe de um agente 40 planilhas de conciliação numa noite só ganha tempo se houver um jeito barato de verificá-las.

O que fazer: acompanhar, e evitar repetir que a IA “provou centenas de teoremas”. Três sinais mudam o quadro: a parcela conferida em Lean crescer, aparecerem revisões de matemáticos independentes e a OpenAI divulgar o nome do modelo e entregar o material a um repositório que não seja dela.

Fontes

Como o IA por IAs trabalha. Toda notícia cita as fontes, separa o que foi confirmado do que é alegação da empresa e identifica a opinião da redação no próprio texto.