AI can write proofs faster than science can trust themLa IA puede escribir demostraciones más rápido de lo que la ciencia puede confiar en ellas · V8.2 Master Engine
54 slides · 32 min · 1 hour ago54 láminas · 32 min · hace 1 hlanguage
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
AI systems report solving up to 85% of a corrected frontier-math benchmark, yet 42% of its problems required error corrections and performance remains uneven across research proofs and ordinary clock reading.
OpenAI reports a construction at 88 hours and Lean verification at 105.
6 technical terms carry much of the argument.
Los sistemas de IA reportan resolver hasta el 85 % de un benchmark corregido de matemáticas de frontera, pero el 42 % de sus problemas requirió correcciones y el desempeño sigue siendo desigual entre pruebas de investig…
OpenAI informa una construcción en 88 horas y una verificación en Lean en 105.
6 términos técnicos sostienen buena parte del argumento.
AI systems report solving up to 85% of a corrected frontier-math benchmark, yet 42% of its problems required error corrections and performance remains uneven across research proofs and ordinary clock reading.
Los sistemas de IA reportan resolver hasta el 85 % de un benchmark corregido de matemáticas de frontera, pero el 42 % de sus problemas requirió correcciones y el desempeño sigue siendo desigual entre pruebas de investigación y la lectura cotidiana de relojes.
6 términos técnicos sostienen buena parte del argumento.
Start with the correction, not the hype. Clay's own classification still puts 5 of the 7 problems in the unsolved column. Navier-Stokes is active, not accepted, and the public claim was only five days old when this snapshot was taken.
Empieza por la corrección, no por el hype. La propia clasificación de Clay todavía coloca 5 de los 7 problemas en la categoría de no resueltos. Navier-Stokes está activo, no aceptado, y la afirmación pública apenas tenía cinco días cuando se tomó esta instantánea.
Clay's status page converts the fund into a stark balance sheet: $1 million solved, $1 million active, and $5 million still attached to problems classified as unsolved.
La página de estado de Clay convierte el fondo en un balance contundente: $1 millón resuelto, $1 millón activo y $5 millones aún ligados a problemas clasificados como no resueltos.
The prize system is simple enough to remember. There are 7 problems and $1 million attached to each one. But the money follows institutional acceptance, not an announcement, so the fund is a promise of recognition rather than a scoreboard.
El sistema de premios es lo bastante sencillo como para recordarlo. Hay 7 problemas y $1 millón asociado a cada uno. Pero el dinero depende de la aceptación institucional, no de un anuncio, así que el fondo promete reconocimiento, no funciona como marcador.
Clay's timeline is deliberately slower than a press cycle. A proposed solution must clear a minimum 2-year wait, while the institution can keep decision records private for 50 years. Those are different rules, but together they explain why a breakthrough announcement cannot settle the prize question.
El calendario de Clay avanza deliberadamente más lento que un ciclo de prensa. Una solución propuesta debe superar una espera mínima de 2 años, mientras que la institución puede mantener privados los registros de decisión durante 50 años. Son reglas distintas, pero juntas explican por qué el anuncio de un avance no puede zanjar la cuestión del premio.
The portrait of OpenAI’s leader sharpens the distinction between public authority and institutional verification.
El retrato del líder de OpenAI acentúa la diferencia entre la autoridad pública y la verificación institucional.
This is the speed claim that makes the story feel different. OpenAI reports reaching the construction in 88 hours, then spending 17 more hours formalizing it in Lean. The important boundary is scope: the work addresses forced alternatives C and D, and machine checking does not equal institutional acceptance.
Esta es la afirmación de velocidad que hace que la historia parezca distinta. OpenAI informa que alcanzó la construcción en 88 horas y luego dedicó 17 horas más a formalizarla en Lean. El límite importante es el alcance: el trabajo aborda las alternativas forzadas C y D, y la verificación automática no equivale a una aceptación institucional.
The atmospheric vortices give the Navier–Stokes claim a physical scale as the deck narrows its mathematical scope.
Los vórtices atmosféricos dan una escala física a la afirmación sobre Navier–Stokes mientras el relato delimita su alcance matemático.
The phrase solved Navier-Stokes hides a crucial boundary. OpenAI claims 2 of 4 official alternatives, C and D, through a construction with smooth forcing. The unforced smooth-data alternatives A and B remain outside the result.
La expresión «resolvió Navier-Stokes» oculta un límite crucial. OpenAI afirma abordar 2 de 4 alternativas oficiales, C y D, mediante una construcción con forzamiento suave. Las alternativas A y B, con datos suaves y sin fuerza externa, quedan fuera del resultado.
The Navier-Stokes effort dominated the reported campaign. It used 130 billion of roughly 300 billion output tokens and 2.7 million of 4.9 million messages. Those figures measure search scale, not mathematical acceptance.
El trabajo en Navier-Stokes dominó la campaña reportada. Utilizó 130 mil millones de aproximadamente 300 mil millones tokens de salida y 2,7 millones de 4,9 millones mensajes. Estas cifras miden la escala de búsqueda, no la aceptación matemática.
The campaigns occupied radically different computational regimes: 31 million tokens for the Riemann advance, 6 billion for Fermat formalization, and 130 billion for the claimed Navier-Stokes construction.
Las campañas ocuparon regímenes computacionales radicalmente distintos: 31 millones de tokens para el avance de Riemann, 6.000 millones para la formalización de Fermat y 130.000 millones para la construcción propuesta de Navier-Stokes.
Stokes’s portrait places a human mathematical legacy beside an AI campaign operating at industrial computational scale.
El retrato de Stokes sitúa un legado matemático humano junto a una campaña de IA de escala computacional industrial.
The two Anthropic projects used radically different amounts of model output. Fermat formalization consumed about 6 billion tokens, versus 31 million for the Riemann project. Formal verification can be more computationally intensive than finding a promising mathematical argument.
Los dos proyectos de Anthropic utilizaron cantidades radicalmente distintas de producción del modelo. La formalización de Fermat consumió aproximadamente 6 mil millones tokens, frente a 31 millones en el proyecto de Riemann. La verificación formal puede exigir más recursos computacionales que encontrar un argumento matemático prometedor.
The race was not only between humans and machines. Two related formalized results appeared on the same day, with OpenAI's announcement arriving roughly 7 hours later. The audit found 2.3 million combined lines and no development history, making provenance part of the result itself.
La competencia no fue solo entre humanos y máquinas. Dos resultados formalizados relacionados aparecieron el mismo día, y el anuncio de OpenAI llegó aproximadamente 7 horas después. La auditoría encontró 2,3 millones líneas combinadas y ningún historial de desarrollo, lo que convierte la procedencia en parte del resultado mismo.
The important distinction is partial progress versus a solved Millennium Problem. Claude reportedly moved the proven lower bound from 41.6% to 67.2%. The argument extends to primitive Dirichlet L-functions and was formally verified in Lean 4. Anthropic reports 31 million output tokens, 650 initial ideas, about 60 subagents, 2,400 shell commands, and 54 downloaded papers.
La distinción importante es entre progreso parcial y la resolución de un problema del milenio. Según informes, Claude movió el límite inferior demostrado de 41,6% a 67,2%. El argumento se extiende a funciones L primitivas de Dirichlet y fue verificado formalmente en Lean 4. Anthropic informa 31 millones de tokens de salida, 650 ideas iniciales, aproximadamente 60 subagentes, 2.400 comandos de shell y 54 artículos descargados.
Claude closed 25.6 percentage points of the numerical gap, but 32.8 points remain; that arithmetic does not imply that the proof is two-thirds complete.
Claude cerró 25,6 puntos porcentuales de la brecha numérica, pero quedan 32,8 puntos; esa aritmética no implica que la demostración esté completada en dos tercios.
Claude's reported lower bound is a major mathematical advance. The Millennium Problem, however, asks for the claim across 100% of the relevant zeros. The 32.8-point difference is not a measure of remaining difficulty, but it makes the logical gap visible.
El límite inferior reportado por Claude es un avance matemático importante. Sin embargo, el Problema del Milenio exige demostrar la afirmación para 100% de los ceros relevantes. La diferencia de 32,8 puntos no mide la dificultad restante, pero hace visible la brecha lógica.
The scattered primes make the core warning tangible because visible structure is not the same as an infinite proof.
Los primos dispersos hacen tangible la advertencia central porque una estructura visible no equivale a una demostración infinita.
This achievement is best understood as automated formalization, not a new discovery of Fermat's Last Theorem. The platform tracked about 30,300 statements, while the final dependency tree used 29,511 theorems that were rechecked. The run took 11 days and consumed about 6 billion output tokens. Humans supplied only the one-line goal, according to the supplied account.
Este logro se entiende mejor como formalización automatizada, no como un nuevo descubrimiento del último teorema de Fermat. La plataforma registró aproximadamente 30.300 enunciados, mientras que el árbol final de dependencias utilizó 29.511 teoremas que volvieron a verificarse. La ejecución tomó 11 días y consumió aproximadamente 6 mil millones tokens de salida. Según el relato proporcionado, los humanos solo aportaron el objetivo de una sola línea.
The drafting tools frame formalization as a change in how mathematical reasoning is built, preserved, and inspected.
Las herramientas de dibujo presentan la formalización como un cambio en la forma de construir, conservar e inspeccionar el razonamiento matemático.
The striking number is five of ten attempts judged likely correct. But that was not a final acceptance result. OpenAI later acknowledged that its initially favored Problem 2 assessment was incorrect. The lesson is simple: AI can produce promising mathematical work faster than the community can validate it.
La cifra llamativa es cinco de diez intentos considerados probablemente correctos. Pero no fue un resultado final de aceptación. OpenAI reconoció después que su evaluación inicialmente preferida del Problema 2 era incorrecta. La lección es sencilla: la IA puede producir trabajo matemático prometedor más rápido de lo que la comunidad puede validarlo.
The improvement looks small because it sits inside an exponent. Its effect grows with the size of the point set. Will Sawin refined the AI-generated construction to reach n^1.014 pairs for infinitely many n.
La mejora parece pequeña porque está dentro de un exponente. Su efecto crece con el tamaño del conjunto de puntos. Will Sawin refinó la construcción generada por IA para alcanzar n^1,014 pares para infinitos valores de n.
The model clears the human team results in this reported comparison, reaching 40.3%. But that number is not a finish line. The supplied evidence says 59.7% remained unsolved, and the denominators may not match across the evaluations.
El modelo supera los resultados de los equipos humanos en esta comparación reportada, al alcanzar 40,3%. Pero esa cifra no marca la meta final. La evidencia proporcionada indica que 59,7% quedó sin resolver, y los denominadores podrían no coincidir entre las evaluaciones.
Las matemáticas de nivel investigador y el razonamiento visual cotidiano siguen siendo muy desiguales: la mejor IA en relojes queda 39,5 puntos porcentuales por debajo de los humanos.
The capability jump is real enough to demand attention. Reported performance moved from below 2% to 40.3%. But the benchmark versions and evaluation setups changed, so this is evidence of rapid progress rather than a clean laboratory trajectory.
El salto de capacidad es suficientemente real como para exigir atención. El desempeño reportado pasó de menos de 2% a 40,3%. Pero las versiones del benchmark y las configuraciones de evaluación cambiaron, así que esto es evidencia de un progreso rápido, no una trayectoria de laboratorio limpia.
The share of problems corrected was slightly larger than the earlier leading score. The subsequent 85% result belongs to a materially revised benchmark, so it is evidence of rapid progress but not a clean continuation of the old series.
La proporción de problemas corregidos fue ligeramente mayor que la puntuación líder anterior. El resultado posterior del 85 % pertenece a una prueba sustancialmente revisada, por lo que evidencia un progreso rápido, pero no una continuación limpia de la serie anterior.
The benchmark did not simply add stronger models to an unchanged race. Its v2 update addressed errors in 42% of problems and defined a 338-problem dataset with separate tiers. Against that reset, GPT-5.5 led Tiers 1-3 at 85%, while Google's AI co-mathematician led Tier 4 at 76%.
El benchmark no se limitó a añadir modelos más potentes a una carrera sin cambios. Su actualización v2 corrigió errores en 42% de los problemas y definió un conjunto de datos de 338 problemas con niveles separados. Tras ese reinicio, GPT-5.5 lideró los niveles 1-3 con 85%, mientras que el co-matemático de IA de Google lideró el nivel 4 con 76%.
There is no single FrontierMath champion in the supplied v2 evidence. GPT-5.5 led Tiers 1-3 at 85%. Google's AI co-mathematician led Tier 4 at 76%, so the winner changes with the problem tier.
La evidencia v2 proporcionada no muestra un único campeón de FrontierMath. GPT-5.5 lideró los niveles 1-3 con 85%. El co-matemático de IA de Google lideró el nivel 4 con 76%, así que el ganador cambia según el nivel de los problemas.
A benchmark score is only as clean as the test access behind it. OpenAI had access to 30 Tier 4 problems, while 20 were held out. The public v2 subset was different again, with 10 core problems and only 2 Tier 4 problems. The reported Tier 4 score was 31%, but access conditions differed.
Una puntuación de benchmark es tan sólida como el acceso a las pruebas que la sustenta. OpenAI tuvo acceso a 30 problemas del nivel 4, mientras que 20 quedaron reservados. El subconjunto público de la v2 era distinto: tenía 10 problemas centrales y solo 2 problemas del nivel 4. La puntuación reportada del nivel 4 fue de 31%, pero las condiciones de acceso fueron distintas.
Held-out control is what turns a benchmark into stronger evidence. OpenAI had access to 30 of the 50 Tier 4 problems. The remaining 20 create the cleaner test, although access to problem statements and solutions followed different rules.
Mantener problemas fuera de la evaluación convierte un benchmark en evidencia más sólida. OpenAI tuvo acceso a 30 de los 50 problemas del nivel 4. Los 20 restantes crean una prueba más limpia, aunque el acceso a los enunciados y a las soluciones siguió reglas distintas.
The public can inspect only a small slice of FrontierMath v2. The hub released 10 problems from Tiers 1-3 and 2 from Tier 4. Other published figures generally refer to private sets, making independent reproduction difficult.
El público solo puede inspeccionar una pequeña parte de FrontierMath v2. El hub publicó 10 problemas de los niveles 1-3 y 2 del nivel 4. Por lo general, las demás cifras publicadas se refieren a conjuntos privados, lo que dificulta la reproducción independiente.
The benchmark did not sit still. It moved from 119 problems to 147, then 180 and 197, before reaching 300 in February 2025. That expansion matters because a score can rise or fall with the test itself, not only with the model.
El benchmark no permaneció estático. Pasó de 119 problemas a 147, luego a 180 y 197, antes de llegar a 300 en febrero de 2025. Esa expansión importa porque una puntuación puede subir o bajar debido a la propia prueba, no solo al modelo.
Model scores inherit the quality of the questions underneath them. The reviewed invalid-question rate was 2% for MMLU Math and 42% for GSM8K. Benchmark governance is therefore part of capability measurement, not administrative cleanup.
Las puntuaciones de los modelos heredan la calidad de las preguntas en las que se basan. La tasa de preguntas inválidas revisada fue de 2% para MMLU Math y de 42% para GSM8K. Por lo tanto, la gobernanza del benchmark forma parte de la medición de capacidades, no es una simple tarea administrativa.
This is not a claim that one model solved seven problems. First Proof combined four systems, 39 submissions, and about 30 expert referees. Across the 10 research problems, seven received at least one passing solution. The striking point is breadth across the problem set, with system-level attribution still separate.
Esto no significa que un solo modelo haya resuelto siete problemas. First Proof combinó cuatro sistemas, 39 propuestas y aproximadamente 30 árbitros expertos. De los 10 problemas de investigación, siete recibieron al menos una solución aprobada. Lo destacable es la amplitud en el conjunto de problemas, mientras que la atribución a nivel de sistema sigue siendo independiente.
Standard public models solved none of the 10 screening problems under the preliminary conditions. Later, stronger systems and research harnesses produced passing solutions on 7 of 10 problems. The comparison shows how much the surrounding research system matters.
Los modelos públicos estándar no resolvieron ninguno de los 10 problemas de la evaluación preliminar bajo esas condiciones. Posteriormente, sistemas más potentes y entornos de pruebas de investigación produjeron soluciones aprobadas para 7 de 10 problemas. La comparación muestra cuánto importa el sistema de investigación que rodea al modelo.
Formal proving has moved well beyond toy demonstrations, but the strength is not one clean number. Prover Agent reported 86.1% on MiniF2F. In another setting, Lean Copilot automated 74.2% of proof steps, compared with 40.1% for AESOP. Success on a benchmark and automation inside a proof are different tests.
La demostración formal ya superó ampliamente las demostraciones de juguete, pero su fortaleza no se resume en una sola cifra. Prover Agent reportó 86,1% en MiniF2F. En otro contexto, Lean Copilot automatizó 74,2% de los pasos de demostración, frente a 40,1% de AESOP. El éxito en un benchmark y la automatización dentro de una demostración son pruebas distintas.
A formal proof can disclose exactly what it assumes. Both supplied artifacts report only Lean's 3 standard axioms. That strengthens confidence in the encoded argument, but it still leaves interpretation, attribution, and broad acceptance to people.
Una demostración formal puede revelar exactamente qué supone. Los dos artefactos proporcionados reportan únicamente los 3 axiomas estándar de Lean. Eso aumenta la confianza en el argumento codificado, pero deja la interpretación, la atribución y la aceptación general en manos de las personas.
The gap between a checked component and a completed theorem is the key lesson. MerLean-Prover solved 10 of 23 qualifying-exam theorems, compared with 8 for OpenGauss. But the Grasshopper case verified four helper lemmas and still left one top-level obligation unresolved. Formal checking strengthens the chain, yet it does not erase the final missing link.
La diferencia entre un componente comprobado y un teorema completo es la lección clave. MerLean-Prover resolvió 10 de 23 teoremas de exámenes de doctorado, frente a 8 de OpenGauss. Pero el caso de Grasshopper verificó cuatro lemas auxiliares y dejó sin resolver una obligación de nivel superior. La comprobación formal fortalece la cadena, pero no elimina el último eslabón faltante.
MerLean-Prover solved 10 of the 23 qualifying-exam theorems. The strongest published open-source baseline solved 8. The improvement is meaningful, but most of the benchmark still resisted both systems.
MerLean-Prover resolvió 10 de los 23 teoremas del examen de doctorado. La línea base de código abierto publicada más fuerte resolvió 8. La mejora es significativa, pero la mayoría del benchmark siguió resistiéndose a ambos sistemas.
The AI formalization successfully verified four helper lemmas. The main theorem still closed with one unresolved sorry. A proof pipeline can therefore look busy and locally correct while failing at the single obligation that matters most.
La formalización asistida por IA verificó correctamente cuatro lemas auxiliares. El teorema principal aún quedó cerrado con un único `sorry` sin resolver. Por lo tanto, una cadena de demostración puede parecer activa y correcta a nivel local, pero fallar en la única obligación que más importa.
A correct proof does not become settled science the moment it appears. Poincare asked the question in 1904. Perelman posted decisive work in 2002 and 2003, consensus arrived in 2006, and expert notes filled missing details in 2008 before Clay's 2010 prize announcement. The result also reached beyond Poincare to eight geometries in the broader geometrization theorem.
Una demostración correcta no se convierte en ciencia consolidada en cuanto aparece. Poincaré planteó la pregunta en 1904. Perelman publicó trabajos decisivos en 2002 y 2003, el consenso llegó en 2006 y los apuntes de expertos completaron los detalles faltantes en 2008, antes del anuncio del premio de Clay en 2010. El resultado también fue más allá de Poincaré, al abarcar ocho geometrías en el teorema más amplio de geometrización.
Discovery dominated the century-long history, but validation still consumed four years to consensus and another four to institutional recognition. Faster proof generation does not erase that downstream work.
El descubrimiento dominó la historia de un siglo, pero la validación aún consumió cuatro años hasta el consenso y otros cuatro hasta el reconocimiento institucional. Generar pruebas más rápido no elimina ese trabajo posterior.
This is real progress, but it is progress on a narrower question. The strongest result raises the distinct-zero lower bound to 83.62%. That still says nothing like a universal proof of the Riemann hypothesis, even though the formal Lean artifact uses no added hypotheses.
Es un avance real, pero en una pregunta más acotada. El resultado más sólido eleva la cota inferior de ceros distintos a 83,62%. Eso sigue sin constituir una demostración universal de la hipótesis de Riemann, aunque el artefacto formal en Lean no utiliza hipótesis adicionales.
Two independent 2026 proofs converge on distinct-zero bounds of 83.33% and 83.62%. The comparison is about whether zeros are repeated, not about the separate percentage known to lie on the critical line.
Dos demostraciones independientes de 2026 convergen en cotas de 83,33 % y 83,62 % para los ceros distintos. La comparación trata sobre si los ceros se repiten, no sobre el porcentaje separado que se sabe que está en la línea crítica.
Computation has checked the first 10,000,000,000,000 relevant zeros. Every one can agree with the hypothesis without proving what happens across an infinite sequence. Anthropic also states that Claude did not prove the Riemann hypothesis.
La computación ha verificado los primeros 10.000.000.000.000 ceros relevantes. Todos pueden coincidir con la hipótesis sin demostrar qué ocurre a lo largo de una sucesión infinita. Anthropic también afirma que Claude no demostró la hipótesis de Riemann.
The poll captures expert belief, not a proof. Most respondents expected P to differ from NP, but expectation cannot settle the question. The problem also resists brute force and a whole class of relativizing proof strategies.
La encuesta refleja la opinión de los expertos, no una prueba. La mayoría de los encuestados esperaba que P fuera distinta de NP, pero una expectativa no puede resolver la cuestión. El problema también se resiste a la fuerza bruta y a toda una clase de estrategias de prueba relativizables.
The numbers look harmless: choose 100 students from a pool of 400. The number of possible groups is larger than the estimated number of atoms in the known universe. P versus NP asks whether clever methods can escape searches that brute force cannot finish.
Las cifras parecen inofensivas: elegir 100 estudiantes de un grupo de 400. El número de grupos posibles es mayor que el número estimado de átomos en el universo conocido. P versus NP pregunta si los métodos ingeniosos pueden evitar búsquedas que la fuerza bruta no puede terminar.
Computer assistance rigorously proved the BSD formula for 16,714 eligible curves. The defined population contained 16,725 curves. That is extraordinarily broad evidence within one range, but the Millennium conjecture remains a general statement.
La asistencia computacional demostró rigurosamente la fórmula BSD para 16.714 curvas elegibles. La población definida contenía 16.725 curvas. Es una evidencia extraordinariamente amplia dentro de un rango, pero la conjetura del Milenio sigue siendo una afirmación general.
The researchers could compute five quantities and infer the sixth. In all 32 examined cases, the result sat near an integer power of 2 and matched the computable 2-torsion. Perfect agreement in a sample is strong evidence, not a universal theorem.
Los investigadores pudieron calcular cinco cantidades e inferir la sexta. En los 32 casos examinados, el resultado quedó cerca de una potencia entera de 2 y coincidió con la 2-torsión computable. La coincidencia perfecta en una muestra es evidencia sólida, no un teorema universal.
The result gives the mass gap a positive lower bound at two finite-lattice endpoints. The strong-coupling bound is 0.3599, while the weak-coupling bound is 0.0516. The scope matters: this is a preprint on a finite lattice, not a complete solution of the Millennium problem.
El resultado establece una cota inferior positiva para la brecha de masa en dos extremos de una red finita. La cota de acoplamiento fuerte es 0,3599, mientras que la de acoplamiento débil es 0,0516. El alcance importa: se trata de un preprint sobre una red finita, no de una solución completa del problema del Millennium Prize.
The leaderboard looks tightly packed, from 1,503 to 1,424. But scientific trust is tested elsewhere. AI clock-reading accuracy reached only 50.6%, versus 90.1% for humans, while benchmark reviews found invalid questions and proof-credit disputes moved quickly. Capability, reliability, and provenance have to travel together.
El ranking parece muy compacto, de 1.503 a 1.424. Pero la confianza científica se pone a prueba en otros ámbitos. La precisión de la IA al leer relojes llegó apenas a 50,6%, frente a 90,1% en el caso de los humanos, mientras que las revisiones de benchmarks detectaron preguntas inválidas y disputas de atribución en pruebas que avanzaron rápidamente. La capacidad, la confiabilidad y la procedencia deben avanzar juntas.
The same technological era produced a 35-point Olympiad performance and only 50.6% clock-reading accuracy. Humans reached 90.1% on the clock task. AI capability is not a ladder where every skill rises together.
En la misma era tecnológica se obtuvo un desempeño de 35 puntos en la Olimpiada y una precisión de apenas 50,6% al leer relojes. Los humanos alcanzaron 90,1% en la tarea de los relojes. La capacidad de la IA no es una escalera en la que todas las habilidades mejoren al mismo tiempo.
AI systems report solving up to 85% of a corrected frontier-math benchmark, yet 42% of its problems required error corrections and performance remains uneven across research proofs and ordinary clock reading. 6 technical terms carry much of the argument.
Key findings
OpenAI claims its proof establishes finite-time singularity for smooth three-dimensional Navier-Stokes data with smooth forcing, satisfying official alternatives C and D. OpenAI
OpenAI reports reaching the Navier-Stokes construction after 88 hours, then spending another 17 hours on Lean formalization and verification. OpenAI
The campaign used about 10,000 concurrent agents, 2.7 million messages, and 130 billion output tokens specifically on Navier-Stokes. OpenAI
Claude reportedly raised the proven lower bound for Riemann-hypothesis zeros on the critical line from 41.6 percent to 67.2 percent. Anthropic
Claude formalized Fermat's Last Theorem in 11 days, producing 13 million Lean lines and 30,300 proved intermediate theorems. Anthropic
Reported FrontierMath performance rose from below 2 percent initially to 25.2 percent, 35.4 percent, and 40.3 percent across later OpenAI systems. Epoch AI
OpenAI accessed all 300 core FrontierMath statements but not 53 solutions; it accessed 30 of 50 Tier 4 problems, leaving 20 held out. Epoch AI
On the corrected v2 benchmark, Google's AI co-mathematician led Tier 4 with a 76% score. linkedin.com
On September 13, 2026, Clay classified one Millennium Problem as solved, Navier-Stokes as active, and the remaining five as unsolved. Clay Mathematics Institute
Claude's Riemann project used 31 million output tokens, 650 initial ideas, about 60 subagents, 2,400 shell commands, and 54 downloaded papers. Anthropic
In May 2026, OpenAI described an internal model's unit-distance counterexample as the first autonomous AI solution of a prominent subfield-defining open problem. OpenAI
The argument
Five problems remain unsolved, while OpenAI's Navier-Stokes claim is still only five days old.
Clay's status page converts the fund into a stark balance sheet: $1 million solved, $1 million active, and $5 million still attached to problems classified as unsolved.
Clay assigns $1 million to each of seven problems, creating a $7 million fund.
Clay's process has two clocks: at least 2 years before consideration and 50 years of confidentiality.
The portrait of OpenAI’s leader sharpens the distinction between public authority and institutional verification.
OpenAI reports a construction at 88 hours and Lean verification at 105.
This research is published in English and Spanish. Ver en español
La investigación detrás de esta presentación
Los sistemas de IA reportan resolver hasta el 85 % de un benchmark corregido de matemáticas de frontera, pero el 42 % de sus problemas requirió correcciones y el desempeño sigue siendo desigual entre pruebas de investigación y la lectura cotidiana de relojes. 6 términos técnicos sostienen buena parte del argumento.
Hallazgos clave
OpenAI afirma que su demostración establece una singularidad en tiempo finito para datos tridimensionales suaves de Navier-Stokes con forzamiento suave, y que satisface las alternativas oficiales C y D. OpenAI
OpenAI informa que llegó a la construcción de Navier-Stokes después de 88 horas y que luego dedicó otras 17 horas a la formalización y verificación en Lean. OpenAI
La campaña utilizó aproximadamente 10.000 agentes simultáneos, 2,7 millones mensajes y 130 mil millones tokens de salida específicamente en Navier-Stokes. OpenAI
Según informes, Claude elevó el límite inferior demostrado para los ceros de la hipótesis de Riemann en la línea crítica de 41,6% a 67,2%. Anthropic
Claude formalizó el último teorema de Fermat en 11 días, produciendo 13 millones líneas de Lean y 30.300 teoremas intermedios demostrados. Anthropic
El desempeño reportado en FrontierMath aumentó de menos de 2% inicialmente a 25,2%, 35,4% y 40,3% en sistemas posteriores de OpenAI. Epoch AI
OpenAI tuvo acceso a las 300 formulaciones del conjunto central de FrontierMath, pero no a 53 soluciones; tuvo acceso a 30 de los 50 problemas del Tier 4, y dejó 20 reservados. Epoch AI
Una IA obtuvo 35 puntos para el oro de la Olimpiada Internacional de Matemáticas de 2025, pero el modelo líder solo leyó correctamente 50,6% de los relojes, frente a 90,1% en el caso de los humanos. Stanford Institute for Human-Centered Artificial Intelligence
En el benchmark v2 corregido, el co-matemático de IA de Google lideró el nivel 4 con una puntuación del 76%. linkedin.com
El 13 de septiembre de 2026, Clay clasificó un Problema del Milenio como resuelto, Navier-Stokes como activo y los cinco restantes como no resueltos. Clay Mathematics Institute
El proyecto de Riemann de Claude utilizó 31 millones tokens de salida, 650 ideas iniciales, aproximadamente 60 subagentes, 2.400 comandos de shell y 54 artículos descargados. Anthropic
En mayo de 2026, OpenAI describió el contraejemplo de distancia unitaria de un modelo interno como la primera solución autónoma de IA a un problema abierto importante que define un subcampo. OpenAI
El argumento
Los sistemas de IA reportan resolver hasta el 85 % de un benchmark corregido de matemáticas de frontera, pero el 42 % de sus problemas requirió correcciones y el desempeño sigue siendo desigual entre pruebas de investig…
Cinco problemas siguen sin resolverse, mientras que la afirmación de OpenAI sobre Navier-Stokes apenas tenía cinco días.
La página de estado de Clay convierte el fondo en un balance contundente: $1 millón resuelto, $1 millón activo y $5 millones aún ligados a problemas clasificados como no resueltos.
Clay asigna $1 millón a cada uno de siete problemas, creando un fondo de $7 millones.
El proceso de Clay tiene dos relojes: al menos 2 años antes de considerar una solución y 50 años de confidencialidad.
El retrato del líder de OpenAI acentúa la diferencia entre la autoridad pública y la verificación institucional.
OpenAI informa una construcción en 88 horas y una verificación en Lean en 105.
Esta investigación se publica en inglés y español. Read in English