Hanademi

AI can write proofs faster than science can trust themLa IA puede escribir demostraciones más rápido de lo que la ciencia puede confiar en ellas · V8.2 Master Engine

54 slides · 32 min · 1 hour ago54 láminas · 32 min · hace 1 h language
ENES
theme
LightDark
view
TalkTable
brand
HanademiPlatzi
AI can write proofs faster thanscience can trust themMade for Freddy Vega, by Hanademi
  1. AI systems report solving up to 85% of a corrected frontier-math benchmark, yet 42% of its problems required error corrections and performance remains uneven across research proofs and ordinary clock reading.
  2. OpenAI reports a construction at 88 hours and Lean verification at 105.
  3. 6 technical terms carry much of the argument.
La IA puede escribir demostracionesmás rápido de lo que la ciencia puedeconfiar en ellasMade for Freddy Vega, by Hanademi
  1. Los sistemas de IA reportan resolver hasta el 85 % de un benchmark corregido de matemáticas de frontera, pero el 42 % de sus problemas requirió correcciones y el desempeño sigue siendo desigual entre pruebas de investig…
  2. OpenAI informa una construcción en 88 horas y una verificación en Lean en 105.
  3. 6 términos técnicos sostienen buena parte del argumento.
How uneven is reported AI performanceacross math and clock reading?AI systems report solving up to 85% of a corrected frontier-math benchmark, yet 42% of its problemsrequired error corrections and performance remains uneven across research proofs and ordinary clockreading.Made for Freddy Vega, by HanademiSources: linkedin.com; Anthropic; Stanford Institute for Human-Centered Artificial Intelligence; hai.stanford.edu;epoch.ai; Epoch AI; epochai.substack.comUnitpercent on each cited measureGPT-5.5 (xhigh), FrontierMathTiers 1–3 v285%Google AI co-mathematician,FrontierMath Tier 4 v276%Claude, Riemann zeros proven onthe critical line67.2%Top AI model reading clockscorrectly50.6%FrontierMath problems witherrors corrected in v242%GPT-5.2, FrontierMath problemssolved40.3%
AI systems report solving up to 85% of a corrected frontier-math benchmark, yet 42% of its problems required error corrections and performance remains uneven across research proofs and ordinary clock reading.
¿Qué tan desigual es el rendimientoreportado en matemáticas y relojes?Los sistemas de IA reportan resolver hasta el 85 % de un benchmark corregido de matemáticas defrontera, pero el 42 % de sus problemas requirió correcciones y el desempeño sigue siendo desigual entrepruebas de investigación y la lectura cotidiana de relojes.Made for Freddy Vega, by HanademiFuentes: linkedin.com; Anthropic; Stanford Institute for Human-Centered Artificial Intelligence; hai.stanford.edu;epoch.ai; Epoch AI; epochai.substack.comUnidadporcentaje en cada medida citadaGPT-5.5 (xhigh), niveles 1–3 deFrontierMath v285 %Cocomatemático de IA de Google,nivel 4 de FrontierMath v276 %Claude, ceros de Riemannprobados en la línea crítica67,2 %Mejor modelo de IA leyendorelojes correctamente50,6 %Problemas de FrontierMath conerrores corregidos en v242 %GPT-5.2, problemas deFrontierMath resueltos40,3 %
Los sistemas de IA reportan resolver hasta el 85 % de un benchmark corregido de matemáticas de frontera, pero el 42 % de sus problemas requirió correcciones y el desempeño sigue siendo desigual entre pruebas de investigación y la lectura cotidiana de relojes.
The terms behind the argumentMade for Freddy Vega, by HanademiArtificial intelligence (AI)Computer systems designed to perform tasks involving reasoning,prediction, perception, language, or decision-making.Nondeterministic polynomial time (NP)The class of decision problems for which a proposedsolution can be checked in polynomial time.Finite-time singularityA mathematical breakdown in which a modeled quantity becomes unboundedafter a finite amount of simulated time.Mass gapA positive minimum energy separating a quantum field theory's vacuum from its first possibleexcitation.Formal verificationThe use of a computer to check every logical step of a precisely encoded proof orprogram.Elliptic curveA smooth curve defined by a cubic equation and equipped with an algebraic rule forcombining points.
6 technical terms carry much of the argument.
Los términos detrás del argumentoMade for Freddy Vega, by HanademiInteligencia artificial (IA)Sistemas informáticos diseñados para realizar tareas que implicanrazonamiento, predicción, percepción, lenguaje o toma de decisiones.Tiempo polinomial no determinista (NP)La clase de problemas de decisión cuya soluciónpropuesta puede verificarse en tiempo polinomial.Singularidad en tiempo finitoUn colapso matemático en el que una cantidad modelada se vuelveilimitada después de un tiempo finito de simulación.Brecha de masaUna energía mínima positiva que separa el vacío de una teoría cuántica de camposde su primera excitación posible.Verificación formalEl uso de una computadora para comprobar cada paso lógico de unademostración o un programa codificado con precisión.Curva elípticaUna curva suave definida por una ecuación cúbica y dotada de una regla algebraica paracombinar puntos.
6 términos técnicos sostienen buena parte del argumento.
How many Millennium Problems remainunsolved?Clay's classification of all seven problems on September 13, 2026; OpenAI's announcement came five daysearlier.Made for Freddy Vega, by HanademiSources: Clay Mathematics Institute. (2026). The Millennium Prize Problems.; OpenAI. (2026, September 8). On the Navier-StokesMillennium Prize Problem.; modelcurrent.com.UnitProblemsSolved1Active1Unsolved5Navier-Stokes was still active five days after OpenAI's announcement.
Start with the correction, not the hype. Clay's own classification still puts 5 of the 7 problems in the unsolved column. Navier-Stokes is active, not accepted, and the public claim was only five days old when this snapshot was taken.
¿Cuántos Problemas del Milenio siguen sinresolverse?Clasificación de Clay de los siete problemas el 13 de septiembre de 2026; el anuncio de OpenAI llegó cincodías antes.Made for Freddy Vega, by HanademiFuentes: Clay Mathematics Institute. (2026). The Millennium Prize Problems.; OpenAI. (2026, September 8). On the Navier-StokesMillennium Prize Problem.; modelcurrent.com.UnidadProblemasResuelto1Activo1No resuelto5Navier-Stokes seguía activo cinco días después del anuncio de OpenAI.
Empieza por la corrección, no por el hype. La propia clasificación de Clay todavía coloca 5 de los 7 problemas en la categoría de no resueltos. Navier-Stokes está activo, no aceptado, y la afirmación pública apenas tenía cinco días cuando se tomó esta instantánea.
How much prize money remains tied tounsolved Millennium Problems?Clay's status page converts the fund into a stark balance sheet: $1 million solved, $1 million active, and $5million still attached to problems classified as unsolved.Made for Freddy Vega, by HanademiSources: Clay Mathematics Institute. (2026). The Millennium Prize Problems.; Navier-Stokes Announcement - Clay MathematicsInstitute.; The Millennium Prize Problems.Unitprize allocationUnsolvedproblems$5 millionActive problem$1 millionSolved problem$1 million
Clay's status page converts the fund into a stark balance sheet: $1 million solved, $1 million active, and $5 million still attached to problems classified as unsolved.
¿Cuánto dinero sigue ligado a Problemas delMilenio sin resolver?La página de estado de Clay convierte el fondo en un balance contundente: $1 millón resuelto, $1 millónactivo y $5 millones aún ligados a problemas clasificados como no resueltos.Made for Freddy Vega, by HanademiFuentes: Clay Mathematics Institute. (2026). The Millennium Prize Problems.; Navier-Stokes Announcement - ClayMathematics Institute.; The Millennium Prize Problems.Unidadasignación de premiosProblemas sinresolver$5 millonesProblema activo$1 millónProblema resuelto$1 millón
La página de estado de Clay convierte el fondo en un balance contundente: $1 millón resuelto, $1 millón activo y $5 millones aún ligados a problemas clasificados como no resueltos.
Clay assigns $1 million to each of sevenproblems, creating a $7 million fund.Clay's prize structure treats the seven designated problems equally: each solutioncarries a nominal $1 million award. The allocation is a prize framework, not anautomatic payment triggered by a company announcement.Sources: Clay Mathematics Institute. (2026). The Millennium Prize Problems.
The prize system is simple enough to remember. There are 7 problems and $1 million attached to each one. But the money follows institutional acceptance, not an announcement, so the fund is a promise of recognition rather than a scoreboard.
Clay asigna $1 millón a cada uno desiete problemas, creando un fondo de$7 millones.La estructura de premios de Clay trata por igual los siete problemas designados: cadasolución conlleva un premio nominal de $1 millón. La asignación es un marco depremios, no un pago automático activado por el anuncio de una empresa.Fuentes: Clay Mathematics Institute. (2026). The Millennium Prize Problems.
El sistema de premios es lo bastante sencillo como para recordarlo. Hay 7 problemas y $1 millón asociado a cada uno. Pero el dinero depende de la aceptación institucional, no de un anuncio, así que el fondo promete reconocimiento, no funciona como marcador.
How long does Clay wait and keep decisionrecords private?Two separate Clay rules, measured in years: minimum elapsed time before possible consideration andconfidentiality for decision records.Made for Freddy Vega, by HanademiSources: web.archive.org.; claymath.org.UnitYearsMinimum review wait2Record confidentiality5025x
Clay's timeline is deliberately slower than a press cycle. A proposed solution must clear a minimum 2-year wait, while the institution can keep decision records private for 50 years. Those are different rules, but together they explain why a breakthrough announcement cannot settle the prize question.
¿Cuánto espera Clay y cuánto guarda susdecisiones en privado?Dos reglas distintas de Clay, medidas en años: el tiempo mínimo transcurrido antes de una posibleconsideración y la confidencialidad de los registros de decisión.Made for Freddy Vega, by HanademiFuentes: web.archive.org.; claymath.org.UnidadAñosEspera mínima para la revisión2Confidencialidad de los registros5025x
El calendario de Clay avanza deliberadamente más lento que un ciclo de prensa. Una solución propuesta debe superar una espera mínima de 2 años, mientras que la institución puede mantener privados los registros de decisión durante 50 años. Son reglas distintas, pero juntas explican por qué el anuncio de un avance no puede zanjar la cuestión del premio.
Does authority prove a mathematical claim?A celebrated announcement can start the scientific process, but it cannot finish it.Sources: OpenAI says it cracked 90-year-old maths problem in 88 hours. bbc.com.
The portrait of OpenAI’s leader sharpens the distinction between public authority and institutional verification.
¿La autoridad demuestra unaafirmación matemática?Un anuncio destacado puede iniciar el proceso científico, pero no concluirlo.Fuentes: OpenAI says it cracked 90-year-old maths problem in 88 hours. bbc.com.
El retrato del líder de OpenAI acentúa la diferencia entre la autoridad pública y la verificación institucional.
How long did OpenAI report taking toconstruct and formalize its result?OpenAI's self-reported elapsed campaign time from agent launch through construction and Leanformalization.Made for Freddy Vega, by HanademiSources: OpenAI. (2026, September 8). On the Navier-Stokes Millennium Prize Problem.; mathoverflow.net.; thenextweb.com.OpenAI reports the elapsed campaign time.UnitElapsed hoursAgents launched0Construction reached88Construction reached after 88 hours.Lean verification completed105Lean formalization added 17 hours.
This is the speed claim that makes the story feel different. OpenAI reports reaching the construction in 88 hours, then spending 17 more hours formalizing it in Lean. The important boundary is scope: the work addresses forced alternatives C and D, and machine checking does not equal institutional acceptance.
¿Cuánto tardó OpenAI, según informó, enconstruir y formalizar su resultado?Tiempo transcurrido de la campaña, según el reporte de OpenAI, desde el lanzamiento de los agentes hastala construcción y la formalización en Lean.Made for Freddy Vega, by HanademiFuentes: OpenAI. (2026, September 8). On the Navier-Stokes Millennium Prize Problem.; mathoverflow.net.; thenextweb.com.OpenAI informa el tiempo transcurrido de la campaña.UnidadHoras transcurridasAgentes activados0Construcción alcanzada88Construcción alcanzada después de 88 horas.Verificación en Lean completada105La formalización en Lean añadió 17 horas.
Esta es la afirmación de velocidad que hace que la historia parezca distinta. OpenAI informa que alcanzó la construcción en 88 horas y luego dedicó 17 horas más a formalizarla en Lean. El límite importante es el alcance: el trabajo aborda las alternativas forzadas C y D, y la verificación automática no equivale a una aceptación institucional.
Why does turbulence make Navier-Stokesphysically important?Visible turbulence turns an abstract proof claim into a question about the physical world.Sources: stanfordtechreview.com.
The atmospheric vortices give the Navier–Stokes claim a physical scale as the deck narrows its mathematical scope.
¿Por qué la turbulencia da importanciafísica a Navier-Stokes?La turbulencia visible convierte una afirmación abstracta de demostración en una pregunta sobre elmundo físico.Fuentes: stanfordtechreview.com.
Los vórtices atmosféricos dan una escala física a la afirmación sobre Navier–Stokes mientras el relato delimita su alcance matemático.
OpenAI claims 2 of 4 alternatives, Cand D, with smooth forcing; A and Bremain untouched.The company claim was new and pending broad independent acceptance. OpenAI claims2 of Clay's 4 official alternatives, C and D, using smooth forcing. The unforcedsmooth-data alternatives A and B remain outside the claimed result.Sources: OpenAI. (2026, September 8). On the Navier-Stokes Millennium Prize Problem.; mathoverflow.net.; thenextweb.com.
The phrase solved Navier-Stokes hides a crucial boundary. OpenAI claims 2 of 4 official alternatives, C and D, through a construction with smooth forcing. The unforced smooth-data alternatives A and B remain outside the result.
OpenAI afirma abordar 2 de 4alternativas, C y D, con forzamientosuave; A y B siguen intactas.La afirmación de la empresa era nueva y estaba pendiente de una amplia aceptaciónindependiente. OpenAI afirma abordar 2 de las 4 alternativas oficiales de Clay, C y D,mediante forzamiento suave. Las alternativas A y B, con datos suaves y sin fuerzaexterna, quedan fuera del resultado afirmado.Fuentes: OpenAI. (2026, September 8). On the Navier-Stokes Millennium Prize Problem.; mathoverflow.net.; thenextweb.com.
La expresión «resolvió Navier-Stokes» oculta un límite crucial. OpenAI afirma abordar 2 de 4 alternativas oficiales, C y D, mediante una construcción con forzamiento suave. Las alternativas A y B, con datos suaves y sin fuerza externa, quedan fuera del resultado.
How much reported campaign activity wentto Navier-Stokes?OpenAI-reported output tokens and messages for the full campaign and its Navier-Stokes work, September2026.Made for Freddy Vega, by HanademiSources: OpenAI. (2026, September 8). On the Navier-Stokes Millennium Prize Problem.UnitReported campaign activityOutput tokens300130Full campaignNavier-StokesAgent messages4.92.7Full campaignNavier-Stokes
The Navier-Stokes effort dominated the reported campaign. It used 130 billion of roughly 300 billion output tokens and 2.7 million of 4.9 million messages. Those figures measure search scale, not mathematical acceptance.
¿Cuánta actividad reportada de la campañase destinó a Navier-Stokes?Tokens de salida y mensajes reportados por OpenAI para la campaña completa y su trabajo enNavier-Stokes, septiembre de 2026.Made for Freddy Vega, by HanademiFuentes: OpenAI. (2026, September 8). On the Navier-Stokes Millennium Prize Problem.UnidadActividad reportada de la campañaTokens de salida300130Campaña completaNavier-StokesMensajes de agentes4,92,7Campaña completaNavier-Stokes
El trabajo en Navier-Stokes dominó la campaña reportada. Utilizó 130 mil millones de aproximadamente 300 mil millones tokens de salida y 2,7 millones de 4,9 millones mensajes. Estas cifras miden la escala de búsqueda, no la aceptación matemática.
How did output-token use differ acrossthree AI math projects?Convert all output-token totals to millions and divide by 31 million.Made for Freddy Vega, by HanademiSources: OpenAI. (2026, September 8). On the Navier-Stokes Millennium Prize Problem.; On the Navier–StokesMillennium Prize Problem | OpenAI.; Anthropic. (2026, August 10). Learning more about Claude's mathematicalcapabilities.Unitmultiple of Claude's Riemann projectClaude Riemann project1xClaude Fermatformalization193.5xOpenAI Navier-Stokescampaign4,193.5x
The campaigns occupied radically different computational regimes: 31 million tokens for the Riemann advance, 6 billion for Fermat formalization, and 130 billion for the claimed Navier-Stokes construction.
¿Cómo varió el uso de tokens entre tresproyectos matemáticos de IA?Convertir todos los totales de tokens de salida a millones y dividir entre 31 millones.Made for Freddy Vega, by HanademiFuentes: OpenAI. (2026, September 8). On the Navier-Stokes Millennium Prize Problem.; On the Navier–StokesMillennium Prize Problem | OpenAI.; Anthropic. (2026, August 10). Learning more about Claude's mathematicalcapabilities.Unidadmúltiplo del proyecto de Riemann de ClaudeProyecto de Riemann deClaude1xFormalización de Fermatde Claude193,5xCampaña Navier-Stokes deOpenAI4.193,5x
Las campañas ocuparon regímenes computacionales radicalmente distintos: 31 millones de tokens para el avance de Riemann, 6.000 millones para la formalización de Fermat y 130.000 millones para la construcción propuesta de Navier-Stokes.
What happens when Stokes meetsindustrial-scale computing?Long-standing mathematics is being revisited with computational tools.Sources: OpenAI solves 90-year-old Navier-Stokes maths problem .... timesofindia.indiatimes.com.
Stokes’s portrait places a human mathematical legacy beside an AI campaign operating at industrial computational scale.
¿Qué ocurre cuando Stokes se encuentra concomputación a escala industrial?Las matemáticas de larga trayectoria se examinan con herramientas computacionales.Fuentes: OpenAI solves 90-year-old Navier-Stokes maths problem .... timesofindia.indiatimes.com.
El retrato de Stokes sitúa un legado matemático humano junto a una campaña de IA de escala computacional industrial.
How did Fermat and Riemann token usecompare?Company-reported output tokens: 6 billion for Fermat formalization versus 31 million for the Riemannproject.Made for Freddy Vega, by HanademiSources: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.; Anthropic. (2026, September4). Formalizing Fermat's Last Theorem.6 billion equals 6,000 million.UnitMillion output tokensFermat formalization6,000Riemann project31193.5x
The two Anthropic projects used radically different amounts of model output. Fermat formalization consumed about 6 billion tokens, versus 31 million for the Riemann project. Formal verification can be more computationally intensive than finding a promising mathematical argument.
¿Cómo se comparó el uso de tokens enFermat y Riemann?Tokens de salida reportados por la empresa: 6 mil millones para la formalización de Fermat frente a 31millones para el proyecto de Riemann.Made for Freddy Vega, by HanademiFuentes: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.; Anthropic. (2026,September 4). Formalizing Fermat's Last Theorem.6 mil millones equivale a 6.000 millones.UnidadMillones de tokens de salidaFormalización de Fermat6.000Proyecto de Riemann31193,5x
Los dos proyectos de Anthropic utilizaron cantidades radicalmente distintas de producción del modelo. La formalización de Fermat consumió aproximadamente 6 mil millones tokens, frente a 31 millones en el proyecto de Riemann. La verificación formal puede exigir más recursos computacionales que encontrar un argumento matemático prometedor.
Related formalized results appearedfirst; OpenAI's announcement followedroughly 7 hours later.Both public events occurred on September 8, 2026. An audit of the two published Leancertificates reported 2.3 million combined lines, zero extra axioms, and no developmenthistory. The close timing shows how quickly attribution and verification can become partof the scientific story.Sources: stanfordtechreview.com.Both events occurred on September 8, 2026.
The race was not only between humans and machines. Two related formalized results appeared on the same day, with OpenAI's announcement arriving roughly 7 hours later. The audit found 2.3 million combined lines and no development history, making provenance part of the result itself.
Los resultados formalizados relacionadosaparecieron primero; el anuncio de OpenAIllegó aproximadamente 7 horas después.Ambos eventos públicos ocurrieron el 8 de septiembre de 2026. Una auditoría de los doscertificados Lean publicados reportó 2,3 millones líneas combinadas, cero axiomasadicionales y ningún historial de desarrollo. La cercanía temporal muestra con quérapidez la atribución y la verificación pueden convertirse en parte de la historiacientífica.Fuentes: stanfordtechreview.com.Ambos eventos ocurrieron el 8 de septiembre de 2026.
La competencia no fue solo entre humanos y máquinas. Dos resultados formalizados relacionados aparecieron el mismo día, y el anuncio de OpenAI llegó aproximadamente 7 horas después. La auditoría encontró 2,3 millones líneas combinadas y ningún historial de desarrollo, lo que convierte la procedencia en parte del resultado mismo.
Claude reportedly raised the provenlower bound from 41.6% to 67.2%,without proving Riemann.This is a partial result, not a solution to the Riemann hypothesis. The argument extends toprimitive Dirichlet L-functions and is formally verified in Lean 4. Anthropic reports thatthe project used 31 million output tokens, 650 initial ideas, about 60 subagents, 2,400shell commands, and 54 downloaded papers.Sources: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.; Claude's progress on the Riemann hypothesis.;arxiv.org.
The important distinction is partial progress versus a solved Millennium Problem. Claude reportedly moved the proven lower bound from 41.6% to 67.2%. The argument extends to primitive Dirichlet L-functions and was formally verified in Lean 4. Anthropic reports 31 million output tokens, 650 initial ideas, about 60 subagents, 2,400 shell commands, and 54 downloaded papers.
Según informes, Claude elevó el límiteinferior demostrado de 41,6% a 67,2%, sindemostrar Riemann.Es un resultado parcial, no una solución a la hipótesis de Riemann. El argumento seextiende a funciones L primitivas de Dirichlet y está verificado formalmente en Lean 4.Anthropic informa que el proyecto utilizó 31 millones de tokens de salida, 650 ideasiniciales, aproximadamente 60 subagentes, 2.400 comandos de shell y 54 artículosdescargados.Fuentes: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.; Claude's progress on the Riemann hypothesis.;arxiv.org.
La distinción importante es entre progreso parcial y la resolución de un problema del milenio. Según informes, Claude movió el límite inferior demostrado de 41,6% a 67,2%. El argumento se extiende a funciones L primitivas de Dirichlet y fue verificado formalmente en Lean 4. Anthropic informa 31 millones de tokens de salida, 650 ideas iniciales, aproximadamente 60 subagentes, 2.400 comandos de shell y 54 artículos descargados.
How close is Claude's reported Riemannbound to the required 100%?Claude closed 25.6 percentage points of the numerical gap, but 32.8 points remain; that arithmetic does notimply that the proof is two-thirds complete.Made for Freddy Vega, by HanademiSources: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.; Claude's progress on theRiemann hypothesis.; Clay Mathematics Institute. (2026). Riemann hypothesis.Unitshare of nontrivial zeros41.6%Previous provenlower bound67.2%Claude's provenlower bound100%Riemann hypothesisrequirement
Claude closed 25.6 percentage points of the numerical gap, but 32.8 points remain; that arithmetic does not imply that the proof is two-thirds complete.
¿Cuánto se acerca el límite reportado deClaude al 100 % requerido?Claude cerró 25,6 puntos porcentuales de la brecha numérica, pero quedan 32,8 puntos; esa aritmética noimplica que la demostración esté completada en dos tercios.Made for Freddy Vega, by HanademiFuentes: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.; Claude'sprogress on the Riemann hypothesis.; Clay Mathematics Institute. (2026). Riemann hypothesis.Unidadproporción de ceros no triviales41,6 %Límite inferiordemostrado anterior67,2 %Límite inferiordemostrado por Claude100 %Requisito de lahipótesis de Riemann
Claude cerró 25,6 puntos porcentuales de la brecha numérica, pero quedan 32,8 puntos; esa aritmética no implica que la demostración esté completada en dos tercios.
How far does Claude's reported Riemannbound remain from 100%?Anthropic's reported 67.2% lower bound compared with the 100% universal claim required by theMillennium Problem.Made for Freddy Vega, by HanademiSources: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.; Clay MathematicsInstitute. (2026). Riemann hypothesis.UnitPercent of relevant zerosReported lowerbound67.2%Full hypothesis100%
Claude's reported lower bound is a major mathematical advance. The Millennium Problem, however, asks for the claim across 100% of the relevant zeros. The 32.8-point difference is not a measure of remaining difficulty, but it makes the logical gap visible.
¿Cuánto le falta al límite reportado deClaude para llegar al 100 %?El límite inferior de 67,2% reportado por Anthropic, frente a la afirmación universal de 100% que exige elProblema del Milenio.Made for Freddy Vega, by HanademiFuentes: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.; Clay MathematicsInstitute. (2026). Riemann hypothesis.UnidadPorcentaje de ceros relevantesLímite inferiorreportado67,2 %Hipótesis completa100 %
El límite inferior reportado por Claude es un avance matemático importante. Sin embargo, el Problema del Milenio exige demostrar la afirmación para 100% de los ceros relevantes. La diferencia de 32,8 puntos no mide la dificultad restante, pero hace visible la brecha lógica.
Why can visible prime patterns temptus to overreach?Finite patterns can sharpen intuition without settling an infinite claim.Sources: No, AI didn’t just solve the thorniest problem in math | Scientific American. scientificamerican.com.
The scattered primes make the core warning tangible because visible structure is not the same as an infinite proof.
¿Por qué los patrones visibles de primospueden llevarnos a exagerar?Los patrones finitos pueden afinar la intuición sin resolver una afirmación infinita.Fuentes: No, AI didn’t just solve the thorniest problem in math | Scientific American. scientificamerican.com.
Los primos dispersos hacen tangible la advertencia central porque una estructura visible no equivale a una demostración infinita.
How large was Fermat's machine-checkeddependency tree?Statements tracked versus theorems in the final dependency tree during the 11-day Lean formalization run.Made for Freddy Vega, by HanademiSources: Anthropic. (2026, September 4). Formalizing Fermat's Last Theorem.; www-cdn.anthropic.com.UnitTracked statements and final dependency-tree theoremsTracked statements30,300Final dependency tree29,511The run lasted 11 days and used about 6 billion output tokens. Humans supplied no mathematics beyond theone-line goal statement.Verify this slide before presenting
This achievement is best understood as automated formalization, not a new discovery of Fermat's Last Theorem. The platform tracked about 30,300 statements, while the final dependency tree used 29,511 theorems that were rechecked. The run took 11 days and consumed about 6 billion output tokens. Humans supplied only the one-line goal, according to the supplied account.
¿Qué tamaño tenía el árbol de dependenciasverificado de Fermat?Enunciados registrados frente a teoremas del árbol final de dependencias durante la ejecución deformalización en Lean de 11 días.Made for Freddy Vega, by HanademiFuentes: Anthropic. (2026, September 4). Formalizing Fermat's Last Theorem.; www-cdn.anthropic.com.UnidadEnunciados registrados y teoremas del árbol final de dependenciasEnunciados registrados30.300Árbol final de dependencias29.511La ejecución duró 11 días y utilizó aproximadamente 6 mil millones tokens de salida. Los humanos noaportaron matemáticas más allá del enunciado de una sola línea.Verifica esta lámina antes de presentarla
Este logro se entiende mejor como formalización automatizada, no como un nuevo descubrimiento del último teorema de Fermat. La plataforma registró aproximadamente 30.300 enunciados, mientras que el árbol final de dependencias utilizó 29.511 teoremas que volvieron a verificarse. La ejecución tomó 11 días y consumió aproximadamente 6 mil millones tokens de salida. Según el relato proporcionado, los humanos solo aportaron el objetivo de una sola línea.
How does formalization turn a proof into aninspectable artifact?Mathematical progress carries more weight when the reasoning can be reopened and checked.Sources: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.
The drafting tools frame formalization as a change in how mathematical reasoning is built, preserved, and inspected.
¿Cómo convierte la formalización unademostración en un artefacto inspeccionable?El progreso matemático adquiere más peso cuando el razonamiento puede reabrirse y comprobarse.Fuentes: Anthropic. (2026, August 10). Learning more about Claude's mathematical capabilities.
Las herramientas de dibujo presentan la formalización como un cambio en la forma de construir, conservar e inspeccionar el razonamiento matemático.
Five of ten attempts looked likelycorrect, but OpenAI later withdrew itsProblem 2 assessment.The five is an initial judgment, not a final acceptance count. OpenAI later acknowledgedthat its initially favored assessment of Problem 2 was incorrect, showing whyresearch-level proof claims need continued review.Sources: OpenAI. (2026, February 20). Our First Proof submissions.
The striking number is five of ten attempts judged likely correct. But that was not a final acceptance result. OpenAI later acknowledged that its initially favored Problem 2 assessment was incorrect. The lesson is simple: AI can produce promising mathematical work faster than the community can validate it.
Cinco de diez intentos parecíanprobablemente correctos, peroOpenAI retiró después su evaluacióndel Problema 2.Los cinco corresponden a un juicio inicial, no a un número final de aceptaciones. OpenAIreconoció después que su evaluación inicialmente preferida del Problema 2 eraincorrecta, lo que demuestra por qué las afirmaciones sobre demostraciones de nivel deinvestigación requieren una revisión continua.Fuentes: OpenAI. (2026, February 20). Our First Proof submissions.
La cifra llamativa es cinco de diez intentos considerados probablemente correctos. Pero no fue un resultado final de aceptación. OpenAI reconoció después que su evaluación inicialmente preferida del Problema 2 era incorrecta. La lección es sencilla: la IA puede producir trabajo matemático prometedor más rápido de lo que la comunidad puede validarlo.
A 0.014 exponent gain produced n^1.014unit-distance pairs.This result concerns the lower-bound exponent for unit-distance pairs in planar pointsets. It is an advance in discrete geometry, not a Millennium Problem solution.Sources: ai-beat.github.io.
The improvement looks small because it sits inside an exponent. Its effect grows with the size of the point set. Will Sawin refined the AI-generated construction to reach n^1.014 pairs for infinitely many n.
Una ganancia de 0,014 en elexponente produjo n^1,014 paresde distancia unitaria.Este resultado se refiere al exponente del límite inferior para pares de distancia unitariaen conjuntos de puntos planos. Es un avance en geometría discreta, no una solución alProblema del Milenio.Fuentes: ai-beat.github.io.
La mejora parece pequeña porque está dentro de un exponente. Su efecto crece con el tamaño del conjunto de puntos. Will Sawin refinó la construcción generada por IA para alcanzar n^1,014 pares para infinitos valores de n.
How much of FrontierMath did GPT-5.2reportedly leave unsolved?Reported share of FrontierMath problems solved by human teams and GPT-5.2, 2025-2026. Evaluationdenominators may differ.Made for Freddy Vega, by HanademiSources: Epoch AI. (2026). About FrontierMath.; OpenAI. (2026). AI as a scientific collaborator.Human and model evaluations may use different denominators.UnitPercent of problems solvedAverage human team19%Human teams collectively35%GPT-5.2 reported40.3%40.3% solved leaves 59.7% unsolved.
The model clears the human team results in this reported comparison, reaching 40.3%. But that number is not a finish line. The supplied evidence says 59.7% remained unsolved, and the denominators may not match across the evaluations.
¿Cuánto de FrontierMath dejó GPT-5.2 sinresolver, según se informó?Proporción reportada de problemas de FrontierMath resueltos por equipos humanos y GPT-5.2,2025-2026. Los denominadores de las evaluaciones pueden diferir.Made for Freddy Vega, by HanademiFuentes: Epoch AI. (2026). About FrontierMath.; OpenAI. (2026). AI as a scientific collaborator.Las evaluaciones de humanos y del modelo pueden usar denominadores diferentes.UnidadPorcentaje de problemas resueltosEquipo humano promedio19 %Equipos humanos en conjunto35 %GPT-5.2, según el reporte40,3 %Resolver 40,3% deja 59,7% sin resolver.
El modelo supera los resultados de los equipos humanos en esta comparación reportada, al alcanzar 40,3%. Pero esa cifra no marca la meta final. La evidencia proporcionada indica que 59,7% quedó sin resolver, y los denominadores podrían no coincidir entre las evaluaciones.
How uneven is AI across FrontierMath andclock reading?Research-level mathematics and ordinary visual reasoning remain sharply uneven: the top AI clock scoretrails humans by 39.5 percentage points.Made for Freddy Vega, by HanademiSources: Epoch AI. (2026). About FrontierMath.; Is AI already superhuman on FrontierMath? - by Anson Ho.;Stanford Institute for Human-Centered Artificial Intelligence. (2026). AI Index Report 2026: Technicalperformance.Unitaccuracy or problems solved (%)GPT-5.2 onFrontierMath40.3%Top AI on ClockBench50.6%Humans on ClockBench90.1%
Research-level mathematics and ordinary visual reasoning remain sharply uneven: the top AI clock score trails humans by 39.5 percentage points.
¿Qué tan desigual es la IA entreFrontierMath y leer relojes?Las matemáticas de nivel investigador y el razonamiento visual cotidiano siguen siendo muy desiguales: lamejor IA en relojes queda 39,5 puntos porcentuales por debajo de los humanos.Made for Freddy Vega, by HanademiFuentes: Epoch AI. (2026). About FrontierMath.; Is AI already superhuman on FrontierMath? - by Anson Ho.;Stanford Institute for Human-Centered Artificial Intelligence. (2026). AI Index Report 2026: Technicalperformance.Unidadprecisión o problemas resueltos (%)GPT-5.2 enFrontierMath40,3 %Mejor IA en ClockBench50,6 %Humanos en ClockBench90,1 %
Las matemáticas de nivel investigador y el razonamiento visual cotidiano siguen siendo muy desiguales: la mejor IA en relojes queda 39,5 puntos porcentuales por debajo de los humanos.
How much did reported FrontierMathperformance rise across changing tests?Reported solved shares across mixed FrontierMath versions and evaluation setups, 2024-2026. The firstpoint is a 2% upper-bound representation.Made for Freddy Vega, by HanademiSources: Glazer, E., et al. (2024). FrontierMath: A benchmark for evaluating advanced mathematical reasoning in AI. arXiv.; EpochAI. (2026). About FrontierMath.; OpenAI. (2026). AI as a scientific collaborator.UnitPercent solved0%20%40%Leading models, 2024o3 announcementGPT-5.5GPT-5.2The initial report was below 2%;2% is the supplied upper-boundrepresentation.The later reported score reached40.3%.
The capability jump is real enough to demand attention. Reported performance moved from below 2% to 40.3%. But the benchmark versions and evaluation setups changed, so this is evidence of rapid progress rather than a clean laboratory trajectory.
¿Cuánto aumentó el rendimiento reportadode FrontierMath entre pruebas cambiantes?Porcentaje resuelto reportado en distintas versiones de FrontierMath y configuraciones de evaluación,2024-2026. El primer punto representa un límite superior de 2%.Made for Freddy Vega, by HanademiFuentes: Glazer, E., et al. (2024). FrontierMath: A benchmark for evaluating advanced mathematical reasoning in AI. arXiv.;Epoch AI. (2026). About FrontierMath.; OpenAI. (2026). AI as a scientific collaborator.UnidadPorcentaje resuelto0 %20 %40 %Modelos líderes, 2024Anuncio de o3GPT-5.5GPT-5.2El informe inicial fue inferior a 2%;2% es la representaciónproporcionada del límite superior.La puntuación reportadaposteriormente alcanzó 40,3%.
El salto de capacidad es suficientemente real como para exigir atención. El desempeño reportado pasó de menos de 2% a 40,3%. Pero las versiones del benchmark y las configuraciones de evaluación cambiaron, así que esto es evidencia de un progreso rápido, no una trayectoria de laboratorio limpia.
How did FrontierMath's 42% correctionchange its reported score trend?The share of problems corrected was slightly larger than the earlier leading score. The subsequent 85%result belongs to a materially revised benchmark, so it is evidence of rapid progress but not a cleancontinuation of the old series.Made for Freddy Vega, by HanademiSources: Glazer, E., et al. (2024). FrontierMath: A benchmark for evaluating advanced mathematical reasoning in AI. arXiv.; EpochAI. (2026). About FrontierMath.; OpenAI. (2026). AI as a scientific collaborator.Unitreported percent40.3%Earlier GPT-5.2score42%Problems correctedin v285%GPT-5.5 score onv2
The share of problems corrected was slightly larger than the earlier leading score. The subsequent 85% result belongs to a materially revised benchmark, so it is evidence of rapid progress but not a clean continuation of the old series.
¿Cómo cambió la corrección del 42 % latendencia reportada de FrontierMath?La proporción de problemas corregidos fue ligeramente mayor que la puntuación líder anterior. Elresultado posterior del 85 % pertenece a una prueba sustancialmente revisada, por lo que evidencia unprogreso rápido, pero no una continuación limpia de la serie anterior.Made for Freddy Vega, by HanademiFuentes: Glazer, E., et al. (2024). FrontierMath: A benchmark for evaluating advanced mathematical reasoning in AI. arXiv.;Epoch AI. (2026). About FrontierMath.; OpenAI. (2026). AI as a scientific collaborator.Unidadporcentaje reportado40,3 %Puntuación anterior deGPT-5.242 %Problemascorregidos en v285 %Puntuación deGPT-5.5 en v2
La proporción de problemas corregidos fue ligeramente mayor que la puntuación líder anterior. El resultado posterior del 85 % pertenece a una prueba sustancialmente revisada, por lo que evidencia un progreso rápido, pero no una continuación limpia de la serie anterior.
What changed when FrontierMath v2 resetthe benchmark?FrontierMath v2 dataset composition and reported leaders after the June 12, 2026 update. The updateaddressed errors in 42% of problems.Made for Freddy Vega, by HanademiSources: epoch.ai. FrontierMath Tiers 1-3 (v2); linkedin.com. FrontierMath Tiers 1-4 v2.UnitProblems and reported scoreWhat v2 contains33829543Full datasetTiers 1-3Tier 4Who leads each tier85%76%GPT-5.5 Tiers 1-3Google Tier 4
The benchmark did not simply add stronger models to an unchanged race. Its v2 update addressed errors in 42% of problems and defined a 338-problem dataset with separate tiers. Against that reset, GPT-5.5 led Tiers 1-3 at 85%, while Google's AI co-mathematician led Tier 4 at 76%.
¿Qué cambió cuando FrontierMath v2reinició el benchmark?Composición del conjunto de datos v2 de FrontierMath y líderes reportados después de la actualización del12 de junio de 2026. La actualización corrigió errores en 42% de los problemas.Made for Freddy Vega, by HanademiFuentes: epoch.ai. FrontierMath Tiers 1-3 (v2); linkedin.com. FrontierMath Tiers 1-4 v2.UnidadProblemas y puntuación reportadaQué contiene v233829543Conjunto de datoscompletoNiveles 1-3Nivel 4Quién lidera cada nivel85 %76 %GPT-5.5, niveles 1-3Google, nivel 4
El benchmark no se limitó a añadir modelos más potentes a una carrera sin cambios. Su actualización v2 corrigió errores en 42% de los problemas y definió un conjunto de datos de 338 problemas con niveles separados. Tras ese reinicio, GPT-5.5 lideró los niveles 1-3 con 85%, mientras que el co-matemático de IA de Google lideró el nivel 4 con 76%.
Who led each tier of correctedFrontierMath?Reported v2 leaderboard scores on separate FrontierMath tiers after the June 12, 2026 correction.Made for Freddy Vega, by HanademiSources: linkedin.com.UnitPercent scoreGPT-5.5, Tiers1-385%Google, Tier 476%
There is no single FrontierMath champion in the supplied v2 evidence. GPT-5.5 led Tiers 1-3 at 85%. Google's AI co-mathematician led Tier 4 at 76%, so the winner changes with the problem tier.
¿Quién lideró cada nivel de FrontierMathcorregido?Puntuaciones reportadas de la tabla de posiciones v2 en niveles separados de FrontierMath después de lacorrección del 12 de junio de 2026.Made for Freddy Vega, by HanademiFuentes: linkedin.com.UnidadPuntuación porcentualGPT-5.5, niveles1-385 %Google, nivel 476 %
La evidencia v2 proporcionada no muestra un único campeón de FrontierMath. GPT-5.5 lideró los niveles 1-3 con 85%. El co-matemático de IA de Google lideró el nivel 4 con 76%, así que el ganador cambia según el nivel de los problemas.
Which FrontierMath problems wereaccessible, private, or public?Problem access across the reported Tier 4 evaluation and the public v2 subset, 2025-2026.Made for Freddy Vega, by HanademiSources: Epoch AI. (2026). About FrontierMath.; OpenAI. (2026). AI as a scientific collaborator.; Introducing GPT-5.2.; FrontierMath:LLM Benchmark for Advanced AI Math ....; epoch.ai.The first bar separates 30 accessed from 20 held-out Tier 4 problems.UnitProblems01020304050Accessible or core publicHeld out or Tier 4 publicTier 4 evaluation3020Public v2 subset10Verify this slide before presenting
A benchmark score is only as clean as the test access behind it. OpenAI had access to 30 Tier 4 problems, while 20 were held out. The public v2 subset was different again, with 10 core problems and only 2 Tier 4 problems. The reported Tier 4 score was 31%, but access conditions differed.
¿Qué problemas de FrontierMath eranaccesibles, privados o públicos?Acceso a los problemas en la evaluación reportada del nivel 4 y en el subconjunto público de la v2,2025-2026.Made for Freddy Vega, by HanademiFuentes: Epoch AI. (2026). About FrontierMath.; OpenAI. (2026). AI as a scientific collaborator.; Introducing GPT-5.2.; FrontierMath:LLM Benchmark for Advanced AI Math ....; epoch.ai.La primera barra separa 30 problemas con acceso de 20 problemas reservados del nivel 4.UnidadProblemas01020304050Accesibles o centrales públicosReservados o públicos del nivel 4Evaluación del nivel 43020Subconjunto público dela v210Verifica esta lámina antes de presentarla
Una puntuación de benchmark es tan sólida como el acceso a las pruebas que la sustenta. OpenAI tuvo acceso a 30 problemas del nivel 4, mientras que 20 quedaron reservados. El subconjunto público de la v2 era distinto: tenía 10 problemas centrales y solo 2 problemas del nivel 4. La puntuación reportada del nivel 4 fue de 31%, pero las condiciones de acceso fueron distintas.
How many Tier 4 problems could OpenAIaccess?FrontierMath Tier 4 problem access disclosed for OpenAI's evaluation, 2025-2026.Made for Freddy Vega, by HanademiSources: Epoch AI. (2026). About FrontierMath.UnitTier 4 problems01020304050AccessibleHeld outTier 43020
Held-out control is what turns a benchmark into stronger evidence. OpenAI had access to 30 of the 50 Tier 4 problems. The remaining 20 create the cleaner test, although access to problem statements and solutions followed different rules.
¿A cuántos problemas del nivel 4 tuvoacceso OpenAI?Acceso a los problemas del nivel 4 de FrontierMath divulgado para la evaluación de OpenAI, 2025-2026.Made for Freddy Vega, by HanademiFuentes: Epoch AI. (2026). About FrontierMath.UnidadProblemas del nivel 401020304050Con accesoFuera de la evaluaciónNivel 43020
Mantener problemas fuera de la evaluación convierte un benchmark en evidencia más sólida. OpenAI tuvo acceso a 30 de los 50 problemas del nivel 4. Los 20 restantes crean una prueba más limpia, aunque el acceso a los enunciados y a las soluciones siguió reglas distintas.
How many FrontierMath v2 problems werepublic?Public problems released on the FrontierMath v2 hub: 10 from Tiers 1-3 and 2 from Tier 4.Made for Freddy Vega, by HanademiSources: epoch.ai.UnitPublic problemsTiers 1-310Tier 42
The public can inspect only a small slice of FrontierMath v2. The hub released 10 problems from Tiers 1-3 and 2 from Tier 4. Other published figures generally refer to private sets, making independent reproduction difficult.
Sources
¿Cuántos problemas de FrontierMath v2eran públicos?Problemas públicos publicados en el hub de FrontierMath v2: 10 de los niveles 1-3 y 2 del nivel 4.Made for Freddy Vega, by HanademiFuentes: epoch.ai.UnidadProblemas públicosNiveles 1-310Nivel 42
El público solo puede inspeccionar una pequeña parte de FrontierMath v2. El hub publicó 10 problemas de los niveles 1-3 y 2 del nivel 4. Por lo general, las demás cifras publicadas se refieren a conjuntos privados, lo que dificulta la reproducción independiente.
Fuentes
How quickly did FrontierMath expand from119 to 300 problems?FrontierMath core-problem counts across five releases from October 22, 2024 to February 28, 2025.Made for Freddy Vega, by HanademiSources: Epoch AI. (2026). About FrontierMath.; FrontierMath v2: 42% of Math Problems Had Errors | Nerd Level Tech.UnitCore problems01002003002024-10-222024-11-062024-11-262024-12-042025-02-28February 2025 reached 300 coreproblems.119
The benchmark did not sit still. It moved from 119 problems to 147, then 180 and 197, before reaching 300 in February 2025. That expansion matters because a score can rise or fall with the test itself, not only with the model.
¿Con qué rapidez creció FrontierMath de119 a 300 problemas?Cantidad de problemas centrales de FrontierMath a lo largo de cinco versiones, del 22 de octubre de 2024al 28 de febrero de 2025.Made for Freddy Vega, by HanademiFuentes: Epoch AI. (2026). About FrontierMath.; FrontierMath v2: 42% of Math Problems Had Errors | Nerd Level Tech.UnidadProblemas centrales01002003002024-10-222024-11-062024-11-262024-12-042025-02-28febrero de 2025 alcanzó 300problemas centrales.119
El benchmark no permaneció estático. Pasó de 119 problemas a 147, luego a 180 y 197, antes de llegar a 300 en febrero de 2025. Esa expansión importa porque una puntuación puede subir o bajar debido a la propia prueba, no solo al modelo.
How much did invalid-question rates varyacross math benchmarks?Invalid-question rates reported in a review of MMLU Math and GSM8K.Made for Freddy Vega, by HanademiSources: hai.stanford.edu.UnitPercent of questionsMMLU Math2%GSM8K42%
Model scores inherit the quality of the questions underneath them. The reviewed invalid-question rate was 2% for MMLU Math and 42% for GSM8K. Benchmark governance is therefore part of capability measurement, not administrative cleanup.
¿Cuánto variaron las tasas de preguntasinválidas entre benchmarks matemáticos?Tasas de preguntas inválidas reportadas en una revisión de MMLU Math y GSM8K.Made for Freddy Vega, by HanademiFuentes: hai.stanford.edu.UnidadPorcentaje de preguntasMMLU Math2 %GSM8K42 %
Las puntuaciones de los modelos heredan la calidad de las preguntas en las que se basan. La tasa de preguntas inválidas revisada fue de 2% para MMLU Math y de 42% para GSM8K. Por lo tanto, la gobernanza del benchmark forma parte de la medición de capacidades, no es una simple tarea administrativa.
Across four systems, expert referees foundpassing solutions on seven of ten problems.First Proof evaluated 39 AI submissions with roughly 30 expert referees. The resultcombines four systems, so it measures the number of problems receiving at least onepassing solution, not one system's standalone success rate.Sources: First Proof Foundation. (2026). First Proof second batch.
This is not a claim that one model solved seven problems. First Proof combined four systems, 39 submissions, and about 30 expert referees. Across the 10 research problems, seven received at least one passing solution. The striking point is breadth across the problem set, with system-level attribution still separate.
En cuatro sistemas, los árbitros expertosencontraron soluciones aprobadas parasiete de cada diez problemas.First Proof evaluó 39 propuestas de IA con aproximadamente 30 árbitros expertos. Elresultado combina cuatro sistemas, por lo que mide cuántos problemas recibieron almenos una solución aprobada, no la tasa de éxito individual de un sistema.Fuentes: First Proof Foundation. (2026). First Proof second batch.
Esto no significa que un solo modelo haya resuelto siete problemas. First Proof combinó cuatro sistemas, 39 propuestas y aproximadamente 30 árbitros expertos. De los 10 problemas de investigación, siete recibieron al menos una solución aprobada. Lo destacable es la amplitud en el conjunto de problemas, mientras que la atribución a nivel de sistema sigue siendo independiente.
How did First Proof results change understronger testing conditions?Different First Proof conditions in 2026: standard public-model screening versus later submissions fromfour stronger systems.Made for Freddy Vega, by HanademiSources: First Proof Foundation. (2026). First Proof second batch.UnitProblems with a solutionApril screening0Laterrefereeing7
Standard public models solved none of the 10 screening problems under the preliminary conditions. Later, stronger systems and research harnesses produced passing solutions on 7 of 10 problems. The comparison shows how much the surrounding research system matters.
¿Cómo cambiaron los resultados de FirstProof con condiciones más potentes?Distintas condiciones de First Proof en 2026: evaluación preliminar de modelos públicos estándar frente aenvíos posteriores de cuatro sistemas más potentes.Made for Freddy Vega, by HanademiFuentes: First Proof Foundation. (2026). First Proof second batch.UnidadProblemas con una soluciónEvaluación preliminar de abril0Evaluación posterior porárbitros7
Los modelos públicos estándar no resolvieron ninguno de los 10 problemas de la evaluación preliminar bajo esas condiciones. Posteriormente, sistemas más potentes y entornos de pruebas de investigación produjeron soluciones aprobadas para 7 de 10 problemas. La comparación muestra cuánto importa el sistema de investigación que rodea al modelo.
How consistently do formal systems solveproblems and automate proof steps?MiniF2F success and automated proof-step shares, reported by separate formal-proving studies.Made for Freddy Vega, by HanademiSources: arxiv.org.; neus-2025.github.io.UnitPercent86.1%Prover Agent success74.2%Lean Copilot automation40.1%AESOP automation
Formal proving has moved well beyond toy demonstrations, but the strength is not one clean number. Prover Agent reported 86.1% on MiniF2F. In another setting, Lean Copilot automated 74.2% of proof steps, compared with 40.1% for AESOP. Success on a benchmark and automation inside a proof are different tests.
¿Con qué constancia resuelven problemas yautomatizan pasos los sistemas formales?Éxito en MiniF2F y proporción de pasos de demostración automatizados, según estudios independientes dedemostración formal.Made for Freddy Vega, by HanademiFuentes: arxiv.org.; neus-2025.github.io.UnidadPorcentaje86,1 %Éxito de Prover Agent74,2 %Automatización de LeanCopilot40,1 %Automatización de AESOP
La demostración formal ya superó ampliamente las demostraciones de juguete, pero su fortaleza no se resume en una sola cifra. Prover Agent reportó 86,1% en MiniF2F. En otro contexto, Lean Copilot automatizó 74,2% de los pasos de demostración, frente a 40,1% de AESOP. El éxito en un benchmark y la automatización dentro de una demostración son pruebas distintas.
Machine checking found no extra axiomsbeyond Lean's standard 3.The Fermat claim was not verified live at build time. The zeta artifact reports that itsheadline theorems have no hypotheses and declare no additional axioms.Sources: Anthropic. (2026, September 4). Formalizing Fermat's Last Theorem.; github.com.Sources use different measurement bases; read the comparison directionally, not as one exact scale.
A formal proof can disclose exactly what it assumes. Both supplied artifacts report only Lean's 3 standard axioms. That strengthens confidence in the encoded argument, but it still leaves interpretation, attribution, and broad acceptance to people.
La comprobación automática no encontróaxiomas adicionales más allá de los 3estándar de Lean.La afirmación sobre Fermat no se verificó en vivo al momento de generar el material. Elartefacto zeta informa que sus teoremas principales no tienen hipótesis ni declaranaxiomas adicionales.Fuentes: Anthropic. (2026, September 4). Formalizing Fermat's Last Theorem.; github.com.Las fuentes usan bases de medición distintas; lea la comparación como tendencia, no como una escala exacta.
Una demostración formal puede revelar exactamente qué supone. Los dos artefactos proporcionados reportan únicamente los 3 axiomas estándar de Lean. Eso aumenta la confianza en el argumento codificado, pero deja la interpretación, la atribución y la aceptación general en manos de las personas.
Can verified local pieces still leave the maintheorem open?FormalQualBench results and a Grasshopper proof case study, with separate denominators and proofscopes.Made for Freddy Vega, by HanademiSources: arxiv.org.; arxiv.org.UnitTheorems and lemmasQualifying-exam theorems solved108MerLean-ProverOpenGauss baselineGrasshopper formalization41Helper lemmas verifiedTop-level proof unresolved
The gap between a checked component and a completed theorem is the key lesson. MerLean-Prover solved 10 of 23 qualifying-exam theorems, compared with 8 for OpenGauss. But the Grasshopper case verified four helper lemmas and still left one top-level obligation unresolved. Formal checking strengthens the chain, yet it does not erase the final missing link.
Sources
¿Pueden piezas locales verificadas dejarabierto el teorema principal?Resultados de FormalQualBench y un estudio de caso sobre la demostración de Grasshopper, condenominadores y alcances de demostración distintos.Made for Freddy Vega, by HanademiFuentes: arxiv.org.; arxiv.org.UnidadTeoremas y lemasTeoremas de examen de doctorado resueltos108MerLean-ProverLínea base de OpenGaussFormalización de Grasshopper41Lemas auxiliares verificadosDemostración principal noresuelta
La diferencia entre un componente comprobado y un teorema completo es la lección clave. MerLean-Prover resolvió 10 de 23 teoremas de exámenes de doctorado, frente a 8 de OpenGauss. Pero el caso de Grasshopper verificó cuatro lemas auxiliares y dejó sin resolver una obligación de nivel superior. La comprobación formal fortalece la cadena, pero no elimina el último eslabón faltante.
Fuentes
How many qualifying theorems did MerLeansolve versus the baseline?FormalQualBench PhD-qualifying-exam theorems solved by MerLean-Prover and the strongest publishedopen-source baseline.Made for Freddy Vega, by HanademiSources: arxiv.org.UnitTheorems solvedMerLean-Prover10OpenGaussbaseline8
MerLean-Prover solved 10 of the 23 qualifying-exam theorems. The strongest published open-source baseline solved 8. The improvement is meaningful, but most of the benchmark still resisted both systems.
Sources
¿Cuántos teoremas de examen resolvióMerLean frente a la línea base?Teoremas de exámenes de doctorado de FormalQualBench resueltos por MerLean-Prover y la línea basede código abierto publicada más fuerte.Made for Freddy Vega, by HanademiFuentes: arxiv.org.UnidadTeoremas resueltosMerLean-Prover10Línea base deOpenGauss8
MerLean-Prover resolvió 10 de los 23 teoremas del examen de doctorado. La línea base de código abierto publicada más fuerte resolvió 8. La mejora es significativa, pero la mayoría del benchmark siguió resistiéndose a ambos sistemas.
Fuentes
Did four verified lemmas complete the maintheorem?Verified local components and unresolved top-level obligation in an AI formalization of the Grasshopperproblem.Made for Freddy Vega, by HanademiSources: arxiv.org.UnitProof componentsHelper lemmas verified4Main theoremunresolved1
The AI formalization successfully verified four helper lemmas. The main theorem still closed with one unresolved sorry. A proof pipeline can therefore look busy and locally correct while failing at the single obligation that matters most.
Sources
¿Cuatro lemas verificados completaron elteorema principal?Componentes locales verificados y obligación de nivel superior sin resolver en una formalización asistidapor IA del problema del Saltamontes.Made for Freddy Vega, by HanademiFuentes: arxiv.org.UnidadComponentes de la demostraciónLemas auxiliares verificados4Teorema principal sinresolver1
La formalización asistida por IA verificó correctamente cuatro lemas auxiliares. El teorema principal aún quedó cerrado con un único `sorry` sin resolver. Por lo tanto, una cadena de demostración puede parecer activa y correcta a nivel local, pero fallar en la única obligación que más importa.
Fuentes
How long did Poincaré take to becomesettled science?Poincare conjecture milestones from 1904 to 2010, with consensus in 2006 and expert exposition in 2008.Made for Freddy Vega, by HanademiSources: Clay Mathematics Institute. (2026). Poincare conjecture.; science.org.; math.berkeley.edu.UnitCalendar years1904200320101904Conjecture posed2002First Perelman preprint2003Final key preprint2010Clay prize announcement
A correct proof does not become settled science the moment it appears. Poincare asked the question in 1904. Perelman posted decisive work in 2002 and 2003, consensus arrived in 2006, and expert notes filled missing details in 2008 before Clay's 2010 prize announcement. The result also reached beyond Poincare to eight geometries in the broader geometrization theorem.
¿Cuánto tardó Poincaré en convertirse enciencia consolidada?Hitos de la conjetura de Poincaré de 1904 a 2010, con consenso en 2006 y una exposición experta en 2008.Made for Freddy Vega, by HanademiFuentes: Clay Mathematics Institute. (2026). Poincare conjecture.; science.org.; math.berkeley.edu.UnidadAños del calendario1904200320101904Conjetura planteada2002Primer preprint de Perelman2003Preprint clave final2010Anuncio del premio de Clay
Una demostración correcta no se convierte en ciencia consolidada en cuanto aparece. Poincaré planteó la pregunta en 1904. Perelman publicó trabajos decisivos en 2002 y 2003, el consenso llegó en 2006 y los apuntes de expertos completaron los detalles faltantes en 2008, antes del anuncio del premio de Clay en 2010. El resultado también fue más allá de Poincaré, al abarcar ocho geometrías en el teorema más amplio de geometrización.
How long did Poincaré take from conjectureto proof and prize?Discovery dominated the century-long history, but validation still consumed four years to consensus andanother four to institutional recognition. Faster proof generation does not erase that downstream work.Made for Freddy Vega, by HanademiSources: Clay Mathematics Institute. (2026). Poincare conjecture.; Poincaré Conjecture.; science.org.Unitelapsed years98 yearsConjecture to firstproof preprint4 yearsFirst preprint toexpert consensus4 yearsExpert consensusto Clay prize
Discovery dominated the century-long history, but validation still consumed four years to consensus and another four to institutional recognition. Faster proof generation does not erase that downstream work.
¿Cuánto tardó Poincaré desde la conjeturahasta la prueba y el premio?El descubrimiento dominó la historia de un siglo, pero la validación aún consumió cuatro años hasta elconsenso y otros cuatro hasta el reconocimiento institucional. Generar pruebas más rápido no elimina esetrabajo posterior.Made for Freddy Vega, by HanademiFuentes: Clay Mathematics Institute. (2026). Poincare conjecture.; Poincaré Conjecture.; science.org.Unidadaños transcurridos98 añosDe la conjetura a laprimera prepublicación4 añosDe la primera prepublicaciónal consenso experto4 añosDel consenso expertoal premio Clay
El descubrimiento dominó la historia de un siglo, pero la validación aún consumió cuatro años hasta el consenso y otros cuatro hasta el reconocimiento institucional. Generar pruebas más rápido no elimina ese trabajo posterior.
What does the reported 83.62% Riemannresult actually prove?Lower bounds for the share of nontrivial zeta zeros that are distinct; the optimized result uses aMontgomery-Taylor window.Made for Freddy Vega, by HanademiSources: arxiv.org.; arxiv.org.; github.com.UnitPercent of nontrivial zerosVerified lowerbound83.3%Optimized result83.6%
This is real progress, but it is progress on a narrower question. The strongest result raises the distinct-zero lower bound to 83.62%. That still says nothing like a universal proof of the Riemann hypothesis, even though the formal Lean artifact uses no added hypotheses.
¿Qué demuestra realmente el resultadoreportado del 83,62 % sobre Riemann?Cotas inferiores de la proporción de ceros no triviales de zeta que son distintos; el resultado optimizadoutiliza una ventana de Montgomery-Taylor.Made for Freddy Vega, by HanademiFuentes: arxiv.org.; arxiv.org.; github.com.UnidadPorcentaje de ceros no trivialesCota inferiorverificada83,3 %Resultado optimizado83,6 %
Es un avance real, pero en una pregunta más acotada. El resultado más sólido eleva la cota inferior de ceros distintos a 83,62%. Eso sigue sin constituir una demostración universal de la hipótesis de Riemann, aunque el artefacto formal en Lean no utiliza hipótesis adicionales.
How close were the two distinct-zerobounds?Unconditional lower bounds for the share of nontrivial zeta zeros that are distinct, from two 2026 papers.Made for Freddy Vega, by HanademiSources: arxiv.org.; arxiv.org.UnitPercent distinctFive-sixthsresult83.3%Optimized window83.6%
Two independent 2026 proofs converge on distinct-zero bounds of 83.33% and 83.62%. The comparison is about whether zeros are repeated, not about the separate percentage known to lie on the critical line.
Sources
¿Qué tan cercanos fueron los dos límites deceros distintos?Cotas inferiores incondicionales para la proporción de ceros no triviales de zeta que son distintos, a partirde dos artículos de 2026.Made for Freddy Vega, by HanademiFuentes: arxiv.org.; arxiv.org.UnidadPorcentaje de ceros distintosResultado de cincosextos83,3 %Ventana optimizada83,6 %
Dos demostraciones independientes de 2026 convergen en cotas de 83,33 % y 83,62 % para los ceros distintos. La comparación trata sobre si los ceros se repiten, no sobre el porcentaje separado que se sabe que está en la línea crítica.
Fuentes
10,000,000,000,000 zeros pass, but aninfinite claim needs proof.Finite verification can test an enormous initial segment, but it cannot establish a universaltheorem over infinitely many zeros.Sources: Clay Mathematics Institute. (2026). Riemann hypothesis.; Anthropic. (2026, August 10). Learning more about Claude's mathematicalcapabilities.
Computation has checked the first 10,000,000,000,000 relevant zeros. Every one can agree with the hypothesis without proving what happens across an infinite sequence. Anthropic also states that Claude did not prove the Riemann hypothesis.
10.000.000.000.000 ceros superan laprueba, pero una afirmación infinitanecesita una demostración.La verificación finita puede poner a prueba un segmento inicial enorme, pero no puedeestablecer un teorema universal sobre infinitos ceros.Fuentes: Clay Mathematics Institute. (2026). Riemann hypothesis.; Anthropic. (2026, August 10). Learning more about Claude's mathematicalcapabilities.
La computación ha verificado los primeros 10.000.000.000.000 ceros relevantes. Todos pueden coincidir con la hipótesis sin demostrar qué ocurre a lo largo de una sucesión infinita. Anthropic también afirma que Claude no demostró la hipótesis de Riemann.
What do experts believe about the unsolvedP versus NP problem?A 2002 poll of mathematicians and computer scientists, alongside Clay's 2026 unsolved classification.Made for Freddy Vega, by HanademiSources: Clay Mathematics Institute. (2026). P versus NP.; news.mit.edu. P versus NP problem.; terrytao.wordpress.com. PNPrelativisation and multiple-choice exams.UnitRespondentsP differs fromNP61P equals NP9
The poll captures expert belief, not a proof. Most respondents expected P to differ from NP, but expectation cannot settle the question. The problem also resists brute force and a whole class of relativizing proof strategies.
¿Qué creen los expertos sobre el problemaP versus NP sin resolver?Una encuesta de 2002 a matemáticos y científicos de la computación, junto con la clasificación de Clay comono resuelto en 2026.Made for Freddy Vega, by HanademiFuentes: Clay Mathematics Institute. (2026). P versus NP.; news.mit.edu. P versus NP problem.; terrytao.wordpress.com. PNPrelativisation and multiple-choice exams.UnidadEncuestadosP es distinta deNP61P es igual a NP9
La encuesta refleja la opinión de los expertos, no una prueba. La mayoría de los encuestados esperaba que P fuera distinta de NP, pero una expectativa no puede resolver la cuestión. El problema también se resiste a la fuerza bruta y a toda una clase de estrategias de prueba relativizables.
Why does choosing 100 of 400 studentsdefeat brute force?Clay's illustrative selection problem: choose a group of 100 students from 400 candidates.Made for Freddy Vega, by HanademiSources: Clay Mathematics Institute. (2026). P versus NP.UnitStudentsGroupselected100Candidatepool400
The numbers look harmless: choose 100 students from a pool of 400. The number of possible groups is larger than the estimated number of atoms in the known universe. P versus NP asks whether clever methods can escape searches that brute force cannot finish.
¿Por qué elegir 100 de 400 estudiantesderrota la fuerza bruta?Problema ilustrativo de selección de Clay: elegir un grupo de 100 estudiantes entre 400 candidatos.Made for Freddy Vega, by HanademiFuentes: Clay Mathematics Institute. (2026). P versus NP.UnidadEstudiantesGrupo seleccionado100Grupo decandidatos400
Las cifras parecen inofensivas: elegir 100 estudiantes de un grupo de 400. El número de grupos posibles es mayor que el número estimado de átomos en el universo conocido. P versus NP pregunta si los métodos ingeniosos pueden evitar búsquedas que la fuerza bruta no puede terminar.
How broadly was BSD proved within onelimited family?Computer-assisted proofs for elliptic curves of conductor below 5,000 and analytic rank 0 or 1.Made for Freddy Vega, by HanademiSources: cambridge.org.UnitElliptic curvesFormula proved16,71416,714 eligible curves received rigorous proofs.Eligible curves16,725
Computer assistance rigorously proved the BSD formula for 16,714 eligible curves. The defined population contained 16,725 curves. That is extraordinarily broad evidence within one range, but the Millennium conjecture remains a general statement.
¿Hasta dónde se demostró BSD dentro deuna familia limitada?Demostraciones asistidas por computadora para curvas elípticas de conductor menor que 5.000 y rangoanalítico 0 o 1.Made for Freddy Vega, by HanademiFuentes: cambridge.org.UnidadCurvas elípticasFórmula demostrada16.714Se obtuvieron demostraciones rigurosas para 16.714 curvas elegibles.Curvas elegibles16.725
La asistencia computacional demostró rigurosamente la fórmula BSD para 16.714 curvas elegibles. La población definida contenía 16.725 curvas. Es una evidencia extraordinariamente amplia dentro de un rango, pero la conjetura del Milenio sigue siendo una afirmación general.
Every tested genus-two case matched thecomputable power-of-two pattern.The study reports empirical evidence for modular Jacobians of genus-two curves. Its32 cases form a separate population from the elliptic-curve proof result.Sources: wstein.org.
The researchers could compute five quantities and infer the sixth. In all 32 examined cases, the result sat near an integer power of 2 and matched the computable 2-torsion. Perfect agreement in a sample is strong evidence, not a universal theorem.
Todos los casos de género dosexaminados coincidieron con el patróncomputable de potencias de dos.El estudio reporta evidencia empírica sobre jacobianos modulares de curvas de génerodos. Sus 32 casos constituyen una población distinta de la del resultado de lademostración para curvas elípticas.Fuentes: wstein.org.
Los investigadores pudieron calcular cinco cantidades e inferir la sexta. En los 32 casos examinados, el resultado quedó cerca de una potencia entera de 2 y coincidió con la 2-torsión computable. La coincidencia perfecta en una muestra es evidencia sólida, no un teorema universal.
What Yang-Mills bounds does thefinite-lattice preprint report?2026 preprint result for a finite lattice in pure SU(2) Yang-Mills theory; endpoint lower bounds.Made for Freddy Vega, by HanademiSources: doi.org.UnitLattice mass-gap unitsStrong couplingendpoint0.4Weak coupling endpoint0.0516
The result gives the mass gap a positive lower bound at two finite-lattice endpoints. The strong-coupling bound is 0.3599, while the weak-coupling bound is 0.0516. The scope matters: this is a preprint on a finite lattice, not a complete solution of the Millennium problem.
Sources
¿Qué cotas de Yang-Mills reporta elpreprint sobre una red finita?Resultado de un preprint de 2026 para una red finita en una teoría de Yang-Mills pura con SU(2); cotasinferiores en los extremos.Made for Freddy Vega, by HanademiFuentes: doi.org.UnidadUnidades de la brecha de masa en la redExtremo de acoplamientofuerte0,4Extremo de acoplamiento débil0,0516
El resultado establece una cota inferior positiva para la brecha de masa en dos extremos de una red finita. La cota de acoplamiento fuerte es 0,3599, mientras que la de acoplamiento débil es 0,0516. El alcance importa: se trata de un preprint sobre una red finita, no de una solución completa del problema del Millennium Prize.
Fuentes
Why does scientific trust require more thanAI leaderboard position?Six-company Arena Elo ranking in March 2026 beside separate ClockBench accuracy results for AI andhumans.Made for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2026). AI Index Report 2026: Technicalperformance.; First Proof Foundation. (2026). First Proof second batch.; OpenAI. (2026, September 8; updated September10). On the Navier-Stokes Millennium Prize Problem.UnitArena Elo and accuracyArena Elo, March 20261,5031,4951,4941,4811,4491,424AnthropicxAIGoogleOpenAIAlibabaDeepSeekClock-reading accuracy50.6%90.1%Top AI modelHumans
The leaderboard looks tightly packed, from 1,503 to 1,424. But scientific trust is tested elsewhere. AI clock-reading accuracy reached only 50.6%, versus 90.1% for humans, while benchmark reviews found invalid questions and proof-credit disputes moved quickly. Capability, reliability, and provenance have to travel together.
¿Por qué la confianza científica exige másque liderar un ranking de IA?Ranking Arena Elo de seis empresas en marzo de 2026, junto a resultados independientes de precisión deClockBench para IA y humanos.Made for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2026). AI Index Report 2026: Technicalperformance.; First Proof Foundation. (2026). First Proof second batch.; OpenAI. (2026, September 8; updated September10). On the Navier-Stokes Millennium Prize Problem.UnidadArena Elo y precisiónArena Elo, marzo de 20261.5031.4951.4941.4811.4491.424AnthropicxAIGoogleOpenAIAlibabaDeepSeekPrecisión al leer relojes50,6 %90,1 %Modelo de IA líderHumanos
El ranking parece muy compacto, de 1.503 a 1.424. Pero la confianza científica se pone a prueba en otros ámbitos. La precisión de la IA al leer relojes llegó apenas a 50,6%, frente a 90,1% en el caso de los humanos, mientras que las revisiones de benchmarks detectaron preguntas inválidas y disputas de atribución en pruebas que avanzaron rápidamente. La capacidad, la confiabilidad y la procedencia deben avanzar juntas.
How can AI win math gold yet struggle toread clocks?Separate 2025-2026 evaluations: International Mathematical Olympiad score and ClockBench accuracy.Made for Freddy Vega, by HanademiSources: Stanford Institute for Human-Centered Artificial Intelligence. (2026). AI Index Report 2026: Technicalperformance.UnitScores from separate evaluationsOlympiad score3542AI scoreMaximumClock-reading accuracy50.6%90.1%Top AI modelHumans
The same technological era produced a 35-point Olympiad performance and only 50.6% clock-reading accuracy. Humans reached 90.1% on the clock task. AI capability is not a ladder where every skill rises together.
¿Cómo puede la IA ganar oro matemático yfallar al leer relojes?Evaluaciones separadas de 2025-2026: puntuación en la Olimpiada Internacional de Matemáticas yprecisión en ClockBench.Made for Freddy Vega, by HanademiFuentes: Stanford Institute for Human-Centered Artificial Intelligence. (2026). AI Index Report 2026: Technicalperformance.UnidadPuntuaciones de evaluaciones separadasPuntuación en la Olimpiada3542Puntuación de la IAMáximoPrecisión al leer relojes50,6 %90,1 %Modelo de IA líderHumanos
En la misma era tecnológica se obtuvo un desempeño de 35 puntos en la Olimpiada y una precisión de apenas 50,6% al leer relojes. Los humanos alcanzaron 90,1% en la tarea de los relojes. La capacidad de la IA no es una escalera en la que todas las habilidades mejoren al mismo tiempo.
In summaryMade for Freddy Vega, by HanademiSources: linkedin.com.; ai-beat.github.io.; Epoch AI. (2026). About FrontierMath.; epoch.ai.; neus-2025.github.io.On the corrected v2 benchmark, Google's AI co-mathematician led Tier 4 with a 76% score.Will Sawin refined the unit-distance construction to achieve n^1.014 unit-distance pairs for infinitely many n.On the corrected v2 benchmark, GPT-5.5 (xhigh) led Tiers 1–3 with an 85% score.FrontierMath Tier 4 contains 50 mini-research-project problems, and OpenAI reported GPT-5.2 Pro solving 31 percent.On June 12, 2026, FrontierMath v2 addressed errors in 42% of problems.Lean Copilot automated 74.2% of proof steps on average, compared with 40.1% for AESOP.
The value of the research is not only what each source knew, but what became visible when their evidence was combined.
En resumenMade for Freddy Vega, by HanademiFuentes: linkedin.com.; ai-beat.github.io.; Epoch AI. (2026). About FrontierMath.; epoch.ai.; neus-2025.github.io.En el benchmark v2 corregido, el co-matemático de IA de Google lideró el nivel 4 con una puntuación del 76%.Will Sawin refinó la construcción del problema de distancias unitarias para alcanzar n^1.014 pares de distancia unitariapara infinitos valores de n.En el benchmark v2 corregido, GPT-5.5 (xhigh) lideró los niveles 1–3 con una puntuación del 85%.FrontierMath Tier 4 contiene 50 problemas concebidos como miniproyectos de investigación, y OpenAI informó que GPT-5.2 Pro resolvió 31%.El 12 de junio de 2026, FrontierMath v2 corrigió errores en el 42% de los problemas.Lean Copilot automatizó en promedio el 74,2 % de los pasos de prueba, frente al 40,1 % de AESOP.
El valor de la investigación no está solo en cada fuente, sino en lo que apareció al combinar sus evidencias.

The research behind this deck

AI systems report solving up to 85% of a corrected frontier-math benchmark, yet 42% of its problems required error corrections and performance remains uneven across research proofs and ordinary clock reading. 6 technical terms carry much of the argument.

Key findings

The argument

This research is published in English and Spanish. Ver en español

La investigación detrás de esta presentación

Los sistemas de IA reportan resolver hasta el 85 % de un benchmark corregido de matemáticas de frontera, pero el 42 % de sus problemas requirió correcciones y el desempeño sigue siendo desigual entre pruebas de investigación y la lectura cotidiana de relojes. 6 términos técnicos sostienen buena parte del argumento.

Hallazgos clave

El argumento

Esta investigación se publica en inglés y español. Read in English

Related researchInvestigación relacionada