Hopp til hovedinnhold
Tilbake

Erdős-problemene ble KI-labbenes nye benchmark, og hobbyistene kom først

KI Takeaway KI-generert · kan inneholde feil

Startet som en privat liste over Erdős-problemer, endte som benchmarken OpenAI og Google DeepMind kappes på.

Thomas Bloom ville bare holde orden på hvilke av Paul Erdős' tusenvis av spørsmål som fortsatt sto åpne. I 2023 samlet han et par hundre av dem på erdosproblems.com og skrev Python-koden med hjelp fra ChatGPT, i den tro at ingen andre ville bruke siden. Quanta Magazine beskriver hvordan listen ble det Jared Duker Lichtman ved Stanford University kaller et samlet oppslagsverk labbene skjønte kunne fungere som benchmark.

Tempoet det siste halvåret lar seg telle. I januar 2026 gikk 24 forskere ledet av Google DeepMind gjennom 700 problemer merket «åpne» ved hjelp av Gemini, løste fire og gjenfant glemte løsninger på ni. I mai meldte et annet DeepMind-team at agenten deres på egen hånd løste 9 av 353 åpne problemer, til noen hundre dollar per problem. 20. mai la OpenAI fram et moteksempel til enhetsavstand-problemet fra 1946, funnet av en intern modell. 1. august fulgte den uslupne modellen Astra med ti nye framskritt, tre av dem Erdős-problemer.

«Hadde et menneske skrevet artikkelen og sendt den til Annals of Mathematics, og jeg var blitt bedt om en rask vurdering, ville jeg anbefalt den uten å nøle. Ingen tidligere KI-generert bevis har vært i nærheten.» — Tim Gowers, Cambridge og Collège de France

Det praktisk interessante ligger like mye i metoden som i resultatene. Liam Price, som selv sier han ikke har nok matematisk bakgrunn til å verifisere svarene, ba først en modell om en løsning, matet så løsningen inn i en fersk instans som skulle kontrollere den, og gjentok til noe holdt. Sammen med Kevin Barreto brukte han GPT-5.2 Pro til å løse Erdős 728 i januar, og fikk beviset formelt sjekket med verktøyet Aristotle fra Harmonic. Bloom peker på baksiden: nettstedet fylles nå med artikler på 100 til 200 sider der modellen både skrev og godkjente beviset, og ingen mennesker har lest dem.

For deg som bygger med modeller er poenget at gevinsten kom fra sjekk-loopen rundt modellen, ikke fra modellen alene.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter