Seks KI-agenter, ingen koordinator: nye resultater på fem av tolv matematikkproblemer
Ga seks agenter et forskningsmål og ingen koordinator, og fikk matematiske resultater som er nye for litteraturen på fem av tolv problemer.
Stephen Chung, Wenyu Du og William J. Wesley la 24. august ut en studie av Station, et åpent flermiljø der KI-agenter behandles som selvstendige forskere i stedet for som verktøy i en fast pipeline. Hver Station-instans hadde seks agenter: to drevet av GPT-5.5, to av Claude Opus 4.8 og to av Gemini 3.1 Pro. De valgte forskningsretning selv, kjørte kode, sendte post til hverandre og publiserte artikler i et internt arkiv som senere agenter kunne lese og sitere.
Over 12 problemer fra AlphaEvolve-katalogen ga fem funn som er nye for litteraturen. Agentene konstruerte tre eksakte kissing-konfigurasjoner på 604 punkter i dimensjon 11, mot AlphaEvolves 593, og fant et Kakeya-sett på 53 punkter der forrige grense lå på 63. På de resterende sju problemene slo Station AlphaEvolve på tre, gikk likt på to og tapte på to.
Meta-analysen av hvem som fant hva er like interessant som funnene. Av 28 utvalgte resultater sto Claude-agentene for 18, altså 64,3 prosent, GPT-agentene for 9 og Gemini-agentene for ett. Publiseringsmønsteret gikk motsatt vei: Gemini-agentene sendte 2 652 artikler til det interne arkivet og fikk 508 godkjent, mens GPT-agentene sendte 506 og fikk 388 gjennom.
«Gemini-agentene hadde en tendens til å overdrive, for eksempel ved å erklære en retning umulig på grunnlag av begrenset belegg.» - Chung, Du og Wesley i studien
Samarbeidet er den andre halvparten av poenget. 13 av de 28 resultatene involverte agenter fra mer enn én modellfamilie, og Claude-agentene deltok i samtlige 13. Bare 9 av 28 kom fra én agent som jobbet alene. Den hyppigste kanalen på tvers av modellfamilier var ikke direktemelding, men arkivet: 61,5 prosent av samarbeidene gikk gjennom publiserte artikler.
Tidsprofilen forklarer hvorfor det interne biblioteket betyr noe. 13 av 28 resultater kom etter tick 1000, og det vanskeligste, en konferansegraf-familie for Book Ramsey-tall, dukket først opp ved tick 3727. De tidlige funnene var stort sett direkte utvidelser av det modellene allerede kunne fra pretreningen.
«Vår rolle etter kjøringen var begrenset til å kontrollere gyldigheten av bevisene deres og hvor nye resultatene var.» - Chung, Du og Wesley i studien
Station er ikke universelt bedre. På peak- og flat-autokonvolusjon, problemer som belønner utholdende numerisk søk over uregelmessige objekter, tapte agentene mot AlphaEvolve. Forfatterne peker på at hver enkeltevaluering var begrenset til 15 til 30 minutter, noe som presset agentene mot teoristyrte konstruksjoner framfor rå søkekraft.
For deg som bygger agentsystemer er arkivmekanismen den overførbare ideen. Station akkumulerer ikke optimeringshistorikk eller sesjonsminne, men ferdige tekster som har passert en automatisk fagfellevurdering og som en senere agent kan lese kaldt. Koden ligger åpent under dualverse-ai/station på GitHub, sammen med alle rådialogene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.