Hopp til hovedinnhold
Tilbake
Forskning 3 min · Kilde: Hugging Face - Blog

Agenter gjennomgikk 2 200 ICML-artikler: 496 fikk påstander bestridt

KI Takeaway KI-generert · kan inneholde feil

Reproduserte 1 221 deltakere rundt 2 200 ICML-artikler med kodeagenter, og 496 av dem fikk minst én påstand bestridt.

«Den lave konfidensscoren min skyldes at jeg ikke sjekket alle bevisene nøye» — fagfelle, i vurderingen av en ICML 2026-artikkel som likevel fikk spotlight

Setningen står i Hugging Faces egen gjennomgang av ICML 2026 Open Reproductions, og artikkelen den gjelder heter «Towards Optimal Robustness in Learning-Augmented Paging». Da noen omsider sjekket bevisene, holdt de ikke. En deltakers loggbok målte at det additive leddet vokser med k, og pekte på det presise steget i beviset som brakk. Arrangørene utvidet selv sveipet til k lik 1 024 og bekreftet veksten på rundt ni sigma.

Resultatet er ikke et enkelt ja eller nei. 1 103 artikler, 51 prosent av de undersøkte, fikk minst én påstand bekreftet med reelle eksperimenter, og 3 978 enkeltpåstander ble bekreftet i alt. 266 artikler ble reprodusert fullt ut. 496 artikler, 23 prosent, fikk minst én påstand falsifisert eller bestridt. Av dem er 242 det mest tankevekkende tallet: der kom uavhengige reproduksjonslag til motsatt konklusjon om nøyaktig samme påstand.

Noen av funnene er konkrete nok å ta på. I «Attention's forward pass and Frank-Wolfe» fant tre uavhengige lag moteksempler til et teorem, med brudd som først dukker opp etter 224, rundt 3 800 og 6 416 steg. Det forklarer hvorfor alle andre bekreftet påstanden: sjekker med endelig horisont stopper for tidlig. Forfatterne bekreftet funnet samme dag. I «Do Transformers Need Three Projections?» oppdaget en deltaker at rundt 66 prosent av de evaluerte posisjonene var EOS-fylltegn som trener mot null tap, og det presset perpleksiteten ned til en tredjedel. Abstraktets 3,1 prosent kvalitetstap for 50 prosent mindre cache blir rundt 9,4 prosent korrigert.

Agentene tok også feil i motsatt retning. Én loggbok slo fast at metoden var dobbelt så langsom som referansen. Feilen var aritmetisk: tid per bane målt mot tid per bunke på 50. Riktig normalisert bekrefter deltakerens egne tall artikkelens påstand om 8 ganger raskere kjøring. Arrangørene re-verifiserte alle 35 formelle falsifiseringspåstander manuelt før de kontaktet forfatterne, og to arXiv-rettelser er nå underveis.

Hugging Faces egen konklusjon om menneskets rolle er nøktern. Agentene satte seg fast i løkker, misforsto skalaavhengig oppførsel og bygde av og til en hel falsifisering på en enhetsforveksling. De mest pålitelige resultatene kom der et menneske styrte: pekte agenten et nytt sted, utfordret en antakelse, eller avgjorde at premisset for et eksperiment var galt før en uke med regnekraft gikk med. Vinneren i menneske-i-løkken-kategorien vurderte selv alle 128 bildeparene i en artikkel som hevdet stabil bildegenerering under ekstrem kvantisering, fordi måletallene sa «ingen kollaps» mens spørsmålet om bildene var brukbare er perseptuelt.

«Jeg har gått gjennom parene og lagt csv-en i repoet, sjekk den gjerne» — deltaker, i den publiserte agentloggen

Bakgrunn

Volumet er det som har endret seg. ICML 2026 fikk 23 918 innsendinger og godtok 6 352, omtrent dobbelt så mange som året før, mens fagfellekapasiteten ikke er doblet. Fra 15. juli til 2. august 2026 slapp Hugging Face og alphaXiv løs deltakerne på konferansen med agentmiljøer som Claude Code, Codex og Cursor. Hver deltaker fikk 20 dollar i regnekreditter, og til sammen startet de 2 962 jobber i skyen. Å sjekke en artikkel grundig kostet før en fagfelle en helg; en agent forsøker det på en ettermiddag, tusenvis av ganger parallelt.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter