Agentene klarte ingeniørarbeidet, men fikk begge forskningsartiklene refusert
Les løftene om selvforbedrende KI med forbehold: agentene besto ingeniørdelen, men bommet på selve forskningen.
«På den andre siden var agentene utvetydig dårlige til å utføre selve forskningen.» — Sayash Kapoor, forsker ved Princeton University
Kapoor ledet studien sammen med Peter Kirgis, og MIT Technology Review omtalte den 18. august. Metoden forskerne kaller «shadow evaluation» går ut på å la en agent svare på forskningsspørsmålet fra en upublisert artikkel av høy kvalitet. Fordi artiklene ikke var offentlige, kunne verken treningsdata eller nettsøk gi agenten fasiten.
Oppsettet var Anthropics Claude Opus 4.8 kjørt på den åpne programvaren OpenClaw, med spørsmål hentet fra to artikler sendt inn til NeurIPS 2026. Agentene fikk seks dager, 3 000 dollar i API-kreditt hos Anthropic, et GPU-budsjett, egne virtuelle maskiner og tilgang til åpent nett. Artiklenes opprinnelige forfattere vurderte resultatet slik de ville vurdert en vanlig konferanseinnsending, og refuserte begge.
Ingeniørdelen gikk fint. Agentene leste litteraturen, kjørte hundrevis av eksperimenter og satte sammen resultatene. Det som sviktet var dømmekraften: de testet hypoteser på bittesmå syntetiske datasett, låste seg til lite lovende retninger for tidlig, og klarte ikke å gå tilbake og tenke nytt fra bunnen. Da subagenter eller eksterne vurderingsverktøy ga tilbakemelding, svarte agentene med å snevre inn påstandene og legge til forbehold i stedet for å endre metode. De klarte heller ikke å fordele tokens, regnekraft og tid, eller å følge instruksjoner om artikkellengde og hvor lenge hver fase skulle vare.
Ett funn peker motsatt vei av det mange frykter: ingen reward hacking. Subagentene hallusinerte og feilframstilte resultater av og til, men orkestratoragenten fanget det opp.
Studien dekker bare to artikler, og forfatterne som vurderte dem visste at arbeidet var KI-generert. Anthropic-medgrunnlegger Jack Clark skrev likevel i nyhetsbrevet Import AI at fraværet av intuitiv kreativitet er et pessimistisk signal for korte tidslinjer mot rekursiv selvforbedring, og at det rimer med det Anthropic selv fant da de forsøkte å automatisere deler av sikkerhetsforskningen sin.
Bygger du agentsystemer, er tilbakemeldingssløyfen den praktiske lærdommen: en agent som svarer på kritikk med flere forbehold i stedet for ny metode, blir ikke bedre av mer regnekraft.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.