Kodeagenter gjorde forskningskode 60 ganger raskere, men bommet på vitenskapen
Viser at kodeagenter moderniserte forskningsprogramvare kraftig raskere, men ikke klarte å avgjøre om resultatene var vitenskapelig riktige.
«Veltalende, overbevisende og selvsikkert feil på måter som er lette å overse.» — Philip Ewels, leder for RustQC-prosjektet
Slik beskriver Ewels kodeagentene han jobbet med, i en feltrapport OpenAI har laget sammen med akademiske partnere. Rapporten dokumenterer åtte case-studier, de fleste innen biologi, der forskningsgrupper satte Codex og Claude Code til å vedlikeholde, optimalisere eller skrive om aldrende forskningsprogramvare.
Gevinstene er betydelige. RustQC slo sammen 15 separate kvalitetskontroll-verktøy til ett program og kuttet kjøretiden på et stort datasett fra 15 timer og 34 minutter til 14 minutter og 54 sekunder. I prosjektet rustar-aligner ble sekvenseringsverktøyet STAR, over 20 000 linjer C og C++ uten aktivt vedlikehold, bygget opp igjen fra bunnen i Rust. Mot 10 000 leste sekvenser fra gjærceller ga omskrivingen samme resultat som originalen i 99,815 prosent av tilfellene.
Feilene er den mest interessante delen av rapporten. I bayesm-prosjektet gikk Rust-omskrivingen 2 til 20 ganger raskere, men de første versjonene av to metoder inneholdt feil som var vanskelige å se på resultatet. Agenten inverterte en sentral styringsparameter, slik at programmet regnet med den resiproke verdien. Feilen ble først funnet etter en kalibreringstest mot tusenvis av syntetiske datasett med kjent fasit. En annen metode ga plausible resultater, men hadde en feilskalert korreksjonsfaktor.
Ewels lot aldri modellene bedømme sitt eget arbeid, og bygget en uavhengig testrigg i stedet. Rapportforfatterne understreker at funnene ikke kommer fra en representativ studie, og at flaskehalsen flytter seg fra koding til validering og faglig gjennomgang. Mønsteret er kjent utenfor forskningen: en METR-studie fant at faktiske vedlikeholdere ville avvist rundt halvparten av løsningene SWE-bench Verified regner som bestått.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.