Claude Fable 5 vinner fysikktest, rammeverket betyr mer
Måler fire frontier-modeller på forseglede fysikkoppgaver og finner at valget av agent-rammeverk flytter resultatet mer enn dobbelt så mye som valget av modell.
Hva skiller en modell som får fysikken riktig fra en som bare får koden til å kompilere? JuliaHub satte fire modeller gjennom 52 graderte kjøringer på fem forseglede oppgaver fra modellering og simulering, og graderingen ignorerte koden fullstendig: hver løsning ble simulert og målt mot en skjult referansebane. Poenget med oppgavene var at de alle tillater løsninger som kjører grønt mens fysikken de beskriver er umulig.
Alt annet enn modellen ble holdt fast. Samme agent-rammeverk, samme oppgaver, xhigh resonneringsnivå, 1 million tokens kontekstvindu og 128 000 tokens budsjett. Anthropics claude-fable-5 møtte OpenAIs GPT-5.6 i variantene terra, sol og luna.
Fable var den eneste som feide alle tolv kjøringene på de fire kjerneoppgavene, og den ledet også på den femte, som ingen modell løste. Den oppgaven ba om et komplett flyfartøy: NASAs HL-20 med seks frihetsgrader, aerodynamikk fra rundt 170 vindtunneltabeller og en styreflatemikser beskrevet i to tekniske NASA-notater. Fable brukte en tredjedel av kjøringen på å lese før den skrev en linje. Terra hoppet over notatene, gjettet seg til mikseren og leverte den billigste og dårligste flygningen. Luna kranglet med samme kompileringsfeil tjuetre ganger og løste den til slutt ved å nulle ut vertikalkraften på fartøyet.
Den mest interessante målingen er likevel den omvendte. JuliaHub låste modellen og byttet rammeverket i stedet: samme modell fikk 0,899 inne i deres eget Dyad-oppsett og 0,533 i en vanlig kodeagent med Claude Code, til nesten identisk pengebruk.
«Modellen er variabelen. Rammeverket er multiplikatoren.» — JuliaHub, i studien
Her er forbeholdet: JuliaHub selger Dyad. Selskapet argumenterer selv for at insentivene peker mot ærlighet, siden de leverer flere modell-leverandører i samme produkt, men konklusjonen deres er også at du bør velge verktøyet deres først. Tallene er selvrapporterte og oppgavesettet er internt og forseglet, så de kan ikke etterprøves utenfra.
Kritikken kom raskt i diskusjonen på Hacker News, der innlegget fikk 80 poeng.
«Det finnes ingen grunn til å tro at Fables xhigh er sammenlignbar med GPT-Sols xhigh.» — «xnorswap» på Hacker News
Innvendingen er at studien bare kjørte ett innsatsnivå per modell, når nivåene ikke er kalibrert mot hverandre på tvers av leverandører. Stefan Karpinski, medskaper av programmeringsspråket Julia, svarte i samme tråd at flere Anthropic-modeller også ble testet uten å komme med i artikkelen.
For deg som bygger agenter er det andre eksperimentet det som betyr noe. Verifisering som skjer fordi rammeverket tvinger den frem, slår verifisering modellen kanskje gjør på eget initiativ, og det gjelder like fullt når oppgaven er en database eller et API i stedet for et flyfartøy.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.