Googles WikiSkill lar agenten skrive ned egne feil, og henter 18,6 prosentpoeng
Gir agenten en varig wiki over egne feil, og løfter Qwen-3.6-27B fra 39,4 til 63,3 prosent i snitt.
49,5 til 68,1 prosent for Gemini 3.5 Flash. 39,4 til 63,3 prosent for Qwen-3.6-27B. Det er snittløftet forskere ved Google Research måler for WikiSkill, et rammeverk som lar en agent bygge varig kunnskap om egne kjøringer i stedet for å kaste alt når oppgaven er over. The Decoder beskriver det som en omvei rundt et uløst problem: modellen lærer ikke kontinuerlig, men den skriver bedre instruksjoner til seg selv for hver runde og kan hente dem fram neste gang.
Arkitekturen holder tre ting fra hverandre:
- Et rålag som lagrer komplette kjøringsspor, fra verktøykall til resultat. Laget er uforanderlig og fungerer som råmateriale.
- Et wiki-lag der sporene destilleres til dokumenterte feilmønstre og strategier som virket. Dette laget nullstilles aldri og vokser for hver runde.
- Et ferdighetslag med de aktive instruksjonene agenten faktisk følger. I motsetning til wikien kan ferdigheter rulles tilbake hvis en endring gjør ting verre.
En «Wiki Maintainer» leser sporene, finner feilmønstre og skriver funnene inn i wikien. En «Skill Proposer» foreslår målrettede endringer, og en portvaktmekanisme tester forslaget på et eget valideringssett før det får bli stående. Faller ytelsen, rulles ferdigheten tilbake, men wikien beholder notatet om hva som ble prøvd og hvorfor det feilet.
Utslagene varierer kraftig med oppgavetype. LiveMath gikk fra 33,0 til 72,6 prosent for Gemini 3.5 Flash og SpreadSheet fra 50,5 til 76,6 prosent, mens OfficeQA, som har lange dokumentkontekster, knapt rørte seg. Forskerne peker på at Qwen-3.5-4B ikke klarer å gjennomføre flerstegs søkestrategier over lange kontekster og faller tilbake til standardatferden sin.
Ideen har en kjent opphavsmann. Artikkelen viser til Andrej Karpathys forslag om en «LLM Wiki», altså å samle erfaring i varig og kumulativ kunnskap. Det praktisk interessante er overføringen: ferdigheter utviklet av én modell virker ofte på en annen, og noen ganger bedre enn ferdighetene den mottakende modellen bygde selv. Det gjelder ikke alltid, så det må sjekkes fra sak til sak.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.