Claude «leder» 26 prosent av Anthropics modellarbeid, men ingen oppgaver når AL5
Les de 26 prosentene som AL4 og ikke som autonomi: Claude leder en firedel av Anthropics modellarbeid målt i arbeidstimer, men ingen oppgaver er scoret som fullt autonome.
Forskjellen mellom AL4 og AL5 er forskjellen mellom en kollega som analyserer, fikser og tester en feilrapport uten å spørre, og en som også får sende fiksen ut i produksjon. Anthropic oppgir i en ny post at 26 prosent av utviklingsarbeidet lå på AL4 i august 2026, opp fra under én prosent i februar, mens AL5 ikke nås noe sted, skriver The Decoder.
Skalaen er hentet fra Epoch AI og går fra AL0, ingen KI, til AL5, fullt autonom. Over 90 prosent av arbeidet når minst AL3. Karakterene satte Claude selv: agenter samlet bevis fra Slack og interne dokumenter, og en annen Claude-modell tildelte nivåene. Anthropic innrømmer at denne dommeren kan gjøre de samme feilene som systemet den vurderer.
Uenigheten er det mest interessante tallet. Da ansatte ble bedt om å vurdere hvor automatisert deres eget område er, landet to personer på samme nivå bare rundt en tredel av gangene. Menneske og modell lå maks ett nivå fra hverandre i 97 prosent av tilfellene, men ett nivå er nettopp spranget fra «samarbeider» til «leder». Om en oppgave havner innenfor de 26 prosentene er altså ofte en tolkning.
Tallet måler dessuten timer, ikke beslutninger. Anthropic listet opp hvordan de ansatte brukte arbeidstiden i juli og vektet hver aktivitet etter hvor mye tid den spiser. At Claude leder en firedel av arbeidet sier derfor ingenting om hvor mange valg modellen tar, eller om den påvirker forskningsretningen.
For deg som bygger er metoden mer nyttig enn prosenten: Anthropic publiserer en skala du kan måle dine egne agentoppsett mot, og sier rett ut at grensen mellom nivåene er skjønn.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.