Claude leder 26 prosent av Anthropics KI-forskning, og det er Claude som har målt det
Les Anthropics nye tall som selvrapportering: Claude leder 26 prosent av selskapets egen KI-forskning, og det er en Claude-dommer som har satt karakteren.
26 prosent er andelen av Anthropics interne forsknings- og utviklingsarbeid der Claude «leder», altså fullfører det meste av oppgaven fra en overordnet instruks mens et menneske fører tilsyn. Over 90 prosent av arbeidet ligger på «samarbeider» eller høyere, og ingen målt del er fullt autonom. Tallene gjelder august 2026 og ble publisert av Anthropic sammen med to andre måleserier.
Skalaen er hentet fra Epoch AI og går fra AL0, ingen KI-involvering, til AL5, full autonomi. Indeksen er bygget nedenfra. For hver uke i juli 2026 trakk Anthropic et tilfeldig utvalg på 20 prosent av de ansatte i avdelingene som utgjør modellutviklingen, lot en Claude-agent lese Slack og intern dokumentasjon for å liste opp oppgavene deres, og endte med rundt 15 000 oppgaver organisert i et tre med 542 noder. Treet er frosset, slik at senere målinger gjelder nøyaktig samme kurv med arbeid.
Den andre serien gjelder tilsyn med agentene. Rundt 30 000 agenter jobbet samtidig med forskning og utvikling på Anthropics mest brukte interne plattform i august. Alle handlingene deres passerer en sanntidsmonitor før de utføres, og av over én milliard beslutninger i august ble 0,002 prosent blokkert, omtrent én av 47 000. En separat monitor som leser i etterkant flagger rundt 100 000 transkripsjoner i uka, hvorav omtrent 50 eskaleres til et menneske.
Den tredje serien er compute. I uka fra 13. til 20. juli gikk rundt 6 prosent av computen til KI-forskning og utvikling til sikkerhetsarbeid, og 12 prosent av den delen som var KI-drevet. Anthropic kaller estimatene bevisst konservative: arbeid som hjelper kapasitet like mye som sikkerhet ble talt som KI-forskning og utvikling, ikke som sikkerhetsarbeid.
«Vi bruker våre egne modeller til å evaluere systemene våre, noe som kan bety at dommermodellen gjør samme type feil som modellen den kontrollerer.» — Anthropic
Dommeren var eksakt enig med menneskelige vurderinger 59 prosent av gangene, mens mennesker var eksakt enige med hverandre bare 35 prosent. For deg som bygger agenter er det mest brukbare her metoden: en av labene har publisert hvordan den teller dekning, gjennomgangsforsinkelse og eskaleringsrate. Det er de samme tre målene du trenger for å vite om ditt eget tilsyn holder tritt med agentene du kjører.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.