Dobbeltblind Gemini-test: evaluator ser ikke vektene, Google ikke spørsmålene
Låser testspørsmålene inne i et kryptografisk rom: Google DeepMind har kjørt den første dobbeltblinde evalueringen av en lukket frontier-modell.
Fram til nå har eksterne evalueringer av lukkede KI-modeller krevd at én av partene ga fra seg noe. Enten leverte evaluatoren testoppgavene sine til modelleverandøren, som dermed kunne se spørsmålene på forhånd, eller så leverte leverandøren fra seg modellvektene og risikerte sin egen immaterielle eiendom. Google DeepMind skriver at de nå har kjørt en evaluering der ingen av delene skjer.
Oppsettet bruker Confidential Space fra Google Clouds portefølje for konfidensiell databehandling. Der verifiseres det kryptografisk at både de eksterne testdataene og modellen forblir private for hver sin eier. Pilotmodellen er en modell fra Gemini Flash Lite-familien, testet mot konfidensielle benchmarks, og partnerne er Singapore AI Safety Institute, OpenMined, AVERI og MLCommons.
«Dobbeltblinde evalueringer fjerner dette kompromisset. Evaluatoren kan ikke se Gemini-modellens vekter, og Google kan ikke se evaluatorens testoppgaver.» — Google DeepMind
Problemet det løser heter benchmark-kontaminering. Har modellen sett testspørsmålene under trening, kan resultatene bare stoles på til en viss grad. DeepMind bruker bildet av en eksamenskandidat som har snublet over oppgavene på forhånd: en perfekt score måler da ikke lenger hva kandidaten faktisk kan. Fram til nå har bransjen holdt eksterne testoppgaver konfidensielle med nullogging-protokoller og kontraktsfestede garantier, altså med tillit og jus. Nå legges det kryptografi på toppen.
Dilemmaet er ikke teoretisk.
«Et ferskt eksempel på dette dilemmaet var den forsinkede evalueringen for ARC-AGI-benchmarken av Anthropics Fable 5, siden KI-selskapet håndhever 30 dagers datalagring for sine sterkeste modeller.» — The Decoder
DeepMind peker selv på hvor dette betyr mest: evalueringer med høy følsomhet, som cybersikkerhet eller tester kjørt av offentlige organer. Uavhengige organisasjoner kan da granske avanserte modeller grundig uten å gi fra seg datasuverenitet eller sikkerhet. Metodikk og funn ligger i en teknisk rapport fra selskapet.
Piloten har også klare grenser. Én modell fra Gemini Flash Lite-familien er ikke Googles sterkeste modell, og resultatene som kom ut av kjøringen er ikke poenget her. Selve maskineriet er det, og det bygger på Googles egen skyinfrastruktur, som betyr at evaluatoren fortsatt må stole på at Confidential Space gjør det den sier den gjør.
For deg som velger modell på grunnlag av benchmark-tall, er poenget likevel enkelt nok: en score fra en dobbeltblind kjøring er verdt mer enn den samme scoren fra en kjøring der leverandøren kunne ha sett oppgavene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.