DogLM måler hundeklapping: 15 av 17 modeller får null uten hint
Fjern det ene hintet om ekstra spillmekanikker, og 15 av 17 KI-modeller lager null interaksjon mellom spilleren og hunden.
Med hint i oppgaveteksten klarer Gemini 3.7 Flash 8,0 av 10 poeng. Uten hintet faller den til 0,2. Det er hovedfunnet i DogLM, en benchmark Mike Ushakov kjørte i august 2026, der 17 språkmodeller får i oppgave å generere små nettleserspill med en hund i bakgrunnen, og blir målt på om spilleren kan klappe den.
Poengskalaen er enkel. To poeng hvis en bevisst handling rettet mot hunden gir en hjertelig respons, ett poeng hvis hunden bare reagerer på nærhet eller på en kommando, null poeng hvis hund og spiller aldri møtes. Hver modell kjørte fem runder med ti spill hver, og en Claude Sonnet 4.6-dommer leste HTML-koden i stedet for å spille spillene. Bare fire av 17 modeller kommer over 4 av 20 mulige poeng totalt.
Benchmarken kjører to varianter av hver oppgavetekst, én med et hint som ber modellen finne på et par ekstra mekanikker spilleren vil like, og én uten. Ushakov beskriver skillet i essayet «Machines of Spontaneous Warmth», som er lenket fra benchmark-siden. Nesten hele poengsummen ligger i hint-varianten: Claude Opus 5 går fra 0,0 uten hint til 5,2 med.
Hvorfor det betyr noe for deg som lar en modell one-shote en app: en modell som ikke fyller inn det åpenbart hyggelige, fyller heller ikke inn det åpenbart nødvendige. Kravspesifikasjonen må si det du tror er selvsagt.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.