GPT-6 Astra får 80 prosent riktig i Epoch AIs IKEA-test
Test GPT-6 Astra først når agenten din skal sammenligne foto mot en manual, for modellen fikk 80 prosent riktig i Epoch AIs nye IKEA-benchmark.
80 prosent riktig fikk OpenAIs GPT-6 Astra i Furniture Assembly Benchmark (FAB), en ny test fra Epoch AI publisert 23. september. I november 2025 lå toppscoren på 28 prosent, satt av Anthropics Claude Opus 4.5.
Testen består av 60 bilder fra monteringen av tre IKEA-møbler. Noen bilder viser et korrekt montert møbel. Andre har feil som Epoch-forskerne gjorde med vilje, og ofte bygde de videre etter feilen for å gjøre den vanskeligere å oppdage. Modellen får manualen som PDF, et zoomverktøy og en Python-tolk, og har 80 steg per bilde i en agent-sandkasse.
Et bilde uten feil teller som riktig hvis modellen melder at alt er i orden og viser videre til neste steg. Er det en feil, må modellen først peke ut riktig steg. Deretter må beskrivelsen av feilen godkjennes av en LLM-dommer, GPT-5.6 Sol, som er bedt om å være svært raus.
Astra er også raskest, med median tre minutter per bilde, to til ti ganger raskere enn tidligere toppmodeller. Epoch mener det fortsatt er litt for tregt til veiledning i sanntid, men ikke langt unna.
«Vi ser at Googles Gemini- og Alibabas Qwen-modeller nesten alltid antar at det finnes en feil» — Epoch AI
Tidlige modeller fra Anthropic og OpenAI bommet motsatt vei og overså for ofte feilene. Kinesiske åpne modeller henger etter: Kimi K3 fra Moonshot lå sju måneder bak fronten da den kom, mot 4,4 måneder på Epochs generelle kapabilitetsindeks (ECI). DeepSeek V4 Pro og Flash og Z.ai sin GLM 5.3 tar ikke imot bilder i det hele tatt.
Epoch påpeker selv at 60 bilder fra tre møbler er et lite utvalg, og at det er uklart hvor godt resultatene overføres til andre fysiske oppgaver. For deg som bygger agenter som skal kontrollere fysisk arbeid mot dokumentasjon, er retningen likevel tydelig: på ti måneder har toppscoren gått fra rundt to av sju riktige svar til fire av fem.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.