Fable slår opp i 15 kilder, Astra i 5, når modellene anbefaler produkter
Regn med at hvilken modell leseren spør, avgjør hvilket produkt som blir anbefalt, for forskjellene mellom modellgenerasjoner er større enn forskjellene mellom produktene.
Anthropics nyeste modell slår opp i flere kilder enn forgjengeren, mens OpenAIs går motsatt vei. Latent Space har kjørt seks promptvarianter mot syv modeller med søk påslått i 161 kategorier, fra kodeagenter og KI-sandkasser til ASR-modeller og lønnssystemer, og målt medianen for antall kilder hver modell henter inn. Opus lå på 11 og Fable på 15. Sol lå på 9 og Astra på 5.
Metoden er en utvidelse av et opplegg fra AmplifyingAI. Svarene ble hentet ut med Astra og gitt en egen AEO-score som vekter førstevalg tyngst, men også teller alternative valg og rene omtaler, med negativ vekt for anbefalinger som advarer mot produktet. Latent Space oppgir at hvert enkelt prompt- og svarpar er tilgjengelig for inspeksjon.
Det mest anvendelige funnet handler om stabilitet, ikke om rangeringen i seg selv.
«Astra er langt mindre tilbøyelig til å ombestemme seg når du omformulerer spørsmålet litt.» Det gjør AEO mer verdt, skriver Latent Space, fordi tilfeldigheten i valgene synker.
Bare 28 av de 161 kategoriene har ett produkt som alle de undersøkte modellene setter først. Resten er tette løp. Latent Space finner samtidig en tydelig hjemmebane-effekt: Fable og Opus foretrekker Claude Code, Sol og Astra foretrekker Codex, Grok peker på Cursor og SWE-1.7 på Devin. Det finnes unntak, som GPT-modeller som anbefaler Claude.
For deg som bygger noe andre skal finne, er den konkrete delen at teknikkene Ora og Vercel har målt, blant dem content-negotiation som serverer markdown, faktisk virker: når det feiler, leser modellene mindre av innholdet ditt. Gemini, GLM og DeepSeek måtte utelates fra denne første kjøringen på grunn av feil og rate limits, så bildet dekker ikke alle modellene norske brukere faktisk spør.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.