Hopp til hovedinnhold
Tilbake
Forskning 2 min · Kilde: MarkTechPost

Perplexity slipper WANDR: åpen benchmark som måler research-agenter på bredde og dybde

KI Takeaway KI-generert · kan inneholde feil

Måler research-agenter på både bredde og dybde med 500 oppgaver der hver påstand valideres mot siterte kilder.

500 oppgaver og 170 495 kildeforankrede poster: det er skalaen i WANDR (Wide ANd Deep Research), den åpne benchmarken Perplexity slapp 14. juli. Der de fleste agent-benchmarker tester ett enkelt svar, måler WANDR om en agent kan bygge en stor samling der hvert punkt er dokumentert med bevis. Median-oppgaven ber om 50 medlemmer og 245 poster.

WANDR er søsteren til Perplexitys DRACO-benchmark. DRACO spør om en agent produserer en nøyaktig, komplett langform-rapport; WANDR spør om den klarer å oppdage et bredt sett kvalifiserende entiteter og undersøke hver enkelt grundig nok til å belegge påstanden. Oppgavene er bygget som et hierarki av kvalifikasjonsnøkler: en oppgave kan be om «company(70), company_appointee(1), url(1)», altså 70 selskaper med hver sin dokumenterte utnevnelse og kildeside.

Strengheten ligger i scoringen. Karaktersettingen henter hver kildeside på nytt under evalueringen, sjekker at siden er brukbar og relevant, og verifiserer at de siterte utdragene faktisk finnes og støtter kravet. En polert fortelling bygget på ufullstendig research faller igjennom. Oppgavene kommer fra av-identifiserte mønstre i faktisk bruk, ikke syntetiske prompt, fordelt jevnt på 167 lette, 166 middels og 167 vanskelige.

For deg som bygger research-agenter er dette et konkret måleverktøy: et åpent evalueringsoppsett du kan kjøre agenten din mot for å se om den holder når oppgaven krever både bredde og etterprøvbar dokumentasjon.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter