Ai2 åpner AstaBrief 8B, som skriver kildebelagte forskningsrapporter 3,5 ganger raskere
Kjør AstaBrief 8B på egen maskinvare hvis du vil lage kildebelagte litteraturrapporter uten å sende upublisert forskning til et proprietært API.
51,1 sekunder per rapport, mot 178,5 sekunder for den Claude-drevne Thinking-modusen. Det er gevinsten Allen Institute for AI (Ai2) oppgir for AstaBrief 8B, modellen som nå driver Fast-modusen i forskningsplattformen Asta, og som Ai2 har lagt ut med åpne vekter og treningsdata på Hugging Face. Modellen tar et forskningsspørsmål og utdrag fra hentet litteratur, og skriver hele rapporten med kildehenvisninger i ett pass i stedet for seksjon for seksjon.
AstaBrief bygger på Qwen3-8B og er lisensiert under Apache 2.0, ifølge modellkortet. Ai2 valgte bort forsterkningslæring og nøyde seg med supervised fine-tuning (SFT) og direct preference optimization (DPO), som er billigere og lettere å feilsøke. SFT-dataene kom fra 90 000 filtrerte spørsmål fra ekte Asta-brukere, som ga 47 000 brukbare eksempler generert med blant andre Claude 3.7 Sonnet, o3 og GPT-4.1. DPO-settet endte på rundt 6 000 par, der GPT-4.1 og DeepSeek-R1 begge måtte peke ut samme vinner.
«En relativt enkel indikator, om de syntetiske rapportene konsekvent siterte påstandene sine, var mer nyttig enn flere mer kompliserte kombinasjoner vi prøvde.» — Ai2, i bloggposten om AstaBrief
Det er den mest overførbare lærdommen. Av fire statistiske filtre ga det å kaste rapporter med lav siteringstetthet størst gevinst, mens hardere filtrering og kombinasjoner av filtre ikke ga noe ekstra.
Modellkortet viser hva DPO-steget ga. På testsettet i ScholarQA-CS2 går snittet fra 77,3 for Qwen3-8B til 83,7 etter SFT og 87,0 etter DPO, og citation recall fra 64,6 til 78,2. På DeepScholarBench havner AstaBrief derimot bak både Asta ScholarQA og DR Tulu, med 53,50 mot 60,25 og 56,26.
Ai2 er selv tydelig på begrensningene. Mesteparten av trening og evaluering ble gjort i 2025, og Ai2 har ikke kjørt evalueringen på nytt mot dagens frontmodeller. I en menneskelig test med 14 spørsmål og tre forskere vant DR Tulu på helhetsinntrykk, mens to av tre foretrakk AstaBrief på siteringspresisjon. Av 374 Asta-brukere som har prøvd Fast-modusen, har 23 prosent holdt seg der uten å bytte tilbake.
«Bruk av et annet promptformat eller samhandlingsformat kan føre til dårligere eller ustabil oppførsel.» — modellkortet til AstaBrief 8B på Hugging Face
Hva bør du gjøre?
- Last ned allenai/AstaBrief_8B fra Hugging Face og bruk prompten Ai2 trente med, slik modellkortet anbefaler.
- Start fra eksempel-arbeidsflyten Ai2 slipper sammen med vektene, som lager rapporter fra dine egne PDF-er.
- Test siteringstetthet som første filter hvis du lager syntetiske treningsdata til en egen RAG-modell.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.