AllSpark slipper Iris, åpne søkeagenter som leder BrowseComp i sin klasse
Leverer to åpne søkeagenter bygget på Qwen, der den minste bruker 3 milliarder aktive parametere og likevel leder BrowseComp i sin klasse.
Det kinesiske forskningsmiljøet AllSpark har sluppet Iris-mini og Iris-pro, to søkeagenter med åpne vekter som researcher på nettet på egen hånd, ifølge The Decoder. Iris-mini bygger på Qwen3.6-35B-A3B og har 35 milliarder parametere, hvorav 3 milliarder er aktive per token. Iris-pro bygger på Qwen3.5-397B-A17B med 397 milliarder totalt. Begge har et kontekstvindu på 256 000 tokens, og vektene ligger på Hugging Face sammen med koden på GitHub.
Med kontekststyring slått på får Iris-mini 82,2 på BrowseComp, 84,8 på den kinesiske varianten BrowseComp-ZH, 86,9 på DeepSearchQA og 52,3 på Humanity's Last Exam. Iris-pro når 88,6, 85,1, 92,9 og 56,4. I 35B-klassen slår Iris-mini nærmeste konkurrent XYZ-Aquila-mini med 3,4 poeng på BrowseComp, men havner bak på DeepSearchQA.
For deg som bygger egne agenter er metodevalget mer interessant enn plasseringen. Teamet mener kontekststyring under kjøring ofte betyr mer enn forskjellene som rapporteres mellom systemer, og tester derfor hver benchmark både med og uten, med samme verktøy, kontekstgrense og dommermodell. Lange søkeøkter fyller kontekstvinduet før alle delspørsmål er løst, og triks som å kaste samtalehistorikken løfter skåren uten å si mye om modellen. For Iris-mini gir kontekststyring opptil 21,2 poeng mer på BrowseComp. Grunnen er ikke et mindre tokenbudsjett, men at den lille modellen trenger flere steg og treffer taket oftere. Alle Iris-tallene kommer fra én enkelt agent uten hjelpeagenter eller ekstra verifisering til slutt.
Treningsspørsmålene bygges baklengs fra lenkestrukturen på nettsider. Alle begreper utenom svaret byttes ut med omskrivinger, slik at ingen ledetråd kan løses med et enkelt tekstsøk, og bare spørsmål en referansemodell ikke klarer uten verktøy, men klarer med riktige kilder, blir med. Deretter veksler teamet mellom supervised fine-tuning og forsterkende læring mot ekte nettsøk, en prosess forfatterne kaller «SFT-RL climbing».
To funn skiller seg ut. Treningen ga også bedre resultater på generell verktøybruk og kontorarbeid, oppgaver modellene aldri ble trent på. Og i vedlegget viser teamet et spørsmål om «Game of Thrones» der agenten ble vurdert som feil for å svare «Bolton», selv om Sansa Stark faktisk gifter seg med Ramsay Bolton i sitt andre ekteskap. Det var fasiten som tok feil.
Utgivelsen inneholder foreløpig agentløkken, verktøyene, strategiene for kontekststyring og alle fire benchmarkene med vurdering, og koden kjører mot et hvilket som helst OpenAI-kompatibelt endepunkt. Pipelinene for datakonstruksjon og trening kommer senere.
Hva bør du gjøre?
- Kjør evalueringskoden fra GitHub-repoet mot din egen OpenAI-kompatible modellserver, én gang med og én gang uten kontekststyring, før du stoler på noen søkeagents benchmark-tall.
- Prøv Iris-mini hvis du har GPU-kapasitet til en 35B-modell, siden bare 3 milliarder parametere er aktive per token, men alle 35 milliarder fortsatt må ligge i minnet.
- Gi din egen agent et nytt forsøk med et kort notat om hva som allerede er sjekket og utelukket, trikset som ga Iris de beste skårene på Humanity's Last Exam.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.