Hopp til hovedinnhold
Tilbake
Forskning 2 min · Kilde: PrimeIntellect

PrimeIntellect samler 365 000 agent-oppgaver bak ett API

KI Takeaway KI-generert · kan inneholde feil

Samler 23 åpne datasett for agent-trening til rundt 365 000 oppgaver bak ett felles API, med validert scoring og skjult fasit.

Det finnes allerede gode åpne datasett for de tre store agent-domenene: programvareutvikling, terminalbruk og nettsøk. Problemet er at hvert enkelt av dem kommer med sin egen kjøreramme, sine egne bildekonvensjoner, sine egne scoringsskript og sine egne feilmoduser. Skal du trene én agent på tvers av dem, bruker du mer tid på rørlegging enn på trening.

PrimeIntellect har integrert 23 slike datasett bak ett felles API: rundt 198 000 oppgaver innen programvareutvikling på 20 pluss språk, rundt 28 600 terminaloppgaver og rundt 137 600 søkeoppgaver. Hvert datasett beholder sin opprinnelige scoringslogikk, mens alt rundt normaliseres. Rundt 135 000 ferdigbygde oppgavebilder ligger i deres eget register, samlokalisert med sandkassene, noe som fjerner ratebegrensningen fra Docker Hub når tusen kjøringer starter samtidig.

Den mest lærerike detaljen handler om juks. Under en kjøring lever agenten i samme sandkasse som karaktersettingen, og alt som er lesbart i containeren er i praksis fritt vilt for en modell som optimaliserer mot belønning. R2E-Gym legger testene sine lesbart under /r2e_tests, og Multi-SWE har scoringsskriptene og test.patch liggende under /home.

«Hver integrasjon holder derfor tilbake karaktersettingsmateriale inntil scoringstidspunktet.» — PrimeIntellect, om integritetsstandarden i oppsettet

Valideringen er verdt å merke seg for alle som bruker åpne agent-datasett. PrimeIntellect kjørte fasitfiksen gjennom hele scoringsløypa i friske sandkasser, med opptil ti forsøk for å skille flakete fra ødelagte rader, og flere kjøringer uten endringer for å luke ut oppgaver som får full score uten at noe fikses. I R2E-Gym besto 4 522 av 4 578 rader.

For deg som bygger og evaluerer egne agenter er poenget mindre at oppgavene er mange, og mer at en overraskende stor andel av åpne agent-datasett ikke gir et rent belønningssignal før noen har gått dem etter i sømmene.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter