Hopp til hovedinnhold
Tilbake

ServiceNows AutoSynthData gjør agentens feil til treningsdata og løfter Gemma 4 med 35 prosent

KI Takeaway KI-generert · kan inneholde feil

Bruk modellens egne feil til å styre syntetiske treningsdata, slik ServiceNows AutoSynthData gjorde da den løftet Gemma 4 med 7,2 prosentpoeng på bedriftsoppgaver.

Før finjusteringen løste Gemma-4-26B-A4B i snitt 18,77 prosent av oppgavene i ITSM-delen av benchmarken EnterpriseOps-Gym. Etter én runde med syntetiske treningsdata fra AutoSynthData var tallet 27,18 prosent. ServiceNow CoreAI beskriver pipelinen i et blogginnlegg på Hugging Face 2. oktober. I benchmarkens Hybrid-domene ga samme metode 7,2 prosentpoeng bedre Pass@1, en relativ forbedring på 35 prosent, og lukket 59 prosent av avstanden opp til referansemodellen.

Utgangspunktet er at en modell kan være generelt dyktig og likevel feile på én bestemt arbeidsflyt eller verktøykombinasjon. AutoSynthData kjører derfor både målmodellen og en sterkere lærermodell på evalueringsoppgaver og ser etter mønsteret der eleven feiler og læreren lykkes. Funnene destilleres til rensede kapabilitetskort. Generatoren får bare kortene, ikke de opprinnelige promptene, entitetene, løsningene eller verifikatorene, og lager nye oppgaver med andre tilstander og løsningsveier.

Hver oppgave består av en systemspesifikasjon, en brukerprompt og en verifikator, og det er verifikatoren ServiceNow bruker mest plass på.

«En slapp verifikator kan belønne feil oppførsel, mens en for streng verifikator kan straffe gyldige løsninger.» — ServiceNow CoreAI, i blogginnlegget om AutoSynthData

Pipelinen beholder bare oppgaver der målmodellen løser høyst én av tre forsøk og læreren minst to av tre. Referanseløsningen kjøres i miljøet og må bestå verifikatoren. Deretter muteres den forventede sluttilstanden, og verifikatoren må avvise de feile variantene. Kandidater som stryker, går til en kritiker som foreslår en målrettet reparasjon, med et fast tak på antall forsøk. I en egen fase lages varianter av godkjente oppgaver, men en variant kan aldri bli utgangspunkt for en ny variant, slik at datasettet ikke driver bort fra de kontrollerte oppgavene.

Tidsbruken er overkommelig. I Hybrid-kjøringen med Qwen3.8-27B som lærer tok det rundt 18 timer å lage 2 000 eksempler, og beste sjekkpunkt kom etter fem epoker. ITSM-kjøringen med DeepSeek-V4.1-Flash som lærer tok 66 timer for 1 994 eksempler, før ServiceNow optimaliserte gjennomstrømningen.

Bakgrunn

EnterpriseOps-Gym er en benchmark fra mars med 164 databasetabeller, 512 verktøy og 1 150 oppgaver fordelt på åtte fagområder som kundeservice, HR og IT. Den beste modellen i artikkelen, Claude Opus 4.5, klarte bare 37,4 prosent. Forfatterne skriver at funnene viser at dagens agenter «ennå ikke er klare for autonom utrulling i bedrifter». Kapabilitetskortene er likevel destillert fra benchmarkens egne evalueringsoppgaver, og ServiceNow skriver selv at resultatet gjelder miljøet eksperimentet ble kjørt i. Blogginnlegget lenker ikke til kode, og eksperimentene dekker bare supervised finjustering, mens forsterkende læring er neste steg.

Oppskriften er likevel overførbar for deg som finjusterer en liten modell til egne agentoppgaver: behold bare oppgavene der læreren lykkes og eleven feiler, og test hver verifikator med både riktig og bevisst feil sluttilstand.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter