Thomson Reuters valgte å eie modellen, ikke leie den, for 40 millioner dollar
Bygget en egen juridisk språkmodell på Alibabas Qwen for rundt 40 millioner dollar, men den slår GPT-5.4 bare når den får bruke selskapets eget innhold.
Å leie en modell fra OpenAI eller Anthropic koster per kall og binder deg til leverandørens veikart. Å eie en koster to år og et team. Thomson Reuters valgte det siste, skriver The Decoder, og har lansert «Thomson», sin første egne språkmodell, bygget videre på Alibabas åpne Qwen. Tallet på 40 millioner dollar dekker folk og regnekraft over mer enn to år. Den mer siterte prislappen på 450 000 dollar dekker bare den siste treningskjøringen av gjeldende versjon.
Oppskriften er verdt å merke seg for alle som vurderer samme vei. Selskapet startet fra Qwen3.5-397B, retrenet den sammen med Imperial College for sikkerhet, etikk og politisk nøytralitet til en mellomversjon kalt «Snowdon», og kjørte deretter fortrening på eget innhold, ettertrening med egne fageksperter og agentisk forsterkningslæring inne i sine egne verktøymiljøer. Under 10 prosent av det tilgjengelige innholdet er brukt så langt.
Benchmarkene er mer nøkterne enn bloggposten. På Stanford LegalBench havner Thomson på 0,823 og ligger bak både Gemini 3.1 Pro og GPT-5.5, og på reasoning og særlig koding faller den tydelig av. Sammenligningen er dessuten skjev, siden Thomson konkurrerer med test-time scaling mens GPT-5.5 kjører uten resonneringsmodus.
Det mest lærerike tallet ligger i selskapets egen Deep Research-test. Med bare nettilgang treffer Thomson 0,53 på faktapresisjon mot GPT-5.4 sine 0,65. Først når den får tilgang til selskapets eget innhold, sniker den seg forbi med 0,83 mot 0,82. Men GPT-5.4 løfter seg omtrent like mye av det samme innholdet. Datatilgangen gjør altså nesten hele jobben som den spesialiserte treningen skulle gjøre.
«Å leie et hus kontra å kjøpe et hus» — Joel Hron, teknologidirektør i Thomson Reuters, om hvorfor selskapet bygger selv
Argumentet hans er at hver ekspertgjennomgang i en produktoppdatering blir treningsdata du eier, mens verdien fordamper hos leverandøren når du leier. Det holder når du har tre sjeldne ting samtidig: eksklusive datamengder, hundrevis av fageksperter på lønningslista og arbeidsflyter der kvalitet kan måles objektivt. En liten versjon kommer på Hugging Face med åpne vekter under en ikke-kommersiell lisens.
For deg som bygger, er lærdommen den omvendte av overskriften. Tallene i denne saken sier at det meste av gevinsten kom fra å gi modellen tilgang til eget innhold og egne verktøy, ikke fra å trene en egen modell. Har du verken egne data eller en måte å måle resultater på i skala, kjøper du hovedsakelig vedlikeholdskostnader.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.