Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: CTGT

GPT-OSS arver ikke den politiske sensuren fra DeepSeek-læreren

KI Takeaway KI-generert · kan inneholde feil

Fant KI-selskapet CTGT ingen målbar overføring av kinesisk politisk sensur da de destillerte GPT-OSS-120B på DeepSeek V4 Flash.

Amerikanske CTGT trente den åpne modellen GPT-OSS-120B på svar fra DeepSeek V4 Flash for å styrke finansresonnering, og publiserte samtidig måleapparatet LineageEval: 304 prompter fordelt på 152 matchede par, kontrollene, dommerrubrikken, evalueringskoden og vektene.

Konstruksjonen er poenget. Hvert Kina-sensitivt spørsmål har en strukturelt identisk tvilling om et annet land: Tiananmen mot Gwangju, Xinjiang-arbeidsoverføringene mot usbekisk bomull, Henan-bankfrysen mot Kypros-bail-inen. Fire dommermodeller fra fire ulike amerikanske laber, xAI Grok 4.20, Google Gemini 3.5 Flash, OpenAI GPT-5 Mini og Anthropic Claude Sonnet 4.6, scoret hvert svar fra 0 til 100 for sensur. Læreren ble servert fra egne vekter via vLLM i stedet for et kommersielt API, slik at leverandørens moderasjonslag ikke forurenset målingen.

Nøkkeltall
+45,45
lærerens sensurgap på de 76 kjernepolitiske parene
+32,02
samme gap slått sammen over alle 152 par
+3,94
største gap blant de tre destillerte 120B-modellene

Sidefunnet er trolig mer nyttig for deg som bygger. En arm der modellen ble hintet om sine egne feilsteg og trent på sine egne korrigerte fortsettelser, uten noen ekstern lærer, matchet DeepSeek-armen på hver eneste seed. Ved et genereringsbudsjett på 8 000 tokens scorer den selvlærte 120B-modellen 83,61 prosent på FinanceReasoning, over Kimi K3 på 81,93 og Inkling på 65,13, til 0,00026 dollar per spørring mot henholdsvis 0,041 og 0,016. Den kjører på ett H100- eller A100-kort, og 20B-varianten ligger ute med åpne vekter på Hugging Face i 42 GB.

Les funnet snevert. CTGT selger modellen de måler, treningsdataene inneholdt null Kina-sensitivt innhold, og lærer og elev delte ingen initialisering. Selskapet skriver selv at det ikke testet sikkerhetstrening eller refusal-oppførsel, og at den mest sannsynlige overføringsveien, en kinesisk lærer inn i en kinesisk-avstammet base som Qwen, står igjen som neste eksperiment.

Hva bør du gjøre?

  1. Kjør LineageEval mot din egen destillerte modell før du antar at lærerens skjevheter ble igjen hos læreren. Promptene, kontrollene og scoringskoden ligger åpent.
  2. Test selvdestillering før du henter inn en frontier-lærer på et avgrenset domene. Modellens egne korrigerte spor holdt her samme nivå, med 12,5 prosent færre output-tokens og uten tredjeparts vekter i treningssignalet.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter