Hemmingway-1: 27B-modell slår frontmodellene på hverdagsmeldinger
Slår en åpen 27B-modell frontmodellene på hverdagsmeldinger, men de tre sterkeste tallene kommer fra tester utviklerne har laget selv.
Altworld la Hemmingway-1 ut på Hugging Face 20. september, en Apache-2.0-lisensiert finjustering av Qwen3.8-27B med 262 144 tokens kontekst. Oppdraget er smalt: tekstmeldingen til utleieren, e-posten du har utsatt, den kleine beskjeden til en kollega. Modellkortet oppgir 80 ekte forespørsler kjørt som blinde dueller mot andre modeller, i begge rekkefølger slik at posisjonen ikke skulle telle.
Tallene Altworld trekker fram er store. På CommunicationBench slår modellen Fable 5.1 og ligger 50 poeng over GPT-6 Astra, med Kimi K3, GLM-5.3, Grok 4.6 og DeepSeek V4 Pro bak seg. På kategorien harde forespørsler får GPT-6 Astra 9 prosent mot Hemmingway-1s 72 prosent. Altworld målte også hvor ofte en modell begraver selve teksten i kommentarer og alternativer du må lese deg forbi: Fable 5, GLM-5.3 og Kimi K3 gjør det i mer enn ni av ti svar.
Forbeholdet står i modellkortet selv:
«CommunicationBench, Human-Likeness og StoryBench er våre egne benchmarks. Vi bygget dem, vi kjørte dem, og vi sier det på forhånd.» — Altworld, modellkortet for Hemmingway-1
Det ene tallet som kommer utenfra, er EQ-Bench 4. Den offentlige testen for emosjonell intelligens plasserer Hemmingway-1 på tredjeplass, foran GPT-5.5, Opus 4.7 og Opus 4.8, og innenfor 12 poeng av toppmodellen på listen. Modellen er engelskspråklig først, så norsk hverdagsskriving er ikke målt noe sted. På to døgn har modellkortet fått 323 likes og 834 nedlastinger.
Hva bør du gjøre?
- Kjør den lokalt med vllm serve Altworld/Hemmingway-1 og maks kontekstlengde 262144. Modellkortet oppgir også ferdige oppskrifter for SGLang, Transformers og Docker Model Runner.
- Test på norsk før du bytter ut noe. Altworld oppgir ingen tall for andre språk enn engelsk, og Qwen3.8-27B som bunn er ingen garanti alene.
- Kopier metoden, ikke bare modellen. Tjue av dine egne meldinger, to svar i tilfeldig rekkefølge og en dommer som ikke vet hvem som skrev hva, gir deg et tall som faktisk gjelder din bruk.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.