OpenArch legger Llama, DeepSeek og GPT-OSS side om side i ren PyTorch
Bruk OpenArch til å lese hvordan Llama, DeepSeek R1 og GPT-OSS er bygget opp i ren PyTorch, men ikke til å kjøre vektene i produksjon.
Offisiell modellkode er skrevet for fart, sharding og bakoverkompatibilitet, og derfor tung å lese. OpenArch, et GitHub-repo fra utvikleren anuj0456, snur prioriteringen: hver arkitektur fra Sebastian Raschkas LLM Architecture Gallery skrives for hånd i PyTorch, med de strukturelle valgene gjort eksplisitte.
Forskjellene ligger i detaljene. Llama 3 8B bruker grouped query attention uten mixture of experts, DeepSeek R1 671B bruker multihead latent attention med MoE, og Gemma 3 27B kombinerer grouped query attention med glidende vindu. README-en samler slike valg for attention, normalisering, posisjonskoding og MoE i én tabell, slik at du kan sammenligne to modeller direkte.
«Målet er ikke å konkurrere med transformers eller andre produksjonsbiblioteker. Målet er klarhet og læring.» — README-en til OpenArch
Blant modellene som er markert som brukbare for forward pass, finner du GPT-2 XL, Llama 4 Maverick, Kimi K2, GLM 4.5, GPT-OSS 20B og den multimodale PaliGemma. Grok-2.5 og multimodale Qwen3 er fortsatt under arbeid, og det langsiktige målet er alle 72 arkitekturene i galleriet.
Du bør kjenne to forbehold. Implementasjonene bygger på artikler, tekniske rapporter og config.json-filer, men repoet har ingen test som laster de offisielle vektene og sammenligner output. Den står på listen over bidrag forfatteren ønsker seg. I tillegg oppgir README-en Apache 2.0, mens LICENSE-filen i repoet er MIT.
Hva bør du gjøre?
- Les Llama 3- og DeepSeek R1-implementasjonene etter hverandre for å se hvordan multihead latent attention skiller seg fra grouped query attention i kode.
- Avklar lisensen, for eksempel i en issue, før du kopierer kode inn i et eget prosjekt, siden README og LICENSE-fil ikke er enige.
- Bruk transformers eller de offisielle implementasjonene når du skal kjøre ekte vekter, slik README-en selv anbefaler.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.