PantheonGPU stresstester GPU-en, men KI-lastene er syntetiske
Test GPU-en med Pantheon 1.0.14, men vit at de ni KI-arbeidslastene er syntetiske proxyer, ikke ekte inferenskjerner.
Ni arbeidslaster i Pantheon 1.0.14 bærer navn hentet rett fra inferensstacken: llm_decode, llm_prefill, kv_cache_churn, fused_attention, rope_stress, quantized_gemm, serving_mix, speculative_decode og moe_router. På dokumentasjonens side for KI-arbeidslaster står det «proxy» eller «synthetic» ved hver eneste av dem, og presiseringene er uvanlig ærlige for et verktøy som selger seg på KI.
«Attention-style compute and memory proxy. It is not a fused-attention kernel.» - Pantheon-dokumentasjonen, pantheongpu.com/ai-workloads
Samme side slår fast at speculative_decode verken kjører utkastsmodell eller målmodell, at moe_router hopper over all-to-all-kommunikasjonen mellom eksperter, og at serving_mix ikke modellerer en produksjonsskeduler eller kø. Unntaket er graph_replay, som faktisk fanger, instansierer og spiller av ekte CUDA- eller HIP-grafer.
Pantheon er en stress- og diagnostikkpakke for CUDA og ROCm som måler compute, minne, cache, interconnect og strømoppførsel. Versjon 1.0.14 kom 15. august 2026 og legges ut som ferdigbygde binærpakker: 33,5 MB Debian-pakke og 67,1 MB portabel tarball for RHEL-familien. Verktøyet oppdager selv om maskinen kjører CUDA, ROCm/HIP eller mock-modus. Du styrer hvor hardt det tar med --mem, som setter hvor stor andel av ledig VRAM det syntetiske arbeidssettet skal bruke, og --verify kjører de korrekthetssjekkene som er implementert for hver last.
Ett forbehold før du stoler på tallene: kildekoden er ikke publisert. GitHub-repoet saqibkh/pantheongpu_website inneholder bare dokumentasjonssiden under MIT-lisens, mens endringsloggen peker til saqibkh/pantheongpu, som svarer 404 mot GitHubs API. Du installerer altså en 33,5 MB binærpakke du ikke kan lese. Prosjektet ble lagt ut som Show HN 18. august og hadde 13 poeng og ingen kommentarer da denne saken ble skrevet.
Benchmark-databasen på nettstedet har samme type forbehold. Resultatene er samlet inn fra tredjeparts sky- og fellesskapssystemer, blant annet Vast.ai og RunPod. Metodikk-siden er ærlig også her: et resultat gjelder én arbeidslast under sammenlignbare forhold, ikke som én universell GPU-score. Pantheon leser av tilgjengelige RAS- og PCIe-feiltellere før og etter hver kjøring, men driverstøtten varierer med leverandør, kort, operativsystem og rettigheter, og en teller som ikke støttes betyr ikke at feiltallet er null.
«They are not collected, certified, or endorsed by NVIDIA, AMD, or their employees.» - Pantheon-dokumentasjonen, pantheongpu.com/benchmarks
Hva bør du gjøre?
- Bruk Pantheon til det dokumentasjonen faktisk lover: isolere maskinvare- og runtime-oppførsel, fange telemetri og finne regresjoner mellom drivere.
- Mål ekte inferens med ekte stack. Time to first token, inter-token-latens og gjennomstrømning hører hjemme i vLLM, llama.cpp eller Ollama, ikke i en syntetisk proxy.
- Start på --mem 25 hvis kortet har annet arbeid gående, og hold Pantheon-versjon, varighet, driver og strøminnstillinger låst mellom kjøringer. Ellers sammenligner du ikke like tall.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.