Hopp til hovedinnhold
Tilbake
Qwen 2 min · Kilde: Red Hat Developer

P-EAGLE i Speculators 0.6.0 trener en draftmodell for Qwen3-8B på 50 minutter

KI Takeaway KI-generert · kan inneholde feil

Trener en P-EAGLE-draftmodell for Qwen3-8B på rundt 50 minutter på fire H100-kort, og får i snitt 3,04 godtatte tokens per steg.

74,9 prosent av de første spekulerte tokenene blir godtatt av verifikatoren, og i snitt slipper 3,044 tokens gjennom per runde. Tallene er Red Hats egne målinger for den ferdigtrente P-EAGLE-draftmodellen de publiserer sammen med Speculators 0.6.0, målt over ni datasett fra koding til oversettelse.

P-EAGLE er utviklet av Amazon og bygger direkte videre på EAGLE-3. Forskjellen ligger i hvordan utkastet lages: der EAGLE-3 gjetter ett token, mater det tilbake og gjetter neste, forutsier P-EAGLE de neste K tokenene samtidig i én forward pass. Verifikatoren sjekker alle i samme runde og godtar det korrekte prefikset. Utdataene er bit for bit de samme som modellen ville gitt alene, så gevinsten er ren latens, ikke en kvalitetsavveining.

Tre grep gjør flerdybdetreningen praktisk. COD-sampling kutter antall posisjoner geometrisk nedover i dybdene: dybde 0 beholder alt, dybde 1 beholder 0,7, dybde 2 beholder 0,49, med et gulv på 0,2 slik at de dypeste nivåene ikke sulter. I tillegg lærer modellen en egen maskeparameter for posisjoner der tokenet ennå ikke finnes, og en flex-attention-maske sørger for at hver rollout bare ser sin egen kjede og den kausale basiskonteksten.

Gevinsten varierer kraftig med arbeidslasten, og det er den viktigste tabellen i hele artikkelen for deg som skal regne hjem investeringen.

Nøkkeltall
3,82
Godtatte tokens per steg på matematisk resonnering, den beste kategorien
3,50
Snittet på HumanEval-koding
2,48
Snittet på oppsummering, der spekulasjon lønner seg minst

Hva bør du gjøre?

  1. Kjør pipelinen på din egen modell før du stoler på tallene: dataprep tar rundt 30 sekunder, uttrekk av skjulte tilstander går via vLLM, og treningen tok rundt 50 minutter på fire H100-kort med 5 000 eksempler.
  2. Mål aksepteringsraten mot din faktiske trafikkmiks. Sitter du på oppsummeringslast, får du under to tredjedeler av gevinsten en resonneringstjeneste ser.
  3. Hopp over treningen hvis modellen din allerede er dekket av Red Hats ferdige speculator-samling på Hugging Face. Hvert sjekkpunkt kan serveres rett i vLLM, som slår på spekulativ dekoding av seg selv.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter