Hopp til hovedinnhold
Tilbake
Modell 2 min · Kilde: Hugging Face / inclusionAI

LLaDA2.2-flash genererer 519 tokens i sekundet, men taper på SWE-bench

KI Takeaway KI-generert · kan inneholde feil

Bytter nøyaktighet på SWE-bench mot nesten dobbelt så høy tokenhastighet, og lar diffusjonsdekoderen slette og sette inn tokens midt i genereringen.

519 tokens i sekundet mot 303 for søstermodellen. Det er tallet Ant Open Source fører opp i modellkortet til LLaDA2.2-flash, en agent-rettet diffusjonsmodell på 100 milliarder parametere. Vektene har ligget åpent på Hugging Face siden 16. juli, mens selve annonseringen kom på X 24. juli.

Vanlige språkmodeller skriver ett token om gangen fra venstre mot høyre og kan ikke angre et valg de allerede har tatt. En diffusjonsmodell starter i stedet med en støyete sekvens og forfiner den i flere runder, slik at flere posisjoner kan avgjøres parallelt. LLaDA2.2-flash legger til to kontrolltokens, DELETE og INSERT, slik at dekoderen kan fjerne overflødig tekst og åpne nye plasser underveis. Ant kaller teknikken Levenshtein Editing, og trente den med en egen forsterkningslæringsmetode kalt L-EBPO mot belønning fra flerstegs verktøybruk.

Modellkortet viser at hastigheten koster nøyaktighet. På SWE-bench Verified får LLaDA2.2-flash 49,28 mot 61,20 for Ling-2.6-flash, som er Ants egen autoregressive modell, og den taper også på SWE-bench Multilingual og BFCL-V4. Den vinner derimot på τ²-Bench (80,33 mot 76,36) og MCP-Atlas (46,21 mot 41,12), som begge måler verktøybruk over flere steg. Alle tallene er selvrapporterte, snittet over fem kjøringer med 128K kontekstvindu og Claude Code som kjøreramme.

Arkitekturen er MoE med 256 eksperter der åtte er aktive per token, fordelt på 32 lag med et vokabular på 157 184 tokens. Lisensen er Apache 2.0. Originalvektene i BF16 veier rundt 192 GiB, så en enkelt konsument-GPU er utelukket. MLX-miljøet la ut en 2-bits OptiQ-kvantisering 24. juli på rundt 36 GiB, og den er innenfor rekkevidde på en Mac med 64 GB delt minne.

Merk at RuntimeWire, som først meldte saken, skrev at annonseringen manglet benchmarktall og teknisk rapport. Modellkortet har begge deler.

Hva bør du gjøre?

  1. Hent MLX-kvantiseringen hvis du har en Mac med minst 64 GB minne, og mål tokenhastigheten mot din vanlige lokale modell før du bytter ut noe.
  2. Test den på verktøybruk framfor ren koding. Tallene peker mot at styrken ligger i flerstegs agent-løkker, ikke i å lukke SWE-bench-oppgaver.
  3. Les den tekniske rapporten i LLaDA2.X-repoet før du stoler på hastighetstallene, siden både de og benchmarkene er Ants egne.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter