Fire veier rundt transformerens flaskehals, og to har vekter du kan laste ned
Bytt ut tett attention, komprimer konteksten eller dropp språk som representasjonsform: fem oppstartsselskaper angriper transformerens skaleringsproblem langs fire spor.
Et dokument på 10 000 ord tvinger en transformer gjennom rundt 50 millioner multiplikasjoner. En modell som holder et rullende sammendrag av konteksten slipper unna med en brøkdel. Den kontrasten er utgangspunktet for MIT Technology Reviews gjennomgang av arkitekturene som prøver å erstatte mekanismen hver eneste store språkmodell på markedet hviler på, ni år etter at Google-artikkelen «Attention Is All You Need» kom.
Subquadratic i Miami hevder å ha laget den første sparse attention-mekanismen som måler seg med toppmodellene på søk og koding, ved å avgjøre underveis hvilke ord i en tekst som betyr noe. Manifest AI i San Francisco bytter ut attention helt med det de kaller power retention, der modellen får et rullende sammendrag av konteksten og slipper ny informasjon inn mens mindre relevant faller ut. Selskapet gjorde den åpne kodemodellen StarCoder om til PowerCoder med minimal ettertrening, og har sluppet en modell kalt Brumby.
Liquid AI, en avlegger fra MIT, beholder transformerne men lar dem utgjøre bare 20 prosent av modellen. Resten er flytende nevrale nett, inspirert av ormehjerner, som kan endre oppførsel etter at treningen er ferdig. Modellene er gratis for organisasjoner med under 10 millioner dollar i omsetning, har passert 34 millioner nedlastinger og kjører på en Raspberry Pi til 50 dollar. Inception i Palo Alto går motsatt vei og genererer hele tekstblokker om gangen med diffusjon, samme teknikk som driver bildemodeller.
«Transformere er en ingeniørmessig bekvemmelighet vi snublet over. Det startet en religion, men det er naivt å tro at et gjennombrudd ikke skjer igjen» — Zuzanna Stamirowska, medgründer og sjef i Pathway
Pathway er den mest radikale av dem. Modellen Dragon Hatchling bytter attention mot et tilstandsrom og løste over 97 prosent av mer enn 250 000 vanskelige sudoku-oppgaver, en test der flere ledende språkmodeller ikke klarte en eneste. Skepsisen i bransjen er der fortsatt, særlig mot Subquadratics påstander, som selskapet så langt bare underbygger med egne tall og en venteliste. For deg som bygger betyr det at modellvalget om et år kan handle om arkitektur og ikke bare parametertall, og at to av kandidatene allerede ligger nedlastbare.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.