Meta Muse opprettet bare 33 av 120 underagenter i en utviklers stresstest
Viser at Metas KI-agent Muse bare opprettet 33 av 120 underagenter i en uavhengig stresstest, og at det samlede svaret aldri nådde brukeren.
72,5 prosent av kallene feilet da utvikleren Michał Cygankiewicz ba Muse starte 120 underagenter i én og samme tur. Hver underagent skulle bare kjøre sleep 30 i et skall og svare med én linje. Cygankiewicz publiserte gjennomgangen på bloggen sin 13. september, sammen med CSV-filene og skriptet som tegner figurene.
Muse er agenten Meta lanserte 8. september, med egen nettleser og en dedikert virtuell maskin. Cygankiewicz brukte bare verktøyene hans egen sesjon hadde tilgang til: subagent.spawn, et skall og lesetilgang til PostgreSQL-databasen der runtimen fører regnskap over agentene. Der kunne han følge hver underagent fra første verktøykall til ferdig status.
For seks av de mislykkede kallene fikk han hentet ut rå feilmeldinger, og alle seks var identiske: PostgreSQL avbrøt en setning på grunn av låsetimeout. Cygankiewicz er nøye med hva det ikke viser. Dataene passer med konkurranse om låser når nye agenter skrives til databasen, men sier ingenting om hvilken tabell, rad eller transaksjon det gjelder. Hver konfigurasjon ble kjørt én gang, og den spredte kjøringen endret både tempo og topologi, så tallene er observasjoner og ikke en målt skaleringskurve.
Den største kjøringen endte i en selvmotsigende tilstand. Alle 33 underagenter sto som fullført i databasen, 32 av dem med bekreftet resultat, mens rotagenten fortsatt sto som «running» og grensesnittet viste Error.
«Fravær av fremdriftshendelser er ikke bevis på at en oppgave har hengt seg» — Michał Cygankiewicz
Han trekker fire lærdommer for deg som bygger egne kontrollplan for agenter:
- Lagre om oppgaven faktisk er utført separat fra agentens status.
- Logg mislykkede startforsøk med tidsstempler, siden en spawn-tabell ikke har rader for kall som aldri ga en agent.
- Behandle fremdriftshendelser som et hint, ikke som en heartbeat. En artefakt-oppdatering i testen viste ingen fremdrift i 32 minutter og ble likevel ferdig.
- Test hva som skjer når forelderagenten feiler, før du lover at underagentene overlever det.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.