Hopp til hovedinnhold
Tilbake
Verktøy 2 min · Kilde: GitHub

Simurg kutter strømmen når modellen kollapser midt i svaret

KI Takeaway KI-generert · kan inneholde feil

Overvåker tegnstrømmen fra en LLM og kutter den når dekodingen kollapser, før teksten når brukeren.

«Dette er ikke faktahallusinasjon» — Simurgs dokumentasjon, om hva verktøyet faktisk fanger

Simurg er et Python-bibliotek fra HAL-X AI, sluppet under Apache-2.0 og lagt ut som Show HN 30. august. Det overvåker tegnstrømmen fra en språkmodell og avbryter den når dekodingen kollapser i en av fire kjente feilmoduser: repetisjonsløkker, drift over i et annet skriftsystem, regurgitering av treningstekst eller ren tegn- og tallsøppel.

Skillet mot faktafeil er hele poenget. En flytende, men gal setning har ingen statistisk signatur. Kollapset dekoding har det: repetisjonsrate, leksikalsk variasjon, skriftfordeling, komprimerbarhet og forutsigelsesoverraskelse beveger seg alle målbart. Simurg gjør ett pass per tegn i konstant tid, holder de første 350 tegnene tilbake i en buffer, slipper dem først når de scorer rent, og sjekker på nytt hvert 400. tegn. Biblioteket bruker bare numpy, ingen modell og ingen GPU, og leser 197 632 tegn i sekundet på én laptop-kjerne. En modell som strømmer 50 tokens i sekundet skriver rundt 250 tegn, så vakten blir aldri flaskehalsen.

Tallene kommer fra prosjektets egen CorruptBench, et syntetisk sett på 243 strømmer. På testsplitten på 81 strømmer treffer den 78 av 80 korrupte, med median 590 tegn etter kollapsens start. Tolv av 21 strømmer som var korrupte fra første tegn ble stoppet helt. Detektoren ga null falske alarmer på 121 ekte produksjonstekster fra en selvhostet resonneringsmodell. Teknisk rapport er skrevet av F. Aghayev og E. Ahmadbayli i HAL-X AI.

Hva bør du gjøre?

  1. Kalibrer på din egen trafikk. Tersklene er tilpasset det medfølgende domenet. Du peker Simurg mot en JSONL-fil med dine egne rene utdata og kjører kalibreringen på sekunder.
  2. Bruk GuardedLLM-innpakningen hvis endepunktet ditt snakker /v1/chat/completions. Den håndterer hold, avbrudd, nytt forsøk og fallback-modell, og vLLM, llama.cpp, TGI og Ollama fungerer alle.
  3. Slå av websøket med tom TINYFISH_API_KEY hvis spørringer ikke skal forlate maskinen. Pakken leveres med en gratis TinyFish-nøkkel og søker som standard.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter