Wayfinder er et referanseprosjekt for å lære KI-evaluering fra grunnen
Viser hele evalueringsstakken fra regelbaserte sjekker til LLM-as-a-Judge på én og samme eksempelapp.
De fleste som bygger noe med en LLM oppdager evaluering for sent, gjerne først når en promptendring stille ødelegger noe som fungerte forrige uke og enhetstestene ikke merker det. Wayfinder er et Python-repo som tar den situasjonen som utgangspunkt og bygger et evalueringssystem lag for lag rundt én enkelt applikasjon, et KI-drevet flysøk.
Rekkefølgen er poenget. Prosjektet går fra regelbasert evaluering, via menneskelig evaluering og LLM-as-a-Judge, til online evaluering av ekte brukerinteraksjoner og til slutt sammenligning av eksperimenter. Hvert steg er et kjørbart eksempel under examples/, og hvert steg svarer på et av spørsmålene repoet stiller innledningsvis: ble applikasjonen bedre, innførte siste endring en regresjon, og hvordan måler du subjektive kvaliteter som hjelpsomhet eller forankring i kilden.
Forutsetningene er Python 3.12 eller nyere og uv. En OpenAI-nøkkel kreves for eksemplene som faktisk genererer svar, og LangSmith for tracing, online evaluering og eksperiment-sammenligning. Det siste binder deg hardest: online-evaluatoren henter nylige Wayfinder-interaksjoner fra LangSmith, fester automatiske kvalitetsscorer og forklaringer tilbake på hver trace, og eksplisitt brukerfeedback fra CLI-en havner samme sted.
Repoet ble lagt ut på Hacker News 6. september og har to stjerner. Det er heller ikke et rammeverk du installerer, men kode du leser og kjører ved siden av artikkelserien «AI Engineering Fundamentals — AI Evaluation» som det er skrevet sammen med. Lisensen er MIT.
Hva bør du gjøre?
- Start med det regelbaserte eksempelet. Det er det billigste steget og viser mekanikken før du drar inn en dommermodell som koster penger per kjøring.
- Kopier strukturen i
src/wayfinder/evaluators/inn i ditt eget prosjekt i stedet for å adoptere flysøk-appen. - Merk deg
--repetitions 5i eksperiment-eksempelet. Å kjøre samme datasett flere ganger er forskjellen mellom en score og en score du kan stole på.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.