Hopp til hovedinnhold
Tilbake

WhoDunnitAI: OpenAIs realtime-modell spiller mistenkt, gpt-5-mini dømmer bevisene dine

KI Takeaway KI-generert · kan inneholde feil

Kombiner en dyr realtime-stemmemodell med en billig tekstmodell som dommer, så slipper stemmemodellen å holde styr på spilltilstanden.

Utvikleren MrRowTheBoat la WhoDunnitAI ut som Show HN tidlig 10. august, et talestyrt mordmysterium der du avhører mistenkte i saken om en forgiftet familiefar. Avhørene går speech to speech mot OpenAIs gpt-realtime-2.1 over WebRTC, skriver han i innlegget.

Det tekniske poenget ligger ikke i spillet, men i hvordan tilstanden håndteres. Hver mistenkt har ett verktøy som kalles i det du kommer med en direkte anklage, og det fanger hvem du anklaget pluss en tro liste over bevisene du faktisk uttalte. En separat gpt-5-mini avgjør deretter hvilke av sakens påkrevde bevisfakta du virkelig la fram. Omskriving teller, vag mistenkeliggjøring og fisking gjør det ikke.

«Jeg har også lagt inn en 30-minutters timer, for jeg vil virkelig ikke gå konkurs mens jeg sover i natt.» — MrRowTheBoat, utvikleren bak WhoDunnitAI

Prisen på realtime-modellen er grunnen til at samtaler er låst til en innlogget Clerk-bruker, og til at hver økt har den timeren. Resten av stacken er Next.js, MongoDB og Clerk, og spillet ligger på whodunnitai.com. Utvikleren skriver at han bygde en første versjon av det samme for to til tre år siden, men at stemmeagenter den gang var for tidlige til at resultatet holdt.

For deg som bygger stemmeagenter er delingen selve lærdommen. Realtime-modellen gjør det bare den kan, nemlig å snakke i sanntid, mens hver avgjørelse som må være presis flyttes til en tekstmodell som er billig nok til å kjøres om igjen og deterministisk nok til å testes.

Hva bør du gjøre?

  1. Skill stemmelaget fra vurderingslaget i din egen agent. Realtime-modellen snakker, en billigere tekstmodell avgjør hva som faktisk ble sagt.
  2. Sett en hard grense per økt før du åpner for publikum. Innlogging og en timer koster mindre enn en overraskelsesregning fra en speech to speech-modell.
  3. La verktøykallet returnere det brukeren faktisk sa, ikke en oppsummering. Dommermodellen trenger råmaterialet for å skille omskriving fra fisking.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter