Hopp til hovedinnhold

Onsdag 7. oktober

 Tilbake MCP 2 min 16.43

talkthrough-mcp gjør et kommentert skjermopptak til agent-klare data lokalt

onsdag 22. juli · KI-generert · Kilde: GitHub

Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.

Gjør et kommentert skjermopptak til strukturerte, agent-klare data lokalt, uten noen språkmodell eller sky i selve serveren.

Der en skjermopptaker-SaaS sender videoen til skyen, kjører talkthrough-mcp alt på din egen maskin og jobber på vilkårlige lokale filer. Serveren gjør et kommentert opptak, eller hvilken som helst video- eller lydfil, om til tidsstemplet transkript, valgfrie hvem-sa-hva-etiketter, keyframes ved scenebytte og OCR av tekst på skjermen.

Det er ingen språkmodell inne i serveren og ingen sky i løypa: ffmpeg, faster-whisper og RapidOCR kjører lokalt, og den kallende agenten står for intelligensen. Alt serveres gjennom lazy retrieval-verktøy, så et 30-minutters opptak flommer aldri modellens kontekst. Agenten henter akkurat den transkript-biten, moment-bunten eller rammen den trenger.

Detaljen som skiller den ut, er at hvert tidsstempel forankres til klokketid. «Øyeblikket jeg sa at utsjekken hang» peker dermed rett på riktig vindu i serverloggene dine. Serveren følger også med workflow-oppsett: server-prompter og eksempel-agenter som viser hvordan et opptak blir til bugrapporter, spec eller backlog.

Hva bør du gjøre?

  1. Installer serveren med uvx og koble den til Claude Desktop, Cursor eller Codex CLI hvis du vil gi en agent kontekst fra skjermopptak.
  2. Bruk lazy retrieval-verktøyene på lange opptak: agenten henter biter, så du slipper å presse hele transkriptet inn i konteksten.

Pulsen · norske KI-nyheter for deg som bygger. Sakene er KI-generert fra originalkilden, som alltid lenkes.