Hopp til hovedinnhold
Tilbake
Verktøy 3 min · Kilde: GitHub (Show HN)

Open-Cowork styrer skjermen din med modellen du selv velger

KI Takeaway KI-generert · kan inneholde feil

Kjører en datamaskin-agent på din egen skjerm, i en sky-VM eller i en nettleserfane, med modellen du selv peker på.

1 105 modeller står i katalogen Open-Cowork slår opp i for å avgjøre om modellen du har valgt i det hele tatt kan se et skjermbilde. Listen er ifølge prosjektet destillert fra to åpne databaser pluss leverandørenes egne metadata, og en modell uten bildeforståelse blir avvist med en forklaring i stedet for å få tilsendt et skjermbilde den ikke kan tolke. Detaljen sier noe om hvor prosjektet legger innsatsen: agenten skal ikke bruke penger på å famle.

Open-Cowork er lagt ut av Coasty under MIT-lisens og har ligget på GitHub siden 11. juni. Selve løkken er den samme som i andre computer-use-agenter: ta skjermbilde, forutsi neste handling, utfør, gjenta. Det uvanlige er at hele løkken går gjennom ett Executor-grensesnitt med tre implementasjoner. LocalExecutor styrer din egen maskin, RemoteMachineExecutor en sky-VM hos Coasty, og BrowserExecutor en nettleserside via Playwright. Forutsi-steget er skilt ut på samme måte, slik at din egen modell bare er nok en implementasjon bak samme kontrakt.

I praksis betyr det at du kan sette ANTHROPIC_API_KEY, OPENAI_API_KEY eller nøkler for Gemini, xAI, Mistral, Groq og OpenRouter i en env-fil, og at Ollama og LM Studio fungerer på samme sted uten nøkkel og uten skytilkobling. Uten noen nøkkel starter den i demomodus med en innebygd mock-server, uten konto og uten fakturering. Kravene er Node 22.5 eller nyere og pnpm 10.

«Klientene holder aldri API-nøkkelen. De snakker med backenden med kortlevde sesjonstokener.» — Open-Cowork-dokumentasjonen

Nøkkelhåndteringen er den delen prosjektet dokumenterer grundigst. Coasty-nøkkelen finnes bare i backendens miljø, og nettleser, Electron-renderer og mobilklient ser den aldri. Prosjektet oppgir at dette håndheves av tester som skanner hver klientpakke, pluss en E2E-sjekk som overvåker nettleserforespørsler for hemmeligheter. Egne modellnøkler krypteres med operativsystemets nøkkelring. Dette er prosjektets egen beskrivelse av sikkerhetsarbeidet, ikke en ekstern gjennomgang.

Over agent-løkken ligger en versjonert JSON-DSL for arbeidsflyt med stegene task, assert, if, loop, parallel, retry og human_approval, med validering, kostnadsestimat og harde budsjettak som håndheves på serversiden. Hendelsesstrømmen er varig og går over SSE med replay, så du kan starte en kjøring på laptopen, få godkjenningsvarselet på telefonen og ta over fra nettleseren.

Den åpenbare risikoen står i README-en selv: lokal styring flytter den ekte musa og det ekte tastaturet ditt. Det er ingen sandkasse mellom agenten og filene dine når du velger «This computer».

Hva bør du gjøre?

  1. Start i nettleser-modus med pnpm dev før du gir agenten musa. Da kjører den mot en Playwright-side, og feilslåtte handlinger rammer en fane, ikke skrivebordet.
  2. Pek den mot Ollama eller LM Studio hvis skjermbildene kan inneholde sensitive data. Skjermbildene forlater da ikke maskinen, og kostnaden er null.
  3. Legg human_approval inn i arbeidsflyten foran alt som ikke kan angres, som sletting, utsending av e-post og betalinger. Budsjettakene stopper pengebruk, ikke handlinger.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter