Open Executive: åtte Claude-agenter, en selvhostet toppledelse
Ruter hvert spørsmål til åtte spesialiserte Claude-agenter og svarer med én samlet lederstemme, under Apache 2.0.
«Ser ut som en god måte å pådra seg en riktig stor Anthropic-tokenregning», skrev brukeren walrus01 i Hacker News-tråden om Open Executive natt til torsdag. Prosjektet fra Sente Labs ligger åpent på GitHub og sender spørsmålet ditt videre til én av åtte spesialistagenter: strategi, økonomi, HR, juridisk, drift, marked, produkt og styrekommunikasjon. Orkestratoren kjører på claude-sonnet-4-6, de fire tyngste rollene får claude-opus-4-7 med utvidet tenkning, og intensjonsrutingen gjøres av claude-haiku-4-5. Brukeren ser aldri agentstrukturen, bare ett samlet svar.
Tråden passerte 340 poeng og 200 kommentarer på under et døgn, under tittelen «CEO fired developers to make room for AI. Developers create open source AI CEO». Repoet navngir selv ingen bedrift og gjør ikke noe poeng av hevnmotivet. Det står nå på 477 stjerner og 37 forker, og siste commit kom onsdag.
Stakken er FastAPI på Python 3.11 og Next.js 15, med ChromaDB som lokal vektorbutikk og SQLite for episodisk minne. Hver spesialist henter kontekst fra to lag: innebygde MBA-notater som følger repoet, og dokumentene du selv laster opp i en egen samling. Etter hvert svar kjører en bakgrunnsjobb på claude-haiku-4-5 som trekker ut beslutninger og initiativ, slik at neste økt åpner med en blokk over hva systemet anbefalte sist. Systemprompten er delt opp slik at persona, selskapsprofil og kunnskapsindeks caches hver for seg, og prosjektet oppgir opptil 85 prosent cache-treff etter de første rundene.
Innvendingen om regningen har et svar i konfigurasjonen. Open Executive kan peke mot hvilken som helst OpenAI-kompatibel server, altså Ollama, LM Studio, vLLM eller llama.cpp, gjennom den samme abstraksjonen som de hostede modellene bruker. Setter du LOCAL_MODELS_ENABLED til true og lar Anthropic-nøkkelen stå tom, kjører hele toppledelsen på din egen maskin. Prisen er at serverside-websøk, prompt-caching og utvidet tenkning slås av lokalt, og at rutingen mellom agentene lener seg tungt på verktøykall. Dokumentasjonen anbefaler Llama 3.3 70B eller Qwen2.5, og advarer om at små modeller ruter dårlig.
Den delen som er lettest å ta med seg til ditt eget prosjekt, er evalueringsoppsettet. Repoet har 29 scenarioer fordelt på de åtte domenene, scoret av claude-opus-4-7 som dommer på fem dimensjoner fra 1 til 5: personakoherens, domenepresisjon, bruk av selskapskontekst, rutingkvalitet og handlingsverdi. CI-porten krever 3,5 av 5 i snitt, og en pull request faller hvis én enkelt dimensjon synker mer enn 10 prosent mot main. Nye agenter må levere minst to egne scenarioer for å slippe gjennom.
«Scheduleren tar rader via UPDATE ... RETURNING. Å kjøre to API-maskiner ville dobbeltutløst planlagte handlinger» — Open Executive-dokumentasjonen
Advarselen er verdt å lese to ganger hvis du vurderer å sette dette i drift. API-et må kjøre som én instans, og Fly-konfigurasjonen låser maskinantallet til 1 av samme grunn.
Hva bør du gjøre?
- Regn med noen minutter på første oppstart. Oppsettet drar inn ChromaDB og PyTorch og laster ned en innebyggingsmodell på rundt 90 MB før appen svarer.
- Vil du unngå tokenregningen walrus01 advarer mot: slå på lokale modeller, pek LOCAL_BASE_URL mot Ollama på port 11434 og la Anthropic-nøkkelen stå tom.
- Kopier evalueringsporten selv om du dropper resten. Kravet om 3,5 av 5 i snitt og to scenarioer per ny agent er en billig måte å hindre at promptendringer stille forringer et agentsystem.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.