Airbnb lar agenter ta første vaktrunde og ettertrener små modeller til søk
Se på Airbnbs oppskrift: hendelsesutløste agenter i containere tar første vaktrunde, mens små ettertrente modeller tar de latensfølsomme jobbene.
«Mange av teamene våre begynner i praksis å automatisere vaktene sine», sier Ahmad Al-Dahle, teknologidirektør i Airbnb, til Latent Space. Når en grense i Grafana eller et annet overvåkingssystem slår ut, starter agenter som triagerer og tar den første vaktrunden. En ingeniør går gjennom pull requesten agenten foreslår, mens agenten selv kan lukke hendelsen hvis den konkluderer med at alarmen var ustabil.
Al-Dahle ledet generativ KI i Meta og lanseringen av Llama-modellene før han begynte i Airbnb i januar. Han kaller asynkrone agenter som kjører i containere og aktiveres av hendelser for neste store skifte, ved siden av den interne agenten AirChat, som har organisasjonens kontekst via MCP. På sikt vil han bruke samme mønster til å overvåke svindel, kvaliteten i markedsplassen og programvarefeil.
Modellvalget er det mest overførbare for deg som bygger. Airbnb kjører minst 10 tilpassede modeller i produksjon og gjør det meste av ettertrening og forsterkningslæring på åpne modeller. Hver modell velges langs en Pareto-front for kostnad, ytelse og latens, med egne evalueringer per bruksområde basert på ekte spørringer fra produksjon. Koding tåler ventetid, men ikke feil, så der brukes den sterkeste frontmodellen. Søk er latensfølsomt og går på små spesialmodeller.
«For smale bruksområder har vi klart å ta veldig små, veldig smidige modeller som er svært raske og billige, og ettertrene dem forbi fronten.» — Ahmad Al-Dahle, CTO i Airbnb
Kundestøtte var det første brukerrettede området med KI, og omtrent halvparten av supportsakene løses nå helt av KI. Airbnbs rapport for andre kvartal satte andelen til nesten 45 prosent. Nøkkelen var å generere et batteri av syntetiske data og teste agenten grundig før produksjon, mens saker som gjelder sikkerhet, bevisst holdes hos mennesker.
Den interne kontekstgrafen Everest, bygget med LLM-er, embeddings og KI-basert gjenfinning, forklarer hvorfor de nye tjenestene kom raskt. Lærdommene fra dagligvarelevering lå der da teamet bak flyplasshenting startet, og grafen lar generalister jobbe i spesialiserte deler av kodebasen.
«Dagligvarer tok åtte måneder, ni måneder, og flyplasshenting tok omtrent seks uker å utvikle.» — Airbnbs rapport for andre kvartal, gjengitt av Latent Space
Én ting bekymrer Al-Dahle: at juniorutviklere ikke bygger dømmekraft når KI gjør jobben. Kravet hans er at hver ingeniør skal kunne forklare det de har bygget, også når en KI skrev pull requesten. Airbnbs egne tall, 60 prosent KI-skrevet kode og rundt 1,6 ganger flere pull requests per ingeniør, oppgis uten målemetode.
Vaktagent-mønsteret krever ikke Airbnbs skala: en alarm-webhook, en agent i en container og menneskelig review av pull requesten er byggeklossene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.