Hopp til hovedinnhold
Tilbake
Forskning 3 min · Kilde: DeepLearning.AI - The Batch

Andrew Ng deler det å bygge KI-apper i seks ferdigheter, og evals veier tyngst

KI Takeaway KI-generert · kan inneholde feil

Bryter den første av fire KI-ingeniørferdigheter ned i seks delferdigheter, der evalueringsdrevet utvikling veier tyngst.

«Å kunne bestemme neste steg på en dyktig måte er det som lar deg lage pålitelige programvaresystemer av upålitelige KI-komponenter.» - Andrew Ng, DeepLearning.AI

Slik oppsummerer Andrew Ng, medgrunnlegger av Google Brain og Coursera, hva som skiller KI-programvare fra alt annet du bygger. Han la 21. august ut brevet som følger opp DeepLearning.AIs ferdighetskart for KI-ingeniørarbeid. Kartet har fire toppnivåferdigheter: å bygge og drifte KI-applikasjoner, programvarefaglige grunnprinsipper, bruk av kodeagenter, og det å forme selve byggingen. Dette brevet fyller ut den første.

Premisset er at utdataene er uforutsigbare, og at bygging derfor blir iterativt heller enn planlagt. De seks delferdighetene han lister opp handler alle om å navigere den uforutsigbarheten. LLM-grunnlag betyr å forstå tokenisering og generering godt nok til å vurdere cache-treff, kunnskapskutt og hvor mye resonnering en oppgave krever. Forankring i data har vokst langt forbi vektorsøk med RAG: valget står mellom hva du legger i prompten og hva modellen henter selv, og mellom vektorindeks, kunnskapsgraf eller et semantisk lag over strukturerte data.

Under agentiske systemer skiller Ng mellom arbeidsflyter med forhåndsbestemt rekkefølge og oppsett der modellen selv velger neste steg, og lister opp valgene som følger: hvilke verktøy modellen får kalle, deriblant MCP, CLI og sandkasser, hvilken minnearkitektur du bruker, hvordan konteksten styres over lange økter, og når en oppgave faktisk trenger flere agenter i stedet for én.

Det han vektlegger tyngst er noe annet. Evalueringsdrevet utvikling er etter hans erfaring det enkelttrekket som skiller de virkelig gode fra resten, og han beskriver det som vanskelig å mestre fordi riktig fremgangsmåte varierer både med prosjekt og med hvilken fase prosjektet er i. Det innebærer å lese traces og utdata, gjøre utforskende dataanalyse, og vite når du skal bruke deterministiske evalueringer, når en modell skal dømme, og når et menneske må inn.

De to siste er drift og maskinlæringsgrunnlag. Drift av KI-programvare skiller seg fra vanlig drift på grunn av uforutsigbarhet, kostnad og latens: du må oppdage drift i modellen, håndtere angrep som prompt-injeksjon, og kalibrere testinnsatsen mot risikoen ved en feil. Ng skriver at alle han kjenner som er gode til å bygge med språkmodeller også forstår maskinlæring og dyplæring i en viss dybde.

Ferdighetskartet er bygget på analyse av stillingsannonser, strukturerte ekspertintervjuer og spørreundersøkelser, og DeepLearning.AI oppdaterer det fortløpende. Det neste brevet tar for seg programvarefaglige grunnprinsipper.

For deg som bygger egne agenter er dette først og fremst en huskeliste med tyngde bak. Evals står som nummer fire på Ngs egen liste, men er det ene punktet han peker ut som avgjørende, og det er punktet som lettest ryker når du bygger alene på fritiden.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter