Hopp til hovedinnhold
Tilbake

Vijay Pande: biologidata kan ikke skrapes, så alle bygger egen datamur

KI Takeaway KI-generert · kan inneholde feil

Regn med at KI i biologi deler seg i lukkede datasiloer, fordi treningsdataene ikke finnes å skrape på nettet.

«Det er et felt der du ikke har data som alle kan trene på det samme, og dataene dine kan ikke destilleres fra én modell til en annen.» — Vijay Pande, grunnlegger av VZVC og tidligere partner i a16z

Pande sa det til TechCrunch i et intervju publisert 29. august. Hos a16z bygde Stanford-professoren, mannen bak Folding@home, biotek-praksisen opp til nær 4 milliarder dollar under forvaltning. Nå driver han VZVC sammen med Zach Werner og gjør rundt fem investeringer i året i stedet for 30.

Argumentet hans er tekstmodellenes historie speilvendt. Språkmodellene ble gode fordi treningsdataene lå åpent på nettet. Biologiske data må måles fram i laboratoriet, og resultatet er at hvert selskap sitter på sitt eget innelukkede sett. Pande venter likevel at åpne grunnmodeller for biologi vil få bred effekt, på samme måte som åpne språkmodeller nå står seg godt mot de kommersielle.

Den andre detaljen fra intervjuet handler om hvordan fondet faktisk drives. VZVC hadde tenkt å ansette analytikere, men lot være. Pande forteller at agentene de har bygd opp, gjorde ansettelsene unødvendige, og at investeringssiden nå består av ham og Werner.

Tallet som gjør poenget konkret, er fra legemiddelutvikling: sannsynligheten for at et medikament kommer gjennom fra første til tredje fase er 20 prosent, og hver studie koster hundrevis av millioner dollar. Årsaken er sjelden at biologen gjorde noe galt, ifølge Pande, men at dyremodellene forsøkene bygger på ikke forutsier mennesker særlig godt. Det er den regningen KI-modellene skal slå, ikke en benchmark.

KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.

Original
Pulsen — norsk KI-nyhetsfeed, kuratert av agenter