Basecamp Research henter 140 millioner dollar: lavere perplexity ga ikke bedre molekyler
Henter 140 millioner dollar til DNA-modellen EDEN, og teknologisjefen advarer mot å stole på perplexity når målet er molekyler som faktisk virker.
StripedHyena, arkitekturen bak Arc Institutes Evo-modell, nådde tidvis lavere perplexity enn Llama da Basecamp Research sammenlignet dem. Llama gjorde det likevel bedre på de biologiske oppgavene etterpå, og derfor bygger EDEN på Llama, forteller teknologisjef Philip Lorenz til The Decoder. Intervjuet kommer samme dag som London-selskapet kunngjør en Series C på 140 millioner dollar ledet av S32, med Nvidia og Anthropics Anthology Fund blant investorene.
Datasettet er det som skiller Basecamp fra andre. Da intervjuet ble gjort, inneholdt det rundt 15 billioner tokens, der hvert token er én DNA-byggestein. Det er samme størrelsesorden som tekstdatasettene bak Claude og GPT. Ifølge Lorenz ga egne data en brattere skaleringskurve enn offentlige data da identiske arkitekturer ble trent under like forhold, og gapet vokste med modellstørrelsen. Offentlige arkiver er skjeve: rundt 68 prosent av sekvensvolumet i Sequence Read Archive kommer fra bare fem arter.
«Akkurat nå er en tredjedel av GPU-ene våre reservert for eksperimenter med forsterkningslæring» — Philip Lorenz, teknologisjef i Basecamp Research, til The Decoder
Lab-eksperimentene gir bare hundrevis til tusenvis av datapunkter, men brukes til å styre den bredt trente modellen mot smale oppgaver. Syntetiske treningsdata har lav prioritet: i interne tester laget slike modeller tidvis fungerende proteiner, men generaliserte aldri til nye oppgaver. Utvalgte EDEN-funksjoner for antibiotikadesign og valg av vaksinemål er tilgjengelige via Claude og Claude Science. Selve modellene blir ikke åpne, med henvisning til sikkerhet og avtaler med datapartnerne.
Resultatene er fortsatt prekliniske. I en artikkel som ikke er fagfellevurdert, viste 97 prosent av et lite, kuratert utvalg antimikrobielle peptider aktivitet i laben, og kandidaten EDEN-7 virket omtrent like godt som et siste-utvei-antibiotikum i mus. Ingen av de seks terapiprogrammene er kommet forbi lead optimization per september 2026.
For deg som trener eller finjusterer egne modeller er Llama-valget den nyttige detaljen: velg arkitektur og sjekkpunkter etter nedstrømsoppgavene, ikke etter tapskurven alene.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.