NVIDIA Kumo Tabular spår verdier i tabeller uten trening og topper fire benchmarker
Test NVIDIA Kumo Tabular på dine egne tabeller før du trener enda en gradient boosting-modell, for den åpne modellen predikerer nye rader direkte fra eksemplene du gir den.
28 millioner parametre i minste utgave, 215 millioner i største. NVIDIA har lagt ut Kumo Tabular på Hugging Face, med vekter for tre størrelser og kode i biblioteket structured-data-models på GitHub. Du gir modellen en tabell med merkede rader som kontekst pluss radene du vil ha svar på, og den returnerer klassesannsynligheter eller tallverdier i ett forward pass. Ifølge NVIDIA trengs verken trening, hyperparametersøk eller feature engineering, og modellen håndterer både klassifisering og regresjon.
Tabelldata er der mye praktisk maskinlæring foregår: kunderegistre, transaksjoner, sensorlogger og ordrer. I to tiår har standardsvaret vært gradient-boosted trees som trenes på nytt for hvert nye spørsmål. Kumo Tabular bruker i stedet samme mekanisme som few-shot-prompting i språkmodeller, altså in-context learning.
«En modell som er forhåndstrent på millioner av tabeller, kan lese en merket tabell som kontekst og forutsi etikettene til nye rader direkte» — NVIDIA, i lanseringsinnlegget på Hugging Face
Det uvanlige er treningsdataene. Modellen har aldri sett en ekte tabell under trening. NVIDIA genererte kunstige tabeller fra tilfeldige strukturelle kausalmodeller og bygde inn skavanker fra virkeligheten: manglende verdier, dupliserte rader med ulik etikett og regresjonsmål med tunge haler. Large-utgaven så rundt 137 millioner slike tabeller, Small rundt 35 millioner. Siste treningsfase strekker konteksten til 60 000 rader med opptil 100 kolonner. Klassifisering og regresjon er separate modeller, og hver størrelse har egne vektfiler for begge.
På TabArena, der modellen møter tunede gradient-boosted trees, AutoGluon og andre tabellmodeller, rapporterer NVIDIA førsteplass med ELO 1950. Modellen topper også BeyondArena, TALENT og ScoringBench, ifølge NVIDIA. Alle tallene kommer fra NVIDIA selv, og treningsoppskriften og datageneratorene er ikke sluppet ennå, så ingen kan foreløpig gjenskape treningen.
Begrensningene står tydelig i innlegget. Modellen leser bare numeriske og kategoriske kolonner, så tekst, bilder og tidsstempler må gjøres om til features med bibliotekets forbehandling. Ett forward pass dekker opptil 10 klasser, og biblioteket utvider til flere med error-correcting output codes. Nøyaktigheten kan også falle når tabellen ligger langt utenfor treningsområdet. Vektene er lisensiert under OpenMDW 1.1, som NVIDIA oppgir at tillater kommersiell bruk, mens bibliotekskoden er Apache 2.0.
«For CUDA-arbeidslaster anbefaler vi sterkt å installere cudf som en ekstra avhengighet, for å holde dataframe-operasjoner på GPU» — README for structured-data-models på GitHub
Hva bør du gjøre?
- Installer biblioteket med pip install structured-data-models, som krever Python 3.11 og PyTorch 2.7 eller nyere. Vektene lastes ned fra Hugging Face første gang du kaller modellen.
- Kjør Kumo Tabular mot en tabell der du allerede har en XGBoost- eller LightGBM-modell, og sammenlign på egne holdout-data før du bytter. NVIDIA ber selv om at nøyaktighet og kalibrering valideres slik.
- Gjør om tekst- og datokolonner med forbehandlingen i biblioteket før du sender tabellen inn, siden modellen bare forstår tall og kategorier.
KI-kuratert — innholdet er generert av KI-agenter basert på originalkilden.