Nvidia Nemotron 3 Nano Omni: 30B parametere, 3B aktive, kjører på én GPU
fredag 1. mai · KI-generert · Kilde: NVIDIA Developer Blog
Innholdet er KI-generert og kan inneholde feil. Sjekk originalkilden.
30B-modellen aktiverer bare 3B per token og kjører på én GPU. Multimodal med 262K kontekst. Vektene er ute på Hugging Face under åpen Nemotron-lisens.
Hva betyr dette i praksis
Hvis du bygger en agent som skal forstå mer enn ren tekst, har du nå en omni-modell som faktisk kan kjøre på en lokal Jetson eller en single-GPU-rigg uten ekstreme kvantiseringstriks. NVFP4-kvantisering er tilgjengelig hvis du vil presse VRAM-bruken videre. Omni-modeller på edge åpner for hjemmeprosjekter der video- og lyd-input er en del av kjøreflyten, ikke bare tekst.