Tillbaka till bloggen

Ny AI-modell tänker i tre lägen

Baserad på forskning av Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich

Tänk dig en AI som kan tänka på tre olika sätt samtidigt. Forskare har presenterat Nemotron-Labs-Diffusion, en banbrytande språkmodell som slår ihop autoregressiv avkodning, diffusion och själv-speculativ avkodning i en och samma arkitektur. Det handlar inte om en ytterligare gradvis uppgradering, utan om ett fundamentalt skifte i hur maskiner bearbetar språk. Det lovar att bryta de nuvarande gränserna för hastighet och effektivitet.

I grunden kombinerar modellen två helt olika tillvägagångssätt. Autoregressiv avkodning genererar text ord för ord, vilket ger en stark språklig struktur, medan diffusion fungerar genom att förädla brus till sammanhängande data och erbjuder överlägsen förläggande planering. Genom att träna på båda målen samtidigt utnyttjar modellen deras komplementära styrkor. Den kan dynamiskt växla mellan lägen beroende på uppgiften och hålla hög genomströmning, oavsett om den hanterar enkla frågor eller komplexa flerstegs-resonemang.

Den verkliga överraskningen finns i dess själv-speculativa läge, där diffusion utkastar potentiella svar och autoregressiv verifiering kontrollerar dem. Denna hybrida strategi överträffar traditionella metoder för flertokensprediktion både när det gäller acceptansgrad och verklig effektivitet. En analys baserad på ljusets hastighet avslöjar dessutom diffusions enorma potential, vilket möjliggör upp till 76,5 procent fler tokens per framåtpass under optimala förhållanden. Det innebär att modellen kan bearbeta avsevärt mer information i ett enda beräkningssteg jämfört med tidigare generationer.

Med skalning upp till 3B, 8B och 14B parametrar slår familjen Nemotron-Labs-Diffusion, som inkluderar bas-, instruktions- och vision-språkmodeller, konsekvent de bästa öppna källkodsmodellerna både i noggrannhet och hastighet. Versionen med 8B parametrar avkodar till exempel sex gånger fler tokens per framåtpass än Qwen3-8B med jämförbar noggrannhet. På ett GB200-GPU motsvarar detta en fyra gånger högre genomströmning, vilket bevisar att förena dessa avkodningslägen inte bara är en teoretisk kuriositet, utan ett praktiskt framsteg för AI:s framtid.

Källa: arXiv:2607.05722

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.