Parallell egenproduktion bevarar noggrannheten
Baserad på forskning av Subham Sekhar Sahoo, Lingjie Chen, Khiem Pham, Jonathan Geuter, Chaitanya Dwivedi
Stora språkmodeller är kraftfulla, men de är smärtsamt långsamma. De tvingas generera text token för token, precis som en läsare som drar ett finger längs varje ord. Denna sekventiella flaskhals begränsar hastigheten, men forskare har nu presenterat en metod som bryter denna kedja utan att offra noggrannheten. Genom att kombinera tillförlitligheten hos autoregressiva modeller med den parallella kraften hos diffusion har de skapat en ny klass av modeller som kan generera flera token samtidigt.
Kärnan i innovationen ligger i att koppla loss modellen i två delar. De huvudsakliga autoregressiva vikterna hanterar den vanliga förutsägelsen av nästa token, medan lätta diffusionsvikter tränas för att generera flera token parallellt. Denna diffusionsträning läggs till via en enkel distillationsprocess som tillför försumbar overhead till befintliga arbetsflöden. Resultatet är ett system som hämtar från samma fördelning som den ursprungliga modellen, men gör det i en burst, vilket effektivt parallelliserar genereringsprocessen.
Denna lösning löser en stor konflikt i nuvarande accelerationstekniker. Till skillnad från speculativ avkodning krävs ingen separat utkastmodell för att gissa nästa steg. Till skillnad från andra diffusionsbaserade stora språkmodeller försämras inte kvaliteten på den underliggande autoregressiva modellen. Forskarna kallar dessa nya modeller för Uno och introducerar en familj av samplrar som möjliggör förlustfri acceleration. Det innebär att du får högre hastigheter utan den vanliga avvägningen av minskad koherens eller noggrannhet.
Prestandaökningarna är betydande. Uno-modeller uppnår högre genomströmning än ledande metoder för speculativ avkodning över alla batchstorlekar och levererar upp till tre gånger hastigheten hos den basala autoregressiva modellen. I synnerhet överträffar deras modell med åtta miljarder parametrar större diffusionsmodeller med tjugosex miljarder parametrar samt proprietära system i benchmark för kodning, verktygsanvändning och resonemang. Detta genombrott gör det möjligt för utvecklare att bygga snabbare och mer effektiva AI-system genom att helt enkelt utöka befintliga modeller med öppna vikter med dessa nya diffusionsförmågor.