Tillbaka till bloggen

Små AI-modeller för snabbare bearbetning

Baserad på forskning av Yuchen Xian, Yang He, Yunqiu Xu, Yi Yang

Tänk dig en dator som kan läsa dina tankar tillräckligt väl för att gissa vad du vill säga härnäst, och sedan dubbelkolla sina antaganden utan att anstränga sig nämnvärt. Det är löftet med speculativ avkodning, en teknik som är utformad för att påskynda stora språkmodeller genom att låta mindre, snabbare assistanter utkasta svar som huvudmodellen sedan verifierar. Men vad händer om huvudmodellen är en överkill för de flesta av dessa gissningar?

Forskare har upptäckt att många avvisade token från dessa utkast inte behöver en fullständig, kostsam omvärdering av den enorma modellen. Istället kan de verifieras korrekt av en lättviktig delmodell som härletts från den ursprungliga verifieraren. Denna insikt ledde till skapandet av VIA-SD, ett ramverk med flera nivåer som styr token baserat på konfidensnivåer. Gissningar med hög konfidens accepteras omedelbart, sådana med medelkonfidens hanteras av den lätta delmodellen, och endast de mest osäkra fallen utlöser den fullständiga, resurskrävande verifieringsprocessen.

Överraskningen här är inte bara effektiviteten, utan även lösningens enkelhet. Genom att införa denna hierarkiska styrning minskar systemet avvisningsfrekvensen med 0,10–0,22 och ger en hastighetsökning på 10–20 procent jämfört med befintliga starka baslinjer. Det uppnår till och med 2,5–3 gånger den acceleration som vanliga avkodningsmetoder som inte använder utkast ger. Avgörande nog fungerar denna approach med befintliga ramverk för speculativ avkodning utan att kräva några ändringar i deras träningsprocesser, vilket gör den till en plug-and-play-uppgradering för skalbarhet.

Slutsatsen är tydlig: speculativ avkodning utvecklas från ett binärt system där man accepterar eller avvisar till en nyanserad, flerlagerad paradigm. Genom att matcha verifieringsinsatsen mot osäkerheten i förutsägelsen kan vi uppnå enorma vinster i inferenshastighet utan att offra noggrannheten. Denna metod erbjuder en generell och effektiv väg framåt för att skala upp stora språkmodeller, och bevisar att det ibland är det smartaste draget att låta en mindre modell göra det tunga lyftet.

Källa: arXiv:2606.12243

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.