Tillbaka till bloggen

Från full uppmärksamhet till sparst modell på 100 steg

Baserad på forskning av Yanke Zhou, Yiduo Li, Hanlin Tang, Maohua Li, Kan Liu

Långkontext-AI har stött på en vägg. De kvadratiska kostnaderna för att bearbeta enorma mängder text saktar ner modellerna i grus och tvingar fram ett smärtsamt val mellan hastighet och intelligens. Men vad om lösningen har legat framför ögonen på oss hela tiden?

Forskare har upptäckt att vanliga stora språkmodeller är naturligt glesa. Istället för att bygga komplexa nya arkitekturer har de funnit att endast en bråkdel av uppmärksamhetsheadarna behöver fullständig kontextbearbetning. Genom att identifiera dessa specifika headar och använda en lättviktig indexering för att hämta relevanta tokens kan de drastiskt minska beräkningsmässigt slöseri med minimal anpassning.

Genombrottet ligger i effektiviteten. Traditionella metoder kräver dyr inbyggd gles träning eller heuristiska genvägar som försämrar noggrannheten. Den nya metoden, kallad RTP:urbo, utnyttjar modellens inbyggda glesighet. Den behåller hela minnescachen endast för hämtningheadar och använder dynamiskt urval för att fokusera på det som betyder något. Resultatet är en slående 9,36 gånger snabbare prefyllning vid en miljon tokens samt en 2,01 gånger högre avkodningshastighet, allt medan närmast förlustfri noggrannhet bevaras.

Robust gles inferens kräver inte längre dyr omträning. Vanliga modeller med full uppmärksamhet kan förvandlas till extremt effektiva system med endast några hundra träningssteg. Detta bevisar att vi kan få både hastighet och precision, och förvandlar en stor flaskhals till en hanterbar funktion.

Källa: arXiv:2605.16928

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.