Tillbaka till bloggen

Ny AI-metod sänker minneskostnaderna

Baserad på forskning av Jushi Kai, Zhuiri Xiao, Alexandra Birch, Zhouhan Lin

Storspråkmodeller blir allt smartare på att resonera, men den nya förmågan har ett högt pris: minnesanvändningen sväller. När dessa modeller hanterar komplexa problem genererar de enorma mängder data som måste lagras i det som kallas KV-cache. Lagringsbehovet växer så snabbt att det riskerar att bli en flaskhals för prestandan, vilket tvingar forskare att hitta sätt att komprimera denna data utan att modellens skärpa försämras.

Den nuvarande standarden för komprimering av denna data bygger på uppmärksamhetsviktningar (attention weights), som uppskattar vilka tokens som är viktiga baserat på hur nära de relaterar till det omedelbara sammanhanget. Denna metod har dock en blind fläck. Den fokuserar kraftigt på närliggande kopplingar medan den ignorerar informations-teoretiska signaler, som prediktiv osäkerhet. Med andra ord prioriterar befintliga metoder tokens som är relevanta just nu, men de missar ofta de tokens som är avgörande för att förstå den större bilden längre fram.

Forskare har nu introducerat en ny måttstock kallad Forward Influence för att åtgärda detta förbiseende. Genom att mäta hur komprimerade tokens påverkar framtida sammanhang upptäckte de en överraskande sanning: tokens med hög prediktiv osäkerhet har ett mycket starkare inflytande på avlägsna framtida sammanhang än de som väljs ut av traditionella uppmärksamhetspoäng. Denna insikt ledde till skapandet av InfoKV, ett ramverk som kombinerar dessa osäkerhetspoäng med traditionella uppmärksamhetsmått. Det tittar på hur representationer utvecklas över lager och integrerar entropipoäng för att avgöra vilken data som ska behållas.

Tester på långkontext-resonemangsbaser med modeller som Llama-3.1, Llama-3.2 och DeepSeek-R1 visar att InfoKV konsekvent överträffar befintliga metoder. Detta är inte bara en mindre justering; det är en fundamental förändring i hur vi värderar information inom AI. Genom att prioritera tokens som driver långsiktigt resonemang bevisar denna approach att förstå prediktiv osäkerhet är lika viktigt som att förstå det omedelbara sammanhanget. För framtiden av effektiv AI innebär detta att vi kan hantera längre och mer komplexa uppgifter utan att minneskostnaderna spirar ur kontroll.

Källa: arXiv:2606.26875

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.