← Tillbaka till bloggen

Ny AI-metod halverar minnesanvändningen

Baserad på forskning av Vishesh Tripathi, Abhay Kumar, Ramsha Khan

Transformer-modellerna kvävs av sitt eget minne. När dessa AI-system genererar text måste de ständigt lagra och hämta enorma mängder data, vilket skapar en flaskhals som saktar ner svarstiden och tömmer resurserna. Den så kallade KV-cachen, som är avgörande för att hålla reda på sammanhanget, växer med varje producerat ord och gör långa konversationer eller komplexa resonemang smärtsamt långsamma.

Forskare har nu presenterat Grouped Value Attention för att lösa denna effektivitetskris. Tidigare metoder, såsom grouped-query attention, minskade kostnaderna genom att dela på data, men de lagrade fortfarande både nycklar och värden vid varje steg. Den nya metoden lagrar grupperade värden och rekonstruerar de nödvändiga nycklarna med hjälp av en inlärd linjär avbildning. Detta smarta knep gör att systemet kan hoppa över att materialisera innehållsnycklar under avkodningen, och förlitar sig istället på en liten, separat cachad positionsnyckel för att upprätthålla sammanhanget.

Resultaten är slående. Metoden halverar nästan den persistenta cachens storlek och minskar antalet skalärer med cirka 45 till 47 procent jämfört med matchad Grouped-Query Attention. Trots denna drastiska komprimering behåller modellen en nästan identisk noggrannhet mot standardbenchmarks, vilket bevisar att man inte behöver offra prestanda för hastighet. Utvecklingsteamet har skräddarsytt avkodningskärnor för att översätta denna kompakta representation till snabbare inferens, och en open-source-lansering planeras inom kort för att sprida denna effektivitetsökning till hela gemenskapen.

Källa: arXiv:2609.13285

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.