AI blir 14 gånger snabbare med ny teknik
Baserad på forskning av Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu
Tänk dig en AI som kan läsa igenom hela en kodbas eller minnas varje detalj från ett års konversationer utan att bromsa in. Dagens stora språkmodeller stöter på en hård gräns när kontexten blir för lång, eftersom deras uppmärksamhetsmekanismer blir för dyra i beräkning. Den kvadratiska kostnaden gör det nästan omöjligt att bearbeta hundratusentals tokens i produktionsskala, vilket i praktiken begränsar AI:n:s användningsområden för komplexa uppgifter som kräver stort minne.
Forskare har nu presenterat MiniMax Sparse Attention (MSA) för att bryta denna flaskhals. Istället för att tvinga modellen att väga varje enskilt token mot alla andra använder denna nya metod ett blockvis sparsamt tillvägagångssätt baserat på Grouped Query Attention (GQA). En lättviktig indexgren bedömer nyckel-värde-block och väljer oberoende ut en Top-k-delmängd för varje GQA-grupp. Huvudgrenen utför sedan exakt blockvis sparsam uppmärksamhet endast över de valda blocken. Denna design prioriterar enkelhet och skalbarhet, vilket gör att den kan köras effektivt över ett brett spektrum av GPU:er utan att kräva komplexa arkitektoniska ombyggnationer.
Överraskningen ligger i de enorma effektivitetsvinster som uppnåtts genom att designa algoritmen tillsammans med specialanpassade GPU-exekveringsvägar. Genom att använda exp-free Top-k-val och optimera utnyttjandet av tensor-kärnor omvandlar systemet teoretisk sparsamhet till verklig hastighet. På en modell med 109 miljarder parametrar och inbyggd multimodal träning minskar metoden beräkningskostnaden per token med 28,4 gånger vid 1 miljon tokens kontext. I praktiken innebär detta en 14,2 gånger snabbare prefill och 7,6 gånger snabbare avkodning i realtid på H800-hårdvara, vilket gör hantering av extremt lång kontext inte bara möjlig, utan också snabb.
Slutsatsen är tydlig: sparsam uppmärksamhet är inte längre en teoretisk nisch utan ett praktiskt nödvändigt verktyg för framtidens AI. Med en öppen källkodsinferenskärna och en offentligt tillgänglig modell i produktionsklass har forskare visat att vi nu kan hantera enorma kontexter utan att offra varken hastighet eller noggrannhet. Detta banar väg för agentic arbetsflöden och system med beständigt minne som tidigare var för kostsamma att implementera.