← Tillbaka till bloggen

Ny AI minskar minnesbehovet med 75 procent

Baserad på forskning av DeepSeek-AI, Anyi Xu, B. Li, Bangcai Lin, Bing Xue

Tänk dig att köra en enorm AI-modell som kan hantera en miljon tokens i kontexten utan att smälta hårdvaran. I åratal har den enorma mängd data som krävs för långa konversationer varit den akilleshäl som har bromsat effektiv AI. När modellerna blir mer kapabla kräver de mer minne och bandbredd, vilket skapar en flaskhals som hotar att stoppa framstegen. Nu har forskare presenterat en ny arkitektur som minskar minnesanvändningen med en faktor fyra, vilket potentiellt kan låsa upp nästa generation av långsiktiga agenter.

Kärnan i innovationen ligger i hur modellen hanterar sitt nyckel-värde-cache, det tillfälliga minne som används för att spåra kontexten under genereringen. Traditionella modeller pressar högbandbreddsminne och lagring när konversationerna blir längre. För att lösa detta kombinerar det nya systemet cacheåteranvändning över lager med extremt effektivt FP4-cachning. Detta gör att modellen kan upprätthålla en global cache på endast 890 bytes per token. Det är ungefär en fjärdedel av storleken på dess föregångare, DeepSeek-V4-Flash. Dessutom minskar en specialiserad optimering för drift den persistenta cachen som lagras på långsammare SSD-diskar till en åttondel av föregående storlek.

Överraskningen här är inte bara kompressionen, utan prestandan. Trots att modellen bär en betydligt mindre minnesbörda levererar den betydligt bättre resultat än baslinjen. Den uppnår detta genom att endast aktivera 16 miljarder parametrar per token under genereringen och bara 8 miljarder under den initiala bearbetningsfasen. Denna design skär kraftigt av de beräkningsmässiga kostnaderna för agentic arbetsbelastningar, där effektivitet är avgörande. Modellen var förtränad på 45 biljoner tokens, vilket säkerställer att den behåller starka förmågor över olika text- och multimodala scenarier.

Slutsatsen är tydlig: minneseffektivitet behöver inte längre gå ut över prestanda. Genom att tänka om hur kontext lagras och hämtas har forskare visat att enorma kontextfönster är möjliga utan förbjudande hårdvarukrav. Detta genombrott banar väg för mer prisvärda och kraftfulla AI-agenter som kan hantera komplexa, långvariga uppgifter utan att kräva exorbitant infrastruktur.

Källa: arXiv:2609.19969

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.