Tillbaka till bloggen

VideoMLA minskar minnesanvändningen med 92 %

Baserad på forskning av Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay

Videoframställning har stött på en vägg. När modellerna försöker skapa längre och mer sammanhängande klipp exploderar minnesbehovet för att hålla reda på sammanhanget, vilket tvingar fram en kompromiss mellan längd och hastighet. Nu har forskare knäckt en viktig flaskhals, vilket möjliggör diffusion av videosekunder utan den vanliga fördröjningen.

Forskargruppen presenterar VideoMLA, en metod som drastiskt minskar minnesavtrycket vid videoproduktion. Standardmodeller sparar separat data för varje uppmärksamhetshead, vilket kräver enorma mängder RAM-minne. VideoMLA ersätter detta med ett delat lågrankat innehållslager och en förenklad positionell nyckel. Denna smarta kompression sänker användningen av KV-cache-minnet med 92,7 procent, vilket gör att modellen kan bearbeta betydligt mer information per token.

Överraskningen ligger i varför detta fungerar. Teorin säger att en så tung kompression borde förstöra kvaliteten, eftersom videodata för uppmärksamhet inte är lågrankat av naturen. Ändå behåller VideoMLA hög trohet. Forskarna fann att det är flaskhalsen i sig, inte den ursprungliga datastrukturen, som styr prestandan. Träningen anpassar modellen för att passa inom detta tighta budgetramverk, vilket bevarar den visuella kvaliteten även vid kompressionsförhållanden som borde misslyckas teoretiskt.

Resultaten är konkreta. VideoMLA matchar befintliga baslinjer för korta videor samtidigt som det levererar de bästa totala betygen för långsiktiga generationer. Det ökar också bearbetningshastigheten med 23 procent på högpresterande hårdvara. Detta genombrott bevisar att effektiv minneshantering är lika avgörande som modellarkitektur för generativ videos framtid.

Källa: arXiv:2605.30351

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.