Tillbaka till bloggen

AI slösar bort hälften av sin beräkningskraft

Baserad på forskning av Vishesh Tripathi, Abhay Kumar

Tänk dig en hjärna som bara vaknar till liv för svåra problem. Det är löftet med Grouped Query Experts, en ny metod som är designad för att lösa en av de största flaskhalsarna i modern artificiell intelligens. När språkmodeller bearbetar längre texter exploderar de beräkningsmässiga kostnaderna eftersom varje ord för närvarande interagerar med varje annat ord. Denna kvadratiska skalning är inte bara långsam; den är extremt ineffektiv och slösar energi på enkla token som inte behöver någon djup analys.

Kärnproblemet ligger i hur Transformer-modeller hanterar uppmärksamhet (attention). Standarddense uppmärksamhet lägger samma tunga beräkningsbelastning på varje enskild token, oavsett om den är komplex eller trivial. Forskare föreslår Grouped Query Experts för att lösa detta genom att lägga ett Mixture-of-Experts-system ovanpå grouped-query-uppmärksamhet. I denna uppställning väljer en smart router endast några få specialiserade query-head-experter för varje token baserat på dess svårighetsgrad. Samtidigt förblir key-value-heads aktiva och täta, vilket bevarar minneseffektiviteten som gör nuvarande modeller snabba. Det innebär att systemet inte kastar bort fördelarna med den befintliga arkitekturen; det slutar helt enkelt att slösa beräkningskraft på enkla uppgifter.

Resultaten är slående. I tester med en fast budget på 30 miljarder token vid en skala på 250 miljoner parametrar matchade denna nya metod noggrannheten hos standardmodeller som alltid är aktiva, samtidigt som endast hälften av query-heads aktiverades per token. Genom att halvera den aktiva beräkningen utan att offra prestanda erbjuder teknologin en tydlig väg till snabbare, billigare och mer skalbar AI. När sekvenserna blir längre blir denna selektiva aktivering inte bara en trevlig funktion, utan en nödvändighet för att hålla stora språkmodeller livskraftiga i verkliga världen.

Källa: arXiv:2606.20945

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.