Looping Transformers sänker energiförbrukningen med 18%
Baserad på forskning av Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu
Tänk dig att träna en enorm AI-modell men använda betydligt mindre energi för att uppnå bättre resultat. Det är löftet med SMELT, en ny arkitektonisk approach som utmanar den vedertagna sanningen att större alltid är bättre. Genom att ompröva hur transformer-lager organiseras har forskare hittat ett sätt att pressa ut mer intelligens ur samma beräkningsbudget, vilket potentiellt kan förändra hur vi bygger effektiva stora språkmodeller.
Kärnan i idén är Loopade Transformers, som ökar modellens effektiva djup genom att iterera igenom en gemensam block av lager flera gånger istället för att stapla dem linjärt. Tidigare studier har ofta förväxlat denna arkitektoniska fördel med att helt enkelt kasta mer beräkningskraft på problemet. För att hantera detta designade forskarna SMELT, eller Sparse MoE Transformer with middle layers Looped Twice. De säkerställde att varje version av modellen använde samma mängd processkraft, parametrar och minnescache. Strikt kontroll möjliggjorde att de isolerade den verkliga vinsten med looping, och bevisade att återanvändning av lager inte bara är ett knep utan en livskraftig väg till effektivitet.
Resultaten var slående. När modellen skalades upp till 54 miljarder icke-inbäddningsparametrar visade SMELT ett snabbare fall i förlust relativt till beräkningsanvändningen. Detta översätts till en besparing på 6,8 till 18,0 procent i tränings-FLOP på den optimala fronten. Fördelarna var inte bara teoretiska; de överfördes till verkliga benchmark-test, särskilt inom programmeringsuppgifter. Modellen presterade ännu bättre med längre kontexter och fler exempel, drivet av en mekanism där den andra passagen genom lagren minskar uppmärksamhetssänkor och fokuserar bearbetningen på relevant innehåll.
Denna forskning erbjuder ett praktiskt recept för AI-utvecklingens framtid. Den bevisar att looping kan förbättra transformers även under strikta budgetbegränsningar, och förvandlar djupåteranvändning till mätbara vinster. När branschen tävlar mot större modeller, tyder SMELT på att smartare arkitekturdesign kan leverera överlägsen prestanda utan den exponentiella kostnaden, vilket gör kraftfull AI mer tillgänglig och hållbar.