Tillbaka till bloggen

xLSTM slår Mamba-2 och DeltaNet i effektivitetsstriden

Baserad på forskning av Anamaria-Roberta Hartl, Levente Zólyomi, David Stap, Pieter-Jan Hoedt, Niklas Schmidinger

Transformers dominerar modern sekvensmodellering, men deras kvadratiska uppmärksamhet (attention) innebär en betydande beräkningsmässig kostnad. Arkitekturer med subkvadratisk komplexitet erbjuder en skalbar alternativ väg. Det är dock fortfarande oklart vilka designval som ger de mest effektiva sekvensmodellerna.

Vi jämför tre ledande tillvägagångssätt: xLSTM, Mamba-2 och Gated DeltaNet. Modellerna utvärderas på uppgifter med komplexa beroenden: (1) förträning av kodmodeller, (2) distillation av kodmodeller från stora språkmodeller och (3) förträning av grundmodeller för tidsserier. I alla dessa sammanhang levererar xLSTM den starkaste prestandan.

För att förklara xLSTMs fördel presenterar vi en enhetlig formulering och analyserar de underliggande arkitektoniska mekanismerna, med fokus på tillståndsövervakning och minnesdynamik. Resultaten visar att xLSTM möjliggör mer flexibel och stabil minneskorrigering genom sitt gatingschema. Vi bekräftar dessa fynd på kontrollerade syntetiska uppgifter för längdgeneralisering. Sammantaget indikerar våra resultat att xLSTMs framgång på komplexa uppgifter härrör från robust tillståndsövervakning och ackumulering.

Källa: arXiv:2606.12364

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.