Tillbaka till bloggen

Tiny AI slår superdatorer med nytt minnestrick

Baserad på forskning av Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami, Andrea Maracani, Ignacio Castro

Att köra en AI-hjärna i superdatorklass på din smartphone, som löser komplexa pussel snabbare än molnet. I åratal har detta varit den heliga gralen inom edge computing, men den tunga beräkningskostnaden för stora språkmodeller (LLM) har hållit drömmen på avstånd. Nu förvandlar en ny teknik, DuoMem, den drömmen till en praktisk verklighet. Den gör det möjligt för kompakta enheter att hantera uppgifter som tidigare krävde enorma serverfarmar.

Kärnproblemet är att LLM-agenter behöver enorma mängder minne och beräkningskraft för att navigera i flerstegsprocesser. DuoMem löser detta genom ett ramverk för distillation i två rum, där kunskap överförs från en stor lärarmodell till en liten elevmodell. Det fungerar på två sätt: Först matas den lilla modellen med högkvalitativt procedurminne genererat av läraren, vilket i praktiken ger den en facitlista. Därefter fine-tunes man lätta adaptorer på eleven för att efterlikna lärarens framgångsrika beslutsbanor. På så sätt lär sig den lilla modellen hur man tänker, inte bara vad man ska säga.

Resultaten är slående. När den testades på en utmanande benchmark för beslutsfattande i fysiska miljöer, sköt elevmodellen med fyra miljarder parametrar sin framgångsgrad i höjden från en ynklig 4,3 procent till 77,9 procent. Denna prestation nästan utjämnar klyftan till lärarmodellen med 72 miljarder parametrar, som nådde 87,1 procent. Det bästa är att elevmodellen lägger till färre än 10 miljoner träningsbara parametrar och använder endast några megabyte minne. Den är inte bara mindre; den är också betydligt snabbare och slutför uppgifter mer än tre gånger snabbare än den jättelika lärarmodellen i realtid.

Detta genombrott innebär att avancerade AI-agenter äntligen kan köras i realtid på resursbegränsade edge-enheter. Genom att kombinera bättre minnesinput med effektiv parameterjustering har forskarna skapat ett system som är både högpresterande och oerhört lättviktigt. När vi rör oss mot att distribuera AI överallt bevisar DuoMem att du inte behöver en superdator för att lösa komplexa problem – du behöver bara rätt sätt att lära en liten modell att tänka stort.

Källa: arXiv:2606.29961

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.