Tillbaka till bloggen

Ny AI-arkitektur åtgärdar ytlig resonemang

Baserad på forskning av Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan

Tänk dig att din hjärna kunde minnas de komplexa, outtalade tankar den bearbetade innan den äntligen yttrade dem. Dagens AI-modeller, som är kända autoregressiva transformers, är förvånansvärt begränsade i detta avseende. De genererar text token för token, men slänger det mesta av sitt interna resonemangskapande vid varje steg. Endast det sista ordet skickas vidare, vilket gör att den rika, dolda beräkningsprocessen från föregående ögonblick försvinner i tomma intet. Denna smala feedbackloop innebär att modellen ofta glömmer sammanhanget i sin egen tankeprocess, vilket leder till ineffektivt och ibland ytligt resonemang.

Forskare har nu presenterat en lösning som kallas full-bandwidth transformer. Denna nya arkitektur vidgar den vertikala kanalen mellan avkodningsstegen genom att behålla den översta lagrets dolda tillstånd – modellens interna ögonblicksbild av dess nuvarande förståelse – och mata tillbaka den in i systemet. Istället för att slänga denna information, slår modellen ihop den med det nygenererade token med hjälp av en gated linear unit. Detta gör att icke-uttryckt beräkning kan återinträda i stacken med en frisk djupbudget. Avgörande nog bevarar denna förändring den standard transformer-strukturen och effektiviteten, vilket innebär att det inte krävs en komplett översyn av befintlig AI-infrastruktur.

Resultaten är slående. Genom att träna en-billion-parametrar-modeller på enorma mängder data fann forskarna att denna latenta feedbackmekanism förbättrar prestandan avsevärt inom matematik, programmering och instruktionföljande-uppgifter. Modellerna uppnår noggrannhet jämförbar med standardtransformers som tränades med ungefär 1,5 gånger mer data. Ännu imponerande är effektivitetsvinsten: dessa nya modeller producerar kortare resonemangsspår samtidigt som de behåller eller till och med förbättrar noggrannheten. Detta tyder på att AI kan tänka tydligare och mer koncist genom att behålla mer av sitt interna sammanhang, snarare än bara sitt slutliga utdata.

Slutsatsen är klar: att ge AI-modeller tillgång till sina egna dolda tankar under generering leder till smartare, snabbare och mer effektivt resonemang. Genom att vidga feedbackloopen från endast det uttalade ordet till att inkludera det outtalade interna tillståndet, låser vi upp en ny nivå av förmåga utan att öka beräkningskostnaderna. Denna metod erbjuder en kraftfull väg framåt för att bygga mer kapabla språkmodeller som kan resonera djupt utan att behöva exponentiellt mer träningsdata.

Källa: arXiv:2608.08888

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.