Tillbaka till bloggen

AI tänker tyst

Baserad på forskning av Guancheng Tu, Xiangjun Fu, Suhao Yu, Yao Tang, Haoqiang Kang

Stora språkmodeller är kända för att vara pratsamma och slösa tid samt beräkningskraft på utförliga steg-för-steg-förklaringar. Men vad händer om modellen kunde tänka snabbare genom att hålla sin resonemangskedja dold i sina egna neurale vikter? Forskare har utvecklat en ny metod som gör det möjligt för AI att bearbeta komplex logik tyst i bakgrunden, vilket potentiellt gör modellerna betydligt smartare och billigare att driva.

Det centrala problemet med dagens kedjor av resonemang (chain-of-thought) är att de tvingar modellen att verbalisera varje mellanliggande steg. Detta skapar en flaskhals där AI:n måste generera diskreta texttoken innan den går vidare till nästa logisk punkt, även om den underliggande tankeprocessen fortfarande är under bildning. Det nya tillvägagångssättet, kallat NF-CoT, erbjuder en alternativ lösning med hög bandbredd genom att utföra dessa mellanliggande beräkningar i kompakta, kontinuerliga tillstånd. Istället för att skriva ut varje tanke använder modellen normaliseringsflöden för att modellera dessa kontinuerliga tankar, vilket möjliggör snabbare och mer effektiv intern bearbetning.

Denna design löser en stor teknisk utmaning: de flesta tidigare försök till tyst resonemang bröt mot det standardiserade sättet som språkmodeller genererar text. NF-CoT integreras sömlöst med befintlig infrastruktur och bevarar den inbyggda vänster-till-höger-genereringen samt kompatibiliteten med nyckel-värde-cache som driver modern avkodning. Modellen genererar kontinuerliga tankepositioner tillsammans med vanliga textpositioner inom samma kausala flöde. Det innebär att modellen kan dra nytta av probabilistisk sampling och exakt sannolikhetsberäkning utan att offra tillförlitligheten och hastigheten i traditionell autoregressiv generering.

Resultaten är lovande för praktiska tillämpningar, särskilt inom kodgenerering. På benchmark-test för kodgenerering ökade denna metod andelen godkända lösningar jämfört med både explicita kedjor av resonemang och tidigare baslinjer för latent resonemang. Viktigare än detta är att metoden kraftigt minskade kostnaden för mellanliggande resonemang. Genom att låta AI:n tänka i täta, kontinuerliga vektorer snarare än sparsamma texttoken får vi bättre prestanda med mindre beräkningsmässig slöseri, vilket markerar ett betydande steg mot mer effektiva och kraftfulla språkmodeller.

Källa: arXiv:2606.06447

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.