Tillbaka till bloggen

RL är överdrivet: SFT vinner med 60 gånger mindre kraft

Baserad på forskning av Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang

De flesta utgår från att komplex förstärkningsinlärning (reinforcement learning) är den hemliga ingrediensen för att lära AI att resonera. Men vad händer om hemligheten inte ligger i den sofistikerade belöningsalgoritmen, utan snarare i att mata modellen med mer varierad data på ett enkelt sätt? Denna fråga utmanar de dyra och beräkningskrävande trender som dominerar den moderna AI-utvecklingen.

Forskarna har undersökt förstärkningsinlärning för nästa stegs-resonemang, en metod som är utformad för att hjälpa modeller att lära sig av rå text, som läroböcker, som saknar explicita steg-för-steg-spår av tänkande. Idén är att belöna modellen för att den förutspårar nästa del av en lösning, vilket i praktiken tvingar den att generera ett underförstått resonemang. Kritiker menar dock att det verkliga värdet kanske bara ligger i bättre exponering för denna rika data, snarare än i det komplexa RL-ramverket i sig.

För att testa detta jämförde forskarteamet RL-approchen med en överraskande enkel alternativ: Mixed SFT. Denna metod kombinerar helt enkelt den råa resonemangsdatan med standardexempel på långsamma tankekedjor (long-chain-of-thought) i ett enda steg för övervakad träning. Resultaten var chockerande. Mixed SFT inte bara överträffade den komplexa RL-metoden, det gjorde det med över sextio gånger mindre beräkningskraft. Denna fördel gällde både för resonemangsuppgifter inom samma domän och för uppgifter utanför domänen.

Studien ger en viktig varning för utvecklare som jagar prestandavinst. Högre noggrannhet innan förstärkningsinlärning garanterar inte bättre resultat efteråt. Hittade tyder på att enklare och mer effektiva träningspipelines kan besegra komplexa, resurskrävande metoder. Det är dags att ompröva om vi optimerar för faktisk intelligens eller bara för dyra beräkningsbudgetar.

Källa: arXiv:2608.23256

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.