Enkel trick besegrar guldmedaljmatte
Baserad på forskning av Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li
Guldmedaljer i världens tuffaste matematik- och fysiktävlingar krävde förr enorma, specialiserade system. Nu har forskare visat att ett överraskande enkelt recept kan förvandla en vanlig modell till en lösningsmaskin på olympisk nivå. Genombrottet utmanar den vedertagna uppfattningen att elitmässig resonemangsförmåga kräver komplexa, fragmenterade arkitekturer.
Forskarteamet utvecklade en enhetlig metod för att uppgradera resonemangsmodeller. De började med att träna modellen att noggrant granska sitt eget arbete genom ett curriculum baserat på omvänd perplextitet. Detta inlärde en vana av självkorrigering. Därefter använde de en tvåstegsprocess för förstärkningsinlärning. Den första fasen fokuserade på verifierbara belöningar, medan den andra finjusterade logiken på bevisnivå. Till sist ökade de prestandan med skalning vid testtid, vilket tillät modellen att tänka längre och djupare under problemlösningen.
Resultatet är en modell med 30 miljarder parametrar som heter SU-01. Den uppnår guldmedaljnivå på International Mathematical Olympiad och International Physics Olympiad. Det som slår en är dess effektivitet. Modellen tränades på endast 340 000 korta trajektorier och 200 steg för förstärkningsinlärning. Trots detta blygsamma träningsunderlag hanterar den problem med resonemangskedjor som överstiger 100 000 token. Den generaliserar också väl till vetenskapliga områden bortom matematik och fysik.
Den viktigaste slutsatsen är att rigorös resonemangsförmåga inte behöver vara komplicerad. Genom att fokusera på självkontrollerande beteenden och skalbara träningssteg har forskarna bevisat att problemlösning på hög nivå kan uppnås med ett enkelt, enhetligt tillvägagångssätt. Detta demokratiserar tillgången till elitnivåns resonemangsförmåga och visar att metoden är viktigare än ren skala.