← Tillbaka till bloggen

På-policy för AI-inlärning är övervärderad

Baserad på forskning av Julianna Piskorz, Antonin Berthon, Mihaela van der Schaar

Vi har länge fått höra att on-policy-lärande är guldstandarden för att träna AI-modeller, med löften om bättre generalisering och mindre katastrofalt glömska. Men vad händer om denna allmänt spridda övertygelse är överdriven? En ny systematisk studie utmanar antagandet att det i sig självt är överlägset att använda en modellens egna genererade data, och avslöjar en mer komplex verklighet bakom hur dessa system faktiskt lär sig.

Forskarna genomförde ett kontrollerat experiment för att isolera den specifika effekten av rollout-policys under distilleringsprocessen, där en mindre modell lär sig av en större. Genom att oberoende variera policyn, riktningen på Kullback-Leibler-divergensen och inlärningshastigheten över modellfamiljerna Llama3 och Qwen2.5 samt resonemangsuppgifter inom vetenskap, medicin och aritmetik, sökte de att skilja policyns effekter från andra variabler. Denna rigorösa metodik möjliggjorde för dem att exakt peka ut vilka faktorer som driver prestandaförbättringar eller försämringar i den slutgiltiga modellen.

Resultaten var överraskande. I motsats till den allmänna uppfattningen spelade valet av rollout-policy inte den centrala roll som många antog. Istället var riktningen på KL-divergensen den främsta drivkraften för uppgiftsprestanda och täckning av utdata, medan inlärningshastigheten styrde hur mycket modellen glömde eller uppdaterade sina vikter. Forward KL visade sig vara markabelt robust mot förändringar i policyn och upprätthöll stark och stabil prestanda. Reverse KL var däremot mycket mer känslig och föredrog data genererad av studentmodellen själv. Även om on-policy-data hjälpte till med svårare varianter av Countdown-uppgiften i aritmetik initialt, försvann denna fördel ofta efter ytterligare förstärkningsinlärning.

Slutsatsen är tydlig: on-policy-rollouts är ingen magisk lösning. Deras värde beror kritiskt på det specifika målet, utvärderingsmiljön och de optimeringshyperparametrar som används. Istället för att blindt anta on-policy-metoder måste aktörerna noggrant överväga KL-riktningen och inlärningshastigheten, då dessa faktorer ofta är viktigare än källan till träningsdatan. Denna nyanserade förståelse kan forma om hur vi närmar oss effektiv och effektiv modellträning i framtiden.

Källa: arXiv:2609.35259

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.