Tillbaka till bloggen

EfficientRollout minskar LLM-träningens eftersläpning

Baserad på forskning av Minseo Kim, Minjae Lee, Seunghyuk Oh, Kevin Galim, Donghoon Kim

Reinforcement learning (RL) har etablerats som en central paradigm för efterträning av stora språkmodeller (LLM), vilket möjliggör starka resonemangsförmågor och agentic förmågor. Trots detta förblir generationen av rolloutar en dominerande flaskhals för latens, eftersom autoregressiv sampling dekodar svar sekventiellt och en liten mängd långa generationer med långsvansfördelning ofta avgör den totala sluttiden.

Speculativ dekoder (SD) erbjuder ett naturligt sätt att adressera denna flaskhals. Det är en väletablerad teknik för att leverera statiska LLM:er som minskar latensen genom att snabbt utkast tokens och acceptera dem via parallell verifiering, samtidigt som målmodellens fördelning bevaras. Denna metod är dock inte direkt överförbar till RL-rollouts av två skäl. För det första gör den utvecklande målpolicyn att en fast utkastare alltmer missanpassas modellens utdatafördelning. För det andra krymper de aktiva batchstorlekarna under rolloutdekoderingen, vilket flyttar dekoderingen från beräkningsbegränsade till minnesbegränsade regimeer där parallell verifiering inte kan utnyttja underutnyttjad beräkningskraft.

För att accelerera RL-rollouts krävs därför både en utkastare som förblir effektiv under långa, högtempererade generationer från en utvecklande policy, samt en systemmedveten användning av SD som undviker beräkningsbegränsade regimeer. Vi presenterar EfficientRollout, ett systemmedvetet ramverk för själv-speculativ dekoder (self-SD) designat för att fylla detta gap.

EfficientRollout inducerar en kvantiserad utkastare från målmodellen, det vill säga själv-speculativ dekoder, och håller den kopplad till den utvecklande policyn utan separat förträning eller online-anpassning av utkastaren. Ramverket koordinerar dessutom en systemmedveten SD-avstängningspolicy med en acceptansmedveten anpassning av utkastningslängd. Detta möjliggör spekulation endast i gynnsamma regimeer och matchar utkastningsbudgeten mot den utvecklande utkastarens kvalitet.

EfficientRollout minskar rollout-latens med upp till 19,6 procent och slutet-till-slut-latens med 12,7 procent jämfört med en accelererad AR-rollout-baseline, samtidigt som den slutliga modellkvaliteten bevaras.

Källa: arXiv:2606.18967

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.