JetSpec slår nya hastighetsrekord för LLM
Baserad på forskning av Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao
Stora språkmodeller är kraftfulla, men de är smärtsamt långsamma. De genererar text token för token, vilket skapar en flaskhals som begränsar hur snabbt de kan svara. En ny teknik som kallas JetSpec lovar att accelerera autoregressiva stora språkmodeller (LLM) genom att kasta ut flera token och verifiera dem parallellt. Detta adresserar skalbarhetsbegränsningar som tidigare har hindrat spekulativ avkodning.
Kärnan i idén bygger på spekulativ avkodning, en metod som försöker lura systemet genom att förutspå flera token i förväg och sedan verifiera dem parallellt. Problemet är att denna metod stöter på en takpunkt för skalbarhet. Om man förutspår för många token blir kostnaden för att generera dem större än nyttan, särskilt när modellen avvisar de flesta av sina gissningar. Tidigare metoder kämpade med en grundläggande avvägning: autoregressiva förutspårare var noggranna men långsamma, medan snabbare bidirektionella förutspårare ofta gav inkonsekventa gissningar som slösade beräkningsresurser.
JetSpec bryter denna dilemma genom att kombinera det bästa från båda världarna. Den använder en specialiserad förutspåringshuvud som tittar på den frysta målmodellens interna tillstånd för att generera kandidatträd. Till skillnad från tidigare metoder säkerställer den att dessa kandidater är kausalt betingade, vilket innebär att varje gissning logiskt följer de föregående. Denna överensstämmelse gör att systemet kan acceptera längre sekvenser av token i ett enda verifieringssteg, vilket omvandlar en större förutspåringsbudget direkt till högre hastighet.
Resultaten är slående. På standardbenchmark för matematik, kodning och chatt överträffar JetSpec befintliga baslinjer för spekulativ avkodning. I verkliga tester på kraftfulla H100-GPUer uppnådde den en 9,64-gångars hastighetsökning på komplexa matematiska problem och en 4,58-gångars hastighetsökning på konversationslexika. Genom att integreras med vLLM minskar ramverket även latensen under realistiska serverbelastningar, vilket bevisar att spekulativ avkodning äntligen kan skala bortom sina tidigare gränser.