Tillbaka till bloggen

Domino femfaldigat AI-hastighet utan avkall på noggrannhet

Baserad på forskning av Jianuo Huang, Yaojie Zhang, Qituan Zhang, Hao Lin, Hanlin Xu

Tänk dig att få din AI att svara fem gånger snabbare utan att offra noggrannheten. Det är löftet från ett nytt ramverk som kallas Domino, som tar itu med en av de största flaskhalsarna i moderna stora språkmodeller: den långsamma processen att generera text token för token. Genom att ompröva hur dessa modeller utkastar och verifierar text har forskarna hittat ett sätt att få AI:n att kännas omedelbart responsiv, även för komplexa uppgifter.

Stora språkmodeller genererar vanligtvis text autoregressivt, vilket innebär att de förutspår nästa ord baserat på de föregående. Denna sekventiella natur är i grunden långsam. För att påskynda processen används en teknik som kallas spekulativ avkodning, där modellen gissar på flera tokens samtidigt och sedan verifierar dem parallellt. Detta skapar dock en knivskarp avvägning. Om modellen gissar sekventiellt är den noggrann men långsam. Om den gissar parallellt är den snabb men gör ofta misstag eftersom den ignorerar det kausala sambandet mellan orden. Denna spänning har länge begränsat hur mycket snabbare dessa modeller faktiskt kan köras i praktiken.

Domino löser detta genom att separera de två processerna. Den använder först en parallell ryggrad för att snabbt generera ett grovt utkast till hela textblocket. Därefter förfinar en lättviktig komponent detta utkast genom att lägga till den nödvändiga kausala kontext som parallella metoder vanligtvis missar. För att säkerställa att denna hybrida approach förblir stabil och noggrann introducerade forskarna en specialiserad träningsmetod som gradvis flyttar fokus från den snabba parallella utkastet till den precisa kausala korrigeringen. Denna smarta separation låter systemet dra nytta av hastigheten hos parallell bearbetning utan priset av dålig noggrannhet.

Resultaten är betydande. Tester på Qwen3-modeller visar att Domino uppnår en hastighetsökning på upp till 5,49 gånger i slutet-till-slut-inferens under Transformers-bakgrunden och en förbättring av genomströmningen med upp till 5,8 gånger under SGLang-serving. Detta genombrott tyder på att vi äntligen kan ha kakan och äta den också: den snabba genereringen hos spekulativ avkodning kombinerat med precisionen hos autoregressiv modellering, vilket gör AI-interaktioner märkbart snabbare och mer effektiva för vardagsanvändare.

Källa: arXiv:2605.29707

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.