AI-fart ökar med 85 procent utan kvalitetsförlust
Baserad på forskning av Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong
Tänk dig en AI-assistent som tänker snabbare utan att offra noggrannheten. Forskare har presenterat DSpark, ett nytt ramverk som dramatiskt ökar hastigheten med vilken stora språkmodeller genererar text. Genom att intelligent balansera mellan hastighet och precision lovar tekniken att göra AI-interaktioner omedelbara, även under hög belastning.
Den största utmaningen med dagens AI-system är att textgenerering token för token är långsam. Även om parallella utkastningsmodeller kan föreslå många tokens samtidigt, gissar de ofta fel eftersom de ignorerar hur ord hänger ihop. Det leder till en hög avvisningsgrad och slöseri med beräkningskraft. DSpark löser detta genom en semi-autoregressiv arkitektur. Den kombinerar ett snabbt parallellt grundläggande nätverk med en lättviktig sekventiell modul, vilket säkerställer att de genererade token är logiskt sammanhängande och därmed mer sannolika att accepteras.
Den verkliga innovationen ligger i hur DSpark hanterar verifiering. Istället för att blindt kontrollera varje föreslagen token använder systemet en verifiering baserad på konfidensplanering. Metoden justerar dynamiskt verifieringslängden utifrån den uppskattade sannolikheten för framgång och den aktuella systembelastningen. Detta förhindrar att systemet slösar kapacitet på tokens som sannolikt kommer att avvisas och optimerar genomströmningen i miljöer med hög konkurrens.
I live-tester med DeepSeek-V4 accelererade DSpark genereringshastigheten per användare med 60 till 85 procent jämfört med den etablerade produktionsbaslinjen (MTP-1). Ännu viktigare är att den upprätthöll prestandan under strikta interaktionskrav, vilket möjliggjorde hastighetsnivåer som tidigare varit omöjliga. Denna förändring i effektivitet markerar ett betydande framsteg för skalbara och responsiva AI-tjänster.