Tillbaka till bloggen

Sluta gissa blockstorlekar i AI

Baserad på forskning av Hao Zhang, Yiming Hu, Yong Wang, Mingqiao Mo, Xin Xiao

Tänk dig att snabba upp din AI:s svarstid utan att offra en enda bit av noggrannheten. Det är löftet bakom speculativ avkodning, en teknik där en snabb, lättviktig modell gissar nästa ord medan en långsammare, smartare modell verifierar dem. Det är en smidig lösning som har blivit avgörande för att stora språkmodeller ska kännas omedelbara, men den har stött på en vägg. De flesta nuvarande system använder en stel, en-stor-pass-alla-metod för hur många ord de gissar på samtidigt, och ignorerar därmed att olika indata kräver olika strategier.

Forskare har identifierat en kritisk brist i denna standardmetod. Befintliga metoder utgår från en fast blockstorlek för generering av kandidattokens, och behandlar varje indata som om det kräver samma mängd parallell bearbetning. Antaget är suboptimalt. Sanningen är att den ideala blockstorleken varierar från exempel till exempel. Genom att analysera datan upptäckte forskarna att dessa optimala värden inte är slumpmässiga; de klumpar sig kring specifika träningsstorlekar och skapar ett strukturerat, lågdimensionellt beslutsrum. Det innebär att systemet inte behöver söka blindt. Det kan lära sig att förutspå den perfekta blockstorleken för varje specifikt fall baserat på den initiala kontext det får.

För att lösa problemet utvecklade teamet BlockPilot, en plug-and-play-mekanism som anpassar sig i realtid. Istället för att gissa blindt tittar BlockPilot på prefyllnadsrepresentationen av indata och förutspår den optimala blockstorleken med minimal overhead. Denna förutsägelse sker endast en gång efter den initiala bearbetningsfasen, vilket gör att den kan integreras sömlöst i befintliga arbetsflöden utan att sänka hastigheten. Resultaten är slående. På Qwen3-4B-modellen uppnådde denna adaptiva metod en acceptanslängd på 5,92 och levererade en 4,20 gånger snabbare bearbetning vid temperaturen 1. Det bevisar att låta modellen bestämma hur många tokens som ska utkastas, snarare än att tvinga fram en fast regel, frigör betydande effektivitetsvinster.

Slutsatsen är tydlig: flexibilitet slår stelhet inom AI-inferens. Genom att behandla valet av blockstorlek som ett lättviktigt policyinlärningsproblem visar BlockPilot att små, adaptiva förändringar kan ge enorma prestandaförbättringar. När AI-modellerna fortsätter att växa kommer förmågan att dynamiskt justera bearbetningsstrategier baserat på varje frågas specifika behov att vara avgörande. Denna forskning flyttar paradigmet från statisk optimering till instansanpassad intelligens, och banar väg för snabbare, mer responsiva AI-system som verkligen förstår nyanserna i sina indata.

Källa: arXiv:2606.31315

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.