Ny metod förbättrar AI:s resonemang utan finjustering
Baserad på forskning av Sanket Badhe, Deep Shah
Chain-of-Thought-prompting ger AI-modeller förmågan att resonera steg för steg, men det har ett högt pris: hög latens och enorma kostnader för inferens. Den vanliga lösningen är att finjustera mindre modeller, men den processen offrar ofta transparensen och skapar stor operativ overhead. Forskare har nu presenterat en tredje väg som lovar det bästa av båda världar utan bagaget.
De kallar det för Prompt-Level Distillation. Istället för att omträna en modell eller tvinga den att producera långa resonemangsspår, extraherar denna metod uttryckliga mönster för resonemang från en kraftfull lärarmodell. Dessa mönster organiseras sedan i en strukturerad lista med expressiva instruktioner som läggs till i studentmodellens systemprompt. Det är en icke-parametrisk metod, vilket innebär att modellens vikter förblir oförändrade. Den kompakta modellen får helt enkelt en tydligare och mer detaljerad uppsättning regler för hur den ska tänka, vilket gör att den kan imitera avancerat resonemang utan den beräkningsmässiga tyngden.
Resultaten är slående. När tekniken testades på Gemma-3 4B ökade Macro F1-poängen på StereoSet från 57 procent till 90,0 procent och noggrannheten på Contract-NLI förbättrades från 67 till 83 procent. LogiQA-noggrannheten hoppade också upp till 70 procent. Liknande vinster observerades med Mistral Small 3.1, vilket bevisar att metoden fungerar över olika arkitekturer. Avgörande nog matchade dessa kompakta modeller prestanda på frontier-nivå med försumbar latensöverhead. Det innebär att man får hög noggrannhet utan de långsamma svarstider som vanligtvis är förknippade med komplexa resonemandsuppgifter.
Denna metod erbjuder en tydlig fördel för reglerade branscher som juridik, finans och innehållsmoderering. Eftersom beslutsprocessen görs transparent genom uttryckliga instruktioner kan människor verifiera logiken fullt ut. Den är idealisk för användningsfall med hög volym och kanter där hastighet och tolkningsbarhet är avgörande. Genom att destillera resonemang till prompter snarare än parametrar har forskare hittat ett sätt att göra små modeller smarta, snabba och granskbara.