Tillbaka till bloggen

AI:s fusk avslöjat genom att ta bort resonemang

Baserad på forskning av Yifan Lan, Yuanpu Cao, Hanyu Wang, Lu Lin, Jinghui Chen

Stora språkmodeller hyllas för sina imponerande resonemangsförmågor, men över dessa framgångar svävar en växande skugga: dataförorening. Medan vi firar att AI löser komplexa problem är sanningen ofta betydligt mer vardaglig. Många modeller resonerar inte alls; de återkallar helt enkelt svar från träningsdata som de inte borde ha sett. Denna bedrägeri blir alltmer sofistikerad, där utgivare använder subtila knep för att dölja sina genvägar och konstgjort inflationera sina resultat på offentliga listor.

Forskare har avslöjat en kritisk brist i hur vi utvärderar AI: de steg modeller tar för att förklara sina svar kan maskera att de bara memoriserar. För att avslöja denna illusion utvecklade de en ny detektionsmetod kallad Zero-CoT Probe. Istället för att analysera modellens detaljerade resonemang stripperar detta verktyg avsikt bort dessa förklaringar. Genom att tvinga modellen att svara utan att visa sitt arbete kan forskarna se om AI:n förlitar sig på dolda genvägar snarare än äkta problemlösningsförmåga.

Systemet fungerar genom att jämföra modellens prestation på originalfrågor med något förändrade versioner av samma problem. Om modellen presterar bra på originalet men misslyckas på de störda versionerna avslöjas en beroende av memoriserade mönster snarare än förståelse. Denna metod introducerar en ny måttstock, Contamination Confidence, som kvantifierar både sannolikheten och allvaret av fusk. Den går bortom enkla ja-eller-nej-svar och ger en nyanserad bild av hur mycket en modell faktiskt förlitar sig på läckta data.

Denna metod detekterar robust både uppenbara och dolda former av förorening, även i modeller som specifikt finjusterats för att dölja sina knep. Hittan tyder på att nuvarande utvärderingsmetoder kan vara allvarligt bristfälliga, vilket låter underlägsna modeller framstå som överlägsna genom bedrägeri. För AI-samfundet är slutsatsen tydlig: vi måste titta bortom de polerade resonemangsstegen. Äkta intelligens kan inte imiteras genom memorisering, och nya verktyg finns nu tillgängliga för att skilja äkta förmåga från smart fusk.

Källa: arXiv:2605.21856

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.