Tillbaka till bloggen

Varför AI-agenter glömmer bort det de inte kan se

Baserad på forskning av Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin

Vi litar på att AI:n kommer ihåg allt, men vad händer när den inte kan se det den behöver för att agera? När multimodala modeller övergår från passiva chattbotar till aktiva agenter i komplexa miljöer, framträder en kritisk brist: de har svårt att återkalla information som inte längre är synlig. Detta är inte bara en mindre bugg; det är ett fundamentalt hinder för att sätta in dessa system i verkliga scenarier där kontexten är flyktig och dold.

Forskarna har presenterat RNG-Bench, ett nytt testverktyg utformat för att mäta just denna förmåga. Till skillnad från befintliga tester som antingen visar hela speltilståndet eller endast kontrollerar minnet i slutet, tvingar RNG-Bench modellerna att rekonstruera tidigare observationer under flerstegsinteraktioner. Testsviten innehåller två utmanande spel: Matching Pairs, där kortens identitet avslöjas kortvarigt och måste minnas senare, samt en 3D-labyrint där modellen måste integrera egocentriska vyer i ett rumsligt kartverktyg. Testerna är rigorösa, med de svåraste konfigurationerna som kräver att modellen bearbetar kontexter på cirka 128 000 tokens och 350 bilder per episod.

Resultaten avslöjar en överraskande flaskhals. Medan modellerna kan fatta goda beslut när de har rätt information, härrör de flesta residualfelen från att glömma tidigare observationer snarare än dåligt beslutsfattande. Med andra ord är problemet inte att AI:n är dum, utan att den är glömsk. Denna distinktion är avgörande eftersom den isolerar minnesrekonstruktion som en egen färdighet som nuvarande toppmodeller ännu inte behärskar, vilket lämnar dem långt från att vara mättade även i dessa kontrollerade miljöer.

Det finns dock en tydlig väg framåt. Genom att finjustera modeller som Qwen3.5-9B på optimala policy-rullningar och filtrerade modell-demonstrationer förbättras prestandan på RNG-Bench avsevärt. Förvånansvärt nog höjer denna målinriktade träning minnesförmågan utan att försämra modellens allmänna multimodala förmågor. Detta tyder på att målinriktad förstärkningsinlärning kan överbrygga gapet, trots att nuvarande AI har svårt med icke-Markoviska uppgifter, och banar väg för mer pålitliga, minnesmedvetna agenter.

Källa: arXiv:2606.19338

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.