AI-agenter misslyckas i 60 % av fallen
Baserad på forskning av Jundong Xu, Qingchuan Li, Jiaying Wu, Yihuai Lan, Shuyue Stella Li
De flesta agenter baserade på stora språkmodeller testas i statiska, oföränderliga miljöer. Det skapar en farlig illusion av kompetens. I verkligheten skiftar förhållandena ständigt, och dagens AI-system är inte byggda för att hantera kaoset i utvecklande uppgifter.
Forskare har presenterat EvoArena, ett nytt testverktyg som är utformat för att avslöja denna bräcklighet. Istället för statiska tester simulerar EvoArena dynamiska miljöer där terminalkommandon, programvarustatus och till och med sociala preferenser förändras successivt över tid. Målet är att se om agenterna kan anpassa sin kunskap och sitt beteende när omgivningen uppdateras.
Resultaten är slående. Dagens agenter har svårt att klara sig, med en genomsnittlig noggrannhet på endast 39,6 procent över dessa föränderliga domäner. För att åtgärda problemet utvecklade teamet EvoMem, ett minnessystem som registrerar uppdateringar som strukturerade historikposter. Genom att spåra hur minnet förändras kan agenterna resonera kring miljön förändringar snarare än att bara reagera på isolerade instruktioner.
EvoMem förbättrar konsekvent prestandan och höjer de genomsnittliga poängen på EvoArena med 1,5 procent. Det lyfter också prestationen på standardbenchmark som GAIA och LoCoMo med respektive 6,1 och 4,8 procent. Avgörande nog förbättras noggrannheten på kedjenivå med 3,7 procent, vilket hjälper agenterna att fullfölja sekvenser av relaterade deluppgifter som kräver ihållande anpassning. Mekanistiska analyser visar att EvoMem förbättrar insamlingen av bevis i minnet, vilket indikerar en bättre bevarande av kompletta tillstånd i den föränderliga miljön. Detta belyser ett kritiskt behov av att modellera evolution både i utvärdering och minnesarkitektur.