AI-agenter misslyckas med att följa verkligheten
Baserad på forskning av Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long
Vi behandlar minne som en hårddisk, men för AI-agenter är det mer likt en levande dagbok. När multimodala modeller tar sig an längre och mer komplexa uppgifter blir det sätt de minns, uppdaterar och använder information på den avgörande flaskhalsen. Om en agent inte kan spåra en föränderlig värld är dess intelligens irrelevant.
Forskare har presenterat WorldMemArena, ett nytt benchmark utformat för att testa just denna förmåga. Till skillnad från tidigare tester som bara bad modeller att återge statiska fakta, utvärderar detta ramverk hur agenter hanterar en "Action-World Interaction Loop". Det simulerar en livscykel med fyra steg där agenter måste skriva, underhålla, hämta och använda minne samtidigt som de interagerar med utvecklande visuella och textuella miljöer. Testet involverar 400 uppgifter över flera sessioner som tvingar fram modeller att skilja på relevanta uppdateringar, föråldrad information och avsiktliga distraktioner.
Resultaten avslöjar en hård verklighet för dagens AI-system. För det första garanterar inte överlägsna mekanismer för att skriva och lagra data bättre prestanda. För det andra, trots sin multimodala natur, har dessa agenter fortfarande svårt att fullt ut utnyttja visuella bevis, och ignorerar ofta viktiga detaljer till förmån för text. För det tredje är systemen mycket instabila; de försämras avsevärt när de ställs inför realistiska, oförutsägbara agentic trajectories snarare än kontrollerade scenarier. Slutligen, även om minnessystem baserade på harness erbjuder mer flexibilitet än manuellt designade pipelines, förblir de kostsamma och mindre tillförlitliga.
Slutsatsen är tydlig: dagens benchmark är för simplistiska. Vi behöver utvärderingsmetoder som speglar den rörliga, dynamiska naturen hos verkligt användande av agenter. Så länge vi inte kan pålitligt testa hur modeller hanterar utvecklande sammanhang och visuella data, kan vi inte lita på att de agerar autonomt i komplexa miljöer.