AI-agentar sviktar när reglerna ändras
Baserad på forskning av Jiayu Liu, Cheng Qian, Zhenhailong Wang, Bingxuan Li, Jiateng Liu
Vi förutsätter att AI-agenter kan hantera komplexa uppgifter i verkliga miljöer, men en ny benchmark avslöjar att de har betydande svårigheter när reglerna ändras mitt i spelet. Forskarna har presenterat AdaPlanBench, en dynamisk testmiljö som visar att planeringsförmågan hos stora språkmodeller är skör när begränsningar avslöjas stegvis snarare än i förväg.
Studien fokuserar på hur agenter anpassar sig när de måste planera och omplanera under dubbla begränsningar från både den fysiska världen och användaren. Till skillnad från traditionella benchmark som listar alla regler från start, döljer AdaPlanBench begränsningarna tills en agent föreslår en plan som bryter mot dem. Systemet bygger på 307 hushållsuppgifter och använder ett flerstegsprotokoll där agenterna får iterativ feedback. Detta tvingar AI:n att dra slutsatser om dolda regler utifrån sina misstag och revidera strategin i realtid, vilket efterliknar det oförutsägbara i verkliga interaktioner.
Resultaten visar en tydlig klyfta mellan nuvarande förmåga och tillförlitlig prestation. Bland tio ledande stora språkmodeller uppnådde den bästa modellen endast 67,75 procents noggrannhet. Prestationen försämrades märkbart när fler begränsningar lades till, och användarspecifika regler visade sig särskilt svåra att hålla reda på. Fel uppstod ofta på grund av svag fysisk förankring och minskad effektivitet.
Denna forskning etablerar en kritisk testbädd för interaktiv planering och visar att nuvarande AI-agenter saknar den robusthet som krävs för dynamiska miljöer. Hittida indikerar att modeller kan följa statiska instruktioner, men förblir opålitliga när de tvingas anpassa sig till utvecklande, tvålagda begränsningar. Så länge fysisk förankring och adaptiv resonemangsförmåga inte förbättras, kommer AI att fortsätta snubbla när reglerna i verkligheten inte är fullt kända i förväg.