AI-agenter misslyckas på grund av denna dolda lucka
Baserad på forskning av Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov
Varför misslyckas AI-agenter med komplexa uppgifter? Svaret ligger i en dold brist i hur de lär sig: ett gap mellan tänkande och handling. Forskare har identifierat detta "tänkande-handling-gap" som den främsta anledningen till att multimodala modeller har svårt att hantera verkliga problem som kräver externa verktyg.
Dagens modeller behandlar resonemang och verktygsanvändning som separata beteenden. När de tränas med standardmetoder försöker de använda verktyg i endast 30 procent av fallen. Ännu värre är att verktygen misslyckas i 40 procent av de fall de faktiskt används. Detta tystar läsekretset precis när det behövs som mest, vilket skapar en ond cirkel där modellen aldrig lär sig använda verktyg effektivt eftersom den sällan får användbar feedback från sina misstag.
Forskarteamet presenterar nu AXPO, en ny optimeringsmetod som åtgärdar denna obalans. Istället för att behandla alla fel lika, riktar AXPO in sig på de specifika fall där verktygsanvändningen misslyckades. Metoden behåller modellens ursprungliga resonemang intakt men resamplar verktygsanropet och dess utfall, kombinerat med en smart urvalsprocess för startkontexten. Detta tvingar modellen att lära sig av sina misslyckanden med verktyg, snarare än att ignorera dem.
Resultaten är slående. På nio multimodala benchmark-test överträffar den nya metoden standardträning med nästan två procentenheter. Det mest imponerande är att en mindre modell med åtta miljarder parametrar, som använder AXPO, överträffade prestandan hos en betydligt större modell med 32 miljarder parametrar. Detta bevisar att smartare träning kan besegra ren storlek och erbjuder en mer effektiv väg mot kapabla AI-agenter.