Tillbaka till bloggen

AI-agenter misslyckas i 80 procent av komplexa uppgifter

Baserad på forskning av Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel, Michal Zakrzewski, Sebastian Montagna

Vi brukar anta att dagens AI-agenter är redo att hantera komplexa, verkliga arbetsuppgifter. Men en ny studie tyder på att vi farligt överskattar deras förmågor. Medan dessa system briljerar vid enkla, välkända uppgifter, snubblar de kraftigt när de möter okända, högriskmiljöer inom professionella yrken.

Forskarna har presenterat GauntletBench, en rigorös ny benchmark utformad för att testa agenters generaliseringsförmåga bortom det bekväma och välkända. Istället för att fokusera på grundläggande frågor tvingar denna utvärdering agenterna att navigera i fem specialiserade professionella applikationer: Video Editor, Workflow Builder, 3D Modeller, Flight Analyser och Circuit Designer. Varje applikation innehåller tjugo bildintensiva uppgifter, vilket sammanlagt ger hundra utmaningar som kräver tidsuppfattning, grafisk förståelse och tredimensionellt resonemang. Målet är att se om agenterna verkligen kan anpassa sig till nya, komplexa scenarier snarare än att bara memorera mönster från populära, enkla appar.

Resultaten var slående och motsade de allmänna förväntningarna. Även de mest avancerade agenterna av senaste generationen uppnådde en usel framgångsgrad på endast 19,1 procent på dessa svåra uppgifter. Detta låga resultat belyser allvarliga begränsningar i hur dessa system hanterar förbisedda förmågor som tidsuppfattning, grafisk förståelse och tredimensionellt resonemang. Klyftan mellan maskin och människa är inte bara märkbar; den är enorm. Icke-experter som annoterade uppgifterna och utförde samma arbetsmoment uppnådde en framgångsgrad på över 80 procent. Detta visar att dagens AI är långt ifrån mänsklig kompetensnivå i komplexa, verkliga miljöer.

Slutsatsen är tydlig: låt dig inte luras av enkla benchmark-test. Även om AI har gjort imponerande framsteg inom smala, välkända domäner, förblir den skör när den pressas in i professionella arbetsflöden som kräver mycket visuell bearbetning. Så länge agenterna inte kan överskrida denna betydande prestationsklyfta bör deras införande i kritiska, komplexa miljöer hanteras med extrem försiktighet.

Källa: arXiv:2606.14397

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.