AI klarar testerna men sviktar i praktiken
Baserad på forskning av Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang
Artificiell intelligens klarar sig strålande på standardiserade tester, men visar sig ändå vara frustrerande värdelös i verkliga yrkesmiljöer. Denna klyfta tyder på att problemet inte handlar om intelligens i sig, utan om hur vi mäter den. Vi har länge betygssatt studenter på grundval av flervalsfrågor, samtidigt som vi helt ignorerat om de faktiskt kan utföra det jobb de utbildats för.
Forskare har nu presenterat ett nytt riktmärke, Agents’ Last Exam (ALE), för att rätta till detta. Till skillnad från tidigare tester som kontrollerar isolerade fakta, utvärderar ALE AI-agenter på långsiktiga, verkliga arbetsuppgifter med verifierbara resultat. Utvecklad i samarbete med över 250 branschexperter täcker testet 1 000 uppgifter inom 13 olika industrikluster, med fokus på icke-fysiskt arbete definierat av standardiserade yrkesklassificeringar. Målet är att mäta ihållande prestation i ekonomiskt värdefulla arbetsflöden, snarare än snabba, artificiella segrar.
Resultaten avslöjar en hård verklighet. Även på den svåraste nivån av uppgifter når mainstream-AI-modeller en genomsnittlig fullständig godkännandegrad på bara 2,6 procent. Den här lilla siffran bevisar att nuvarande riktmärken misslyckas med att förutse verklig nytta. Gapet mellan framgång på testbänkar och faktisk ekonomisk påverkan är stort, och de flesta system ligger långt ifrån mättnad.
ALE är designat som ett levande riktmärke som ständigt växer när nya arbetsflöden läggs till. Det syftar till att flytta fokus från toppositioner på listor till påverkan relevant för BNP. Om vi vill att AI ska spela en roll i yrkeslivet måste vi sluta testa den på gåtor och börja testa den på arbete.