AI sviktar inför okända entiteter
Baserad på forskning av Parinthapat Pengpun, Simran Khanuja, Graham Neubig
Dina favorit-AI-modeller har svårt med det obskyra. Medan multimodala system för entitetslänkning briljerar när det gäller att identifiera kända personer och platser, kraschar de när de ställs inför sällsynta entiteter. Detta är inte bara en mindre bugg; det avslöjar en grundläggande blindfläck i hur vi mäter AI-intelligens. Om din modell inte kan hantera den långa svansen av mänsklig kunskap är dess nytta i verkliga livet kraftigt begränsad.
Forskare har upptäckt att traditionella mått, som sidvisningar, misslyckas med att fånga sann sällsynthet. En entitet kan vara väl dokumenterad i kunskapsgrafer men aldrig trenda på sociala medier. Genom att använda strukturella mått för att identifiera dessa dolda sällsynta entiteter fann forskarteamet att state-of-the-art-precisionen sjunker med 15,4–39,9 procent på dessa delmängder. Detta avslöjar ett kritiskt gap: nuvarande system är optimerade för popularitet, inte för fullständighet, vilket lämnar stora delar av flerspråkig och multimodal data oansluten.
Lösningen ligger i att kombinera två distinkta förmågor: resonemang och hämtning. Forskarna utvecklade ett träningsfritt ramverk där en vision-språkmodell iterativt söker på Wikipedia och dynamiskt samlar in bevis. Överraskande nog löser varken resonemang eller hämtning i sig problemet. Resonemang utan hämtning ger liten vinst, medan hämtning utan resonemang faktiskt kan försämra den totala prestandan. Endast när de kombineras skapas ett robust system som kan hantera komplexa och sällsynta frågor.
Denna metod omdefinierar hur vi utvärderar och bygger modeller för entitetslänkning. Testad på MERLIN, en flerspråkig benchmark som täcker fem språk, förbättrade det nya ramverket den totala precisionen med 6,9 procent och ökade prestandan för sällsynta entiteter med upp till 23,3 procent. Teamet släppte också MERLIN-Rare, en ny testsvit för målinriktad utvärdering. Lärdomen är tydlig: för att bygga verkligen intelligent AI måste vi sluta ignorera det sällsynta och börja lära modellerna att resonera sig fram genom osäkerhet.