Tillbaka till bloggen

Så här besegras AI-hallucinationer

Baserad på forskning av Haoran Xu, Hongyu Wang, Yifei Gao, Jiaze Li, Zizhao Tong

Tänk dig att be en AI att analysera en komplex bild, bara för att den sedan med självsäkerhet fantiserar om detaljer som inte finns där. Det här händer eftersom traditionella modeller tenderar att låsa sig vid de första intrycken och har svårt att väga bevis från olika delar av en scen samtidigt. Ett nytt ramverk som kallas Visual Para-Thinker++ syftar till att åtgärda detta genom att efterlikna hur mänskliga team samarbetar, och omvandlar en enskild modell till en samordnad grupp av specialiserade agenter.

Istället för att lita på en enda tankekedja använder systemet en gemensam stor multimodal språkmodell som instansieras i tre distinkta roller: en huvudagent, arbetare och en sammanfattare. Huvudagenten bryter ner problemet, medan flera arbetare tar itu med olika aspekter parallellt, isolerade från varandra för att förvirring ska undvikas. Avgörande nog väljer sammanfattaren inte bara det mest populära svaret; den granskar hela resonemangsspåren från alla arbetare för att förlikna det slutgiltiga slutsatsen, vilket minskar risken för fel.

Den verkliga innovationen ligger i hur dessa agenter lär sig att arbeta tillsammans. Forskarna har utvecklat en träningsmetod som tilldelar specifika belöningar till olika roller, vilket förhindrar att deras inlärningssignaler krockar. Detta gör att systemet kan optimera varje agents bidrag utan att störa de andra. En effektiv inferensmotor höjer dessutom prestandan genom att återanvända visuella data och minnescacher, vilket gör processen snabbare och mer resurseffektiv.

I tester över V*, CountBench, RefCOCO-familjen och HallusionBench överträffade Visual Para-Thinker++ konsekvent modeller med enskilda banor och andra parallella baslinjer. Vinsterna var särskilt slående i uppgifter som är benägna att hallucinera, vilket bevisar att delegera uppgifter till specialiserade, parallella agenter ger mer korrekta och tillförlitliga resultat. Denna approach tyder på att framtiden för visuell AI inte ligger i större enskilda modeller, utan i smartare, samarbetsinriktade arkitekturer.

Källa: arXiv:2606.09290

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.