Kan AI förstå att föremål försvinner?
Baserad på forskning av Haotian Zhang, Fengyuan Yu, Dezhi Luo, Haoran Sun, Zehong Zhao
Kan artificiell intelligens verkligen förstå att objekt fortsätter att existera även när du tittar bort? Det låter som en grundläggande läxa från barndomen, men för de avancerade videomodellerna som driver dagens AI-revolution är begreppet om objektpermanens ofta en bländande blindfläck. Forskare har nu tagit itu med denna grundläggande lucka i maskinernas kognition och visat att dessa system kan läras att resonera kring den fysiska världen med förvånansvärd noggrannhet.
Studien presenterar WROP, ett specialanpassat dataramverk utformat för att träna världsmodeller på centrala kognitiva principer. Istället för att lita på slumpmässig internetvideo skapade teamet 150 handkonstruerade uppgifter inspirerade av kognitiv vetenskap, indelade i sex kognitiva kategorier. De använde Blender för att generera över 1,5 miljoner träningsprover, där de noggrant randomiserade belysning, hastighet och kameravinklar för att säkerställa att modellerna lärde sig den underliggande logiken bakom objektpermanens snarare än att bara memorera visuella mönster.
Resultaten visar en tydlig hierarki i hur olika AI-arkitekturer hanterar fysiskt resonemang. När de testades mot 14 befintliga videomodeller placerade sig den nyutvecklade PWM-WROP-modellen på första plats bland fortsättningsmodeller och på tredje plats totalt, endast efter en oavgjord strid mellan två referens-till-video-modeller. Denna prestation placerar den i framkant med toppmoderna referens-till-video-modeller och visar att en explicit träning i objektpermanens ger konkreta förbättringar av den fysiska intelligensen. Forskningsteamet har släppt hela datasetet, examensuppgifterna och modellvikterna, vilket ger en ny benchmark för att bygga mer robusta och mänskliga AI-system.