Varför AI misslyckas med korta videor
Baserad på forskning av Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang
Dagens audiovisuella AI fastnar i ett problem med korttidsminnet. Även om modellerna kan generera imponerande klipp, misslyckas de konsekvent med att upprätthålla kvaliteten under längre tidsperioder. Denna begränsning är den avgörande flaskhalsen som hindrar AI från att skapa autentiskt och sammanhängande innehåll som varar i en minut.
Forskarna har presenterat LongAV-Compass, ett nytt testverktyg utformat för att mäta just denna förmåga. Till skillnad från tidigare verktyg som endast utvärderar klipp på fem till tio sekunder, bedömer detta ramverk generationen av minutlångt material baserat på tre olika inmatningstyper: text, bilder och video. Det går bortom enkla kvalitetskontroller för att mäta hur väl modellerna bevarar identitet, berättelseflöde och synkronisering mellan ljud och bild över tid.
Studien visar en tydlig klyfta mellan nuvarande modellers kapacitet och användarnas förväntningar. Genom att testa elva stora modeller fann forskarna att även om korta klipp ser bra ut, urholkas sammanhanget snabbt med tiden. Testet avslöjar specifika svagheter i semantisk överensstämmelse och temporal konsistens, och visar att dagens system har svårt att upprätthålla en enhetlig berättelse eller visuell identitet längre än några sekunder.
Slutsatsen är klar: längd är den nya fronten för generativ AI. LongAV-Compass erbjuder det första sammanhängande diagnostiska verktyget för att mäta denna klyfta, och pressar branschen att prioritera stabilitet över lång tid framför kortsiktiga visuella knep.