AI misslyckas med video eftersom den läser
Baserad på forskning av Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu
Varför missar AI-modeller de subtila ledtrådarna i video? Nuvarande multimodala system tvingar sammanhängande ljud- och bildsignaler till styva texttoken för att resonera. En process som urholkar den temporala nyansen och lämnar AI:n att spekulera baserat på språkliga vanor snarare än sensorisk bevisning. Denna grundläggande brist innebär att modellerna ofta svikter när finmaskiga detaljer från både syn och hörsel krävs för att lösa ett problem.
Forskare har utvecklat LatentOmni, ett ramverk som omprövar hur AI bearbetar information genom att behålla ljud- och bilddata i ett gemensamt latent rum. Istället för att komprimera dessa rika signaler till diskreta texter, väver systemet in textuell resonemang med täta latenta tillstånd. Denna metod bevarar den ursprungliga sensoriska informationen och använder en ny synkroniseringsmetod för att säkerställa att ljudets och bildens tidslinjer förblir perfekt justerade. Det gör att modellen kan resonera med faktisk data snarare än bara beskrivningar.
Konflikten är tydlig: traditionella metoder förlitar sig på explicita textkedjor av tänkande, vilket försvagar den temporala förankringen och flyttar resonemanget mot språkliga förutfattade meningar. LatentOmni vänder på detta genom att använda övervakning på funktionsnivå för att alignera resonemanget med sensoriska egenskaper. Resultatet är en modell som konsekvent överträffar baslinjer med explicit text på benchmark för ljud-visuell resonemang, vilket bevisar att behålla resonemanget i det latenta rummet är en livskraftig väg mot starkare omnimodal förståelse.
Slutsatsen är att bevarandet av tät sensorisk information under resonemanget är avgörande för AI:s noggrannhet. Genom att undvika den förlustfyllda komprimeringen till text sätter LatentOmni en ny standard för öppen källkod-modeller och visar att enhetlig latent resonemang är en lovande riktning för framtida utveckling av multimodal AI.