← Tillbaka till bloggen

OneStreamer fixar AI-videons minne och svarstid

Baserad på forskning av Xiangyu Zeng, Yuandong Yang, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li

Tänk dig att titta på en direkt sändning av en idrottstävling där AI:n inte bara beskriver vad som händer just nu, utan också minns en avgörande foul från tio minuter sedan för att förklara en påföljande straffspark. Dagens streamingvideomodeller har svårt att balansera detta. De glömmer ofta bort det förflutna när de försöker reagera på nuet, eller så fastnar de i väntan på mer data istället för att yttra sig när de har tillräckligt underlag. Denna brist på sammanhang gör den realtidsinteraktionen upplöst och ointelligent.

Forskare har nu presenterat OneStreamer, en ny metod som förenar perception, minne och proaktiv respons i ett och samma system. Istället för att behandla videanalys som en serie isolerade ögonblicksbilder använder OneStreamer en gemensam process för proaktiv generering. Modellen skapar ett så kallat Proactive Hierarchical Caption Memory, som registrerar tidsförankrade detaljer och sammanfattningar av avslutade händelser i takt med att de inträffar. Detta gör att modellen kan bygga upp en återanvändbar faktahistorik utan att behöva bearbeta gammalt visuellt data igen. När en fråga dyker upp kan modellen dra nytta av dessa genererade bildtexter för att ge korrekta svar, vilket effektivt överbryggar klyftan mellan omedelbar observation och långsiktigt sammanhang.

Genombrottet ligger i hur systemet hanterar timing. Traditionella modeller tenderar att slösa tid i upprepade väntelägen, osäkra på om de har tillräckligt med information för att svara. OneStreamer använder Proactive State Transition Learning för att bryta denna cykel. Genom att bevara övervakning vid varje utgångspunkt uppmuntras modellen att yttra sig när den har tillräckligt med bevis, snarare än att vänta i det oändliga. Denna metod accelererar inte bara svaren, utan förbättrar också noggrannheten. Forskarna har dessutom skapat OneStreamer-1M, ett enormt dataset med över en miljon poster, för att träna modellen på mångsidiga streaminguppgifter.

Resultaten är slående. Modellen med fyra miljarder parametrar presterar bäst i alla åtta utvärderade benchmark för streamingvideoförståelse och slår befintliga metoder. Avgörande nog förbättrar behållandet av dessa genererade bildtexter svaren på historiska frågor utan att försämra modellens förmåga att uppfatta händelser i realtid. Proactive State Transition Learning överträffar även dense state supervision, trots att den endast övervakar 27,5 procent av de annoterade stat-token. Detta bevisar att proaktiv generering kan fungera som ett gränssnitt för inlärning, vilket gör att AI:n kan minnas det förflutna samtidigt som den håller sig skarp i nuet. När streamingvideo blir allt vanligare i realtidsapplikationer kommer förmågan att sömlöst blanda ihop minne och reaktion vara avgörande för att skapa verkligen intelligenta interaktiva system.

Källa: arXiv:2610.01762

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.