AI skapar realtidsvideo på ett steg
Baserad på forskning av Min Zhao, Hongzhou Zhu, Kaiwen Zheng, Zihan Zhou, Bokai Yan
Tänk dig att generera video i realtid, bild för bild, i takt med ditt eget hjärtslag. Det är den heliga graalen för interaktiv AI, men nuvarande metoder kämpar med avvägningen mellan kvalitet och latens. Forskare har nu knäckt en nyckelbit av pusslet, vilket möjliggör videogenrering som känns omedelbar snarare än fördröjd.
Teamet har fokuserat på en utmanande inställning: bildvis autoregression med endast ett eller två steg för sampling. Medan tidigare modeller förlitade sig på bitvis bearbetning med fyra steg, siktar denna nya approach på finare granularitet. Det största hindret var att initiera AI-modellen korrekt. Standardmetoderna var antingen för långsamma, felriktade mot målet eller för dyra att skala. Forskarna fastslog att sättet man startar modellen på avgör om den kan generera video av hög kvalitet vid dessa extrema hastigheter.
De presenterade Causal Forcing++, ett skalbart flöde som använder kausal konsistensdistillation. Istället för att förberäkna och lagra enorma mängder data, lär sig systemet från ett enda online-lärsteg mellan intilliggande bilder. Detta smarta knep kringgår den beräkningsmässiga flaskhalsen i traditionella metoder. Resultatet är en modell som initieras snabbare och optimeras enklare, vilket bryter igenom latensbarriärerna som har hämmat realtidsvideogenrering.
Effekten är betydande. Den nya metoden överträffar state-of-the-art 4-stegs Causal Forcing under bildvis 2-stegsinställning med 0,1 i VBench Total, 0,3 i VBench Quality och 0,335 i VisionReward, samtidigt som latensen för första bilden halveras. Den minskar även kostnaderna för träning i steg 2 med en faktor fyra. Detta genombrott närmar oss AI som kan generera interaktiva videovärldar på flyt, vilket öppnar dörrar för realtids-spel och dynamiskt innehållsskapande. Framtiden för videogenrering handlar inte bara om kvalitet, utan om hastighet och responsivitet.