Högupplöst AI utan fördröjning
Baserad på forskning av Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng
Tänk dig en digital människa som ser skarp och tydlig ut, men som svarar lika snabbt som en verklig konversation. Forskare har nu presenterat Wan-Streamer v0.2, en betydande uppgradering av en helhetslösning för ljud- och bildinteraktion. Modellen löser ett vanligt tekniskt dilemma: normalt innebär högre kvalitet längre svarstid. Den nya versionen bryter mot den regeln och levererar kristallklara bilder i hög upplösning utan att lägga till någon märkbar fördröjning för användaren.
Kärnan i framgången är det stora steget framåt i visuell detaljrikedom. Modellen producerar nu videostreamar i upplösningen 640x368 pixlar, en uppgradering från tidigare 192x336. Det handlar inte bara om fler pixlar; ökningen gör agentens kroppsspråk tydligt läsbar. Under ett samtal i realtid kan du nu tydligt se hållning, blickriktning, handrörelser och objekt i närheten. Viktigt nog behåller systemet en blixtsnabb latens på 200 millisekunder mellan mottagande av en signal och generering av ett svar, med en bildhastighet på 25 bilder per sekund. Detta gör interaktionen flytande och omedelbar, snarare än likt ett fördröjt videosamtal.
Hur lyckades de med denna visuella uppgradering utan att sänka hastigheten? Hemligheten ligger i en smart arbetsfördelning mellan två specialiserade komponenter: tänkaren och utföraren. Tänkaren hanterar perception och språkbehandling på ett enskilt GPU, vilket håller vägen kort och snabb. Den skickar endast nödvändig rekonditioneringsdata till utföraren. Utföraren använder däremot flera GPU:er som arbetar parallellt för att hantera det tunga arbetet med att generera videon i hög upplösning. Genom att dela upp den visuella genereringen över dessa kort och hålla ljudgenereringen separat, koncentrerar systemet hårdvarukraften exakt där den behövs som mest.
Resultatet blir en total latens för fjärrinteraktion på cirka 550 millisekunder, även när nätverkets restid beaktas. Denna arkitektur bevisar att man inte behöver offra visuell rikedom för hastigheten i AI-interaktioner i realtid. När dessa modeller utvecklas vidare kommer det att vara avgörande att hålla videostreamen i hög upplösning samtidigt som den konversationella omedelbarheten bibehålls, för att göra digitala agenter verkligt närvarande och trovärdiga.