Tillbaka till bloggen

AI lyssnar och tittar i realtid

Baserad på forskning av Lianghua Huang, Zhi-Fan Wu, Wei Wang, Yupeng Shi, Mengyang Feng

Tänk dig en digital kompanjon som inte bara lyssnar och svarar, utan som också tittar och reagerar i realtid. Det skapar en konversation som känns levande. Det är inte längre science fiction. Forskare har presenterat Wan-Streamer, en banbrytande grundmodell som är byggd från grunden för sömlös, realtidsinteraktion mellan ljud och bild. Modellen markerar ett stort steg framåt i hur maskiner uppfattar och svarar på människans värld, och går bortom enkla kommando-svar-mönster till flytande, naturlig dialog.

I grunden är Wan-Streamer en enhetlig Transformer som behandlar språk, ljud och video som en enda, vävd dataström. Till skillnad från dagens system som förlitar sig på en skör kedja av separata verktyg – som tal-till-text-konverterare, språkmodeller och text-till-tal-syntesator – hanterar denna nya modell allt internt. Den lär sig uppfattning, resonemang, generering och timing samtidigt. Genom att samordna visuella, ljudmässiga och textuella token via block-kausal uppmärksamhet (block-causal attention) bearbetar den indata och genererar utdata inkrementellt. Detta eliminerar behovet av externa moduler och minskar drastiskt den latens och felackumulering som vanligtvis plågar kaskadiserade interaktionssystem.

Resultaten är slående snabba. Modellen uppnår ett svarstid på cirka 200 millisekunder på modellsidan, med en total interaktionslatens på ungefär 550 millisekunder när man inkluderar 350 millisekunders tvåvägs-nätverkslatens. Detta möjliggör subsekund, full-duplex-kommunikation, vilket innebär att systemet kan prata och lyssna samtidigt utan klumpiga pauser. För att göra detta möjligt har hela stacken omdesignats för strömbaserad bearbetning (streamability), med kausala kodare och dekoder som tillåter strömmade enheter så korta som 160 millisekunder vid 25 bilder per sekund. Denna nivå av hastighet och synkronisering var tidigare omöjlig att uppnå med traditionella modulära arkitekturer.

Wan-Streamer bevisar att en enda, enhetlig modell kan överträffa komplexa, flerstegs-pipelines både i hastighet och sammanhållning. Genom att lära sig korsmodal synkronisering och turhantering gemensamt ger den en anblick av framtiden för människa-dator-interaktion: låg latens, naturligt och verkligen interaktivt. När vi rör oss mot mer integrerade AI-assistenter kan denna end-to-end-approach mycket väl bli standarden för hur vi konverserar med maskiner.

Källa: arXiv:2606.25041

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.