Nytt trick gör AI-videomodeller blixtsnabba
Baserad på forskning av Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang
Tänk dig att generera bilder och video i hög kvalitet med en bråkdel av den beräkningskraft som krävs idag. Diffusion transformers är för närvarande guldstandarden inom AI-skapande, men deras flerstegs-sampling och växande antal parametrar gör inferensen dyr. Denna flaskhals har länge hållit avancerad generativ AI utan räckhåll för många enheter, men ett nytt genombrott lovar att ändra detta genom att göra dessa kraftfulla modeller avsevärt mer effektiva utan att offra kvalitet.
Problemet ligger i grunden i hur dessa modeller hanterar data under inferens. Aktiviteterna inom diffusion transformers förskjuts oförutsägbart mellan olika tidpunkter, prompts och styrningsgrenar. Tidigare lösningar krävde att data kalibrerades om för varje nytt scenario, en krävande och resursintensiv process. Forskare har nu introducerat OrbitQuant, en dataagnostisk kvantiseringsmetod som kringgår detta problem helt. Istället för att uppskatta intervall för varje specifik input, kvantiserar OrbitQuant data i en normaliserad, roterad bas. Denna teknik använder en slumpmässig permuterad block-Hadamard-rotation för att koncentrera koordinater kring en fast, känd marginal. Resultatet är en enda kodbok som fungerar för alla tidpunkter, prompts och lager, oavsett input.
Denna innovation skapar en markant kontrast mot befintliga metoder. Genom att absorbera rotationen i vikterna offline, tar systemet bort rotationen inuti varje linjärt lager, vilket lämnar endast en framåtriktad rotation på aktiviteterna vid körning. Denna eleganta lösning innebär att samma recept överförs sömlöst från bild- till videogenerering utan behov av per-modalitet-inställningar. Det tar effektivt bort behovet av ständig omkalibrering, vilket gör att kvantiseringen kan anpassa sig till nya kontroller eller modaliteter omedelbart.
Resultaten är imponerande. OrbitQuant sätter en ny state of the art för post-training-kvantisering över stora modeller som FLUX.1, Z-Image-Turbo, Wan 2.1 och CogVideoX. Det mest anmärkningsvärda är att det pressar bild-diffusion transformers till W2A4-kvantiserningsnivåer samtidigt som en användbar genereringskvalitet upprätthålls. Detta markerar ett betydande framsteg, vilket bevisar att höglokal AI-generering kan vara både kraftfull och tillgänglig. För utvecklare och användare betyder detta att snabbare, billigare och mer skalbara AI-skapandeverktyg äntligen är inom räckhåll.