Träna AI enbart på bilder
Baserad på forskning av Chuyan Chen, Haoxing Chen, Kun Chen, Zhenglin Cheng, Long Cui
Vad händer om man kunde träna en kraftfull bildgenerator utan att drunkna i dyra, parvisa bilder och texter? Forskare har nu presenterat LLaDA-Image, ett nytt ramverk som vänder upp och ner på hur vi bygger visuell AI. Genom att prioritera enbart bildbaserad träning i första steget har de skapat ett system som genererar fotorealistiska bilder av hög kvalitet, samtidigt som det förstår komplexa textinstruktioner. Denna metod utmanar branschens vedertagna norm att tungt beroende av parvisa data är den enda vägen till högkvalitativ generering.
Kärnan i innovationen ligger i ett enhetligt ramverk som kombinerar en Diffusion Transformer med sex miljarder parametrar med en fryst vision-språkmodul. Istället för att börja med text-bild-par bygger teamet upp en stark visuell föreställning genom att först träna modellen enbart på bilder. Piplinen bearbetade 220 miljoner samples, varav endast 98 var riktiga bilder. Detta visar att skala och specifika träningsstrategier kan väga tyngre än behovet av enorma mängder parvisa dataset. För att hålla optimeringen effektiv och skalbar användes parameterfria RMSNorm och Muon-optimiseraren, vilket säkerställer att modellen förblir både kraftfull och hanterbar ur ett beräkningsperspektiv.
Resultaten markerar en ny state-of-the-art för öppna modeller. På Qwen-Image-Bench uppnådde LLaDA-Image betyget 53,53 på engelska och 53,38 på kinesiska, och slog därmed konkurrenterna. Utöver den råa kvaliteten följer modellen också finmaskiga redigeringsinstruktioner med stor precision – en avgörande funktion för praktisk användning. Ännu imponerande är LLaDA-Image-Turbo, en distillerad version som levererar snabb inferens på bara två till fyra steg. Kombinationen av hög trohet och hastighet gör den till ett levande alternativ till proprietära jättar som ofta backar i hastighet eller transparens.
För att accelerera framstegen inom generativ AI har forskarna släppt modellvikter, träningskod och detaljerade recept. Detta engagemang för fullt öppna träningsrecept möjliggör för andra att replikera och bygga vidare på arbetet, vilket främjar ett mer transparent och samarbetsvilligt ekosystem. För utvecklare och entusiaster innebär detta tillgång till toppklassiga funktioner utan de svartarbets-restriktioner som finns i kommersiella verktyg. Epoken för högpresterande, öppen bildgenerering är här, och den är fullt tillgänglig.