Varför din AI-kod misslyckas med att skapa bilder
Baserad på forskning av Haoyu Zhao, Zihao Zhang, Xudong Wang, Jiaxi Gu, Zuxuan Wu
Du ber en AI skriva kod som ska rita en bild. Koden kör utan fel. Resultatet ser helt annorlunda ut än vad du bad om. Denna frustrerande klyfta kallas för Program-to-Visual-gap, och det är den centrala utmaning som ett nytt ramverk, MaLiang-Harness, syftar till att lösa. Det förvandlar visuell generering från ett enstaka kast i tärningen till en kontinuerlig process av konstruktion, verifiering och revision.
Forskarna definierar gapet som diskrepansen mellan ett program som exekveras korrekt och den visuella utdata det producerar. För att överbrygga detta organiserar MaLiang-Harness multimodala stora språkmodeller i en slinga där den utvecklande koden, dess historik och dess verifiering delar en gemensam referensram. Systemet använder ett tillstånd för beständig kodgenerering för att hålla koll på kontexten, en spårbar genereringsprocess för att länka ändringar till renderat bevis, samt revisionsmedveten redigering och verifiering för att kontrollera det nuvarande tillståndet innan slutgiltig publicering. Denna koordinering av planering, exekvering och visuell feedback över olika renderingsbackender säkerställer att den slutgiltiga bilden eller videon stämmer överens med avsikten.
Resultaten avslöjar en slående mismatch mellan allmän AI-kapacitet och faktisk prestanda inom visuell generering. När de testades på MaLiang-IBench och MaLiang-VBench uppnådde GPT-6-Astra en perfekt generationsframgång på 100 procent, där 96,0 procent av bilduppgifterna och 76,9 procent av videouppgifterna uppfyllde alla kvalitetskrav. Studien visar dock att modeller med liknande resultat på allmänna benchmark-tester kan skilja sig markant åt i förmågan att möta specifika visuella krav. Detta tyder på att standardiserade mått är dåliga prediktorer för hur väl en AI kan översätta exekverbar kod till korrekta visuella utfall.
MaLiang-Harness ger en systematisk grund för att förstå hur modeller omvandlar kod till visuella element, och belyser både potentialen i programmerbar generering och begränsningarna i nuvarande utvärderingsmetoder. Genom att göra processen spårbar och revisionsmedveten erbjuder det en tydligare väg mot tillförlitlig visuell skapande. Ramverket är nu tillgängligt för forskare som vill utforska nyanserna i detta kritiska översättningslager inom AI-genererat media.