AI skapar 37 000 uppgifter för fem cent
Baserad på forskning av Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li
Att träna AI-agenter på komplexa, långsiktiga uppgifter är känt för att vara både dyrt och svårt. Människovänliga experter går inte att skala upp, och vanliga AI-verktyg bryter ofta den känsliga logikkedja som krävs för sådana arbetsflöden. Nu har forskare presenterat en metod som automatiserar processen och skapar tusentals högkvalitativa träningsuppgifter till en bråkdel av kostnaden.
Det nya ramverket, kallat Recursive Synthetic Terminal Tasks, fungerar som en oändlig loop av skapande och verifiering. Det startar med ett fåtal verifierade seed-uppgifter och expanderar dem rekursivt. Systemet förlänger lösningen, justerar instruktionerna och verifieringsverktygen, och testar resultatet i en ny miljö. Om uppgiften godkänns blir den ny seed för nästa omgång. Denna cykel upprepas, vilket tillåter systemet att generera komplexa uppgifter utan mänsklig inblandning.
Resultaten är slående. Efter femton omgångar producerade ramverket 37 484 uppgifter till cirka 0,05 dollar per styck. Svårighetsgraden sköt i höjden, med medianlösningens längd som ökade från 67 till 374 rader kod. Följaktligen sjönk DeepSeek-V4-Pro:s framgångsgrad på pass@4 från 90 procent till 2,5 procent. Detta bevisar att uppgifterna är genuint utmanande och inte bara enkla variationer av originalet.
Att träna modeller på dessa syntetiska uppgifter gav enorma förbättringar. Finjustering ökade prestandan med upp till 10 poäng på Terminal-Bench, Terminal-Bench Hard och Long-Horizon Terminal Bench. När detta kombinerades med agentic PPO uppnåddes vinster på upp till 41,2 procent på svåra uppgifter. Viktigt nog visade processen inga tecken på att bromsa in, vilket tyder på att metoden kan fortsätta generera svårare och bättre data oändligt.