AstraFlow gör agentic AI-träning 2,7 gånger snabbare
Baserad på forskning av Haizhong Zheng, Yizhuo Di, Jiahui Wang, Shuowei Jin, Xueshen Liu
Reinforcement learning används i allt högre utsträckning för att förbättra stora språkmodellers förmåga till resonemang, kodning och verktygsanvändning. Men agentic reinforcement learning är fortfarande för dyrt att skala upp. Att tillämpa reinforcement learning på agentic språkmodeller kräver stöd för komplexa arbetsbelastningar, inklusive samtidiga träningar med flera policyer, samtidigt som man effektivt utnyttjar elastiska, heterogena och regionöverskridande beräkningsresurser.
Problemet är att befintliga RL-system för stora språkmodeller bara stödjer en del av dessa funktioner. Varje ny utökning kräver ofta dedikerad systemutveckling. Byrden härrör från tränarcentrerade kontrollarkitekturer och från bristen på väldefinierade abstraktioner för RL-systemets komponenter.
Här kommer AstraFlow in. Det är ett datadrivet RL-system som ersätter den traditionella, tränarcentrerade kontrollen med principierade komponentabstraktioner. I AstraFlow är rollout-tjänster, datadriftshantering och träning åtskilda till autonoma komponenter. Detta gör att systemet inbyggt kan hantera komplexa arbetsbelastningar med flera policyer för agentic RL och effektivt utnyttja varierande beräkningsresurser.
Vi har utvärderat AstraFlow över arbetsbelastningar inom matematik, kod, sökning och AgentBench. Resultaten visar att samma system stödjer träning med flera policyer, elastisk skalning, heterogen körning över regioner och sammansättbara datalgoritmer utan att behöva ändra koden på systemnivå. Vid samtidiga träningar med flera policyer uppnår AstraFlow jämförbar eller bättre noggrannhet än befintliga RL-system, samtidigt som träningstiden snabbar upp med 2,7 gånger.