Tillbaka till bloggen

Träna AI-agenter på 2 miljoner tokens gratis

Baserad på forskning av Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao

AI-agenter drunknar i data. När dessa system ackumulerar observationer, verktygsoutput och tidigare beslut över långa sekvenser närmar sig de kontextfönster som krävs för inferering snabbt längden på en miljon token. Ändå har de träningsmetoder som används för att finjustera dessa modeller ihärdigt fastnat vid 256 000 token eller mindre, med den riskfyllda antagandet att modellerna kan generalisera till längre kontexter som de aldrig faktiskt har tränats på. Denna klyfta mellan vad agenterna upplever och hur de undervisas är en kritisk flaskhals för att bygga tillförlitliga AI-system med långsiktig horisont.

Forskare har presenterat LongStraw, ett exekveringsstack som är designat för att överbrygga denna klyfta genom att möjliggöra förstärkningsinlärning efter träning på kontexter som överstiger två miljoner token, allt medan man opererar under en fast GPU-budget. Systemet fungerar genom att utvärdera den delade prompten utan att kräva automatisk differentiering, och behåller endast det specifika modelltillstånd som behövs för efterföljande token. Det spelar sedan upp korta svarsgrenar individuellt, vilket effektivt krymper det levande träningsgrafiken för att spara minne till priset av extra återuppspelnings tid. Denna metod gör det möjligt att träna effektivt på enorma indata utan att kräva exponentiella ökning av hårdvaruresurser.

Resultaten är slående. På endast åtta H20-GPU:er lyckades systemet behandla grupperad poängsättning och bakåtgående passager för Qwen3.6-27B vid 2,1 miljoner positioner, med minnesanvändningen som ökade med enbart 0,21 GB vid skalning av gruppstorlekar. En stress test drev detta ytterligare till 4,46 miljoner positioner. På en större kluster med 32 H20-GPU:er validerade teamet hela exekveringsvägen för en prompt på 2,1 miljoner token över alla 78 lager i GLM-5.2-modellen. Även om den nuvarande implementationen fokuserar på att etablera exekveringskapacitet snarare än fullständig träningskorrekthet, bevisar den att förstärkningsinlärning med lång kontext inte längre är en teoretisk omöjlighet.

Denna utveckling markerar en vändpunkt i hur vi tränar AI för komplexa, verkliga uppgifter. Genom att koppla bort minneskraven för långkontextträning från den rena storleken på indata gör LongStraw det genomförbart att lära modellerna nyanserna av utsträckt resonemang och verktygsanvändning. När branschen rör sig mot agenter som opererar över timmar eller dagar av interaktion, kommer denna förmåga att träna på kontexter med miljoner token under praktiska hårdvarubegränsningar vara avgörande för att stänga klyftan mellan infereringskapacitet och rigorös efterträning.

Källa: arXiv:2607.14952

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.