Så här tränar du AI på omöjliga problem
Baserad på forskning av Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang
Standardmetoder för träning av AI stöter ofta på en vägg när de möter svåra problem. Om en modell inte redan kan föreställa sig rätt väg till en lösning, kan den helt enkelt inte lära sig den. Detta skapar ett frustrerande blindställe där de mest utmanande frågorna förblir olösta, oavsett hur mycket data du matar in systemet.
Forskare har nu presenterat en ny teknik som kallas TREK för att bryta denna dödvinkel. Istället för att tvinga modellen att blindt kopiera en lärare, använder TREK distillation som ett verktyg för utforskning. Metoden identifierar de svåraste frågorna där eleven misslyckas, frågar en extern lärare efter verifierade lösningar och tar sedan selektivt in dessa framgångsrika resonemangsvägar i elevens eget kunskapsunderlag. När dessa nya mönster väl har integrerats återgår modellen till standardträning för att finslipa sina färdigheter.
Resultaten är slående. På komplexa uppgifter inom matematisk resonemang ökade denna metod Qwen3-8B:s poängsignifikant med förslag från DeepSeek-V4. Inom agentikuppgifter, där AI:n måste navigera i miljöer, uppnådde TREK höga framgångsgrad redan tidigt under träningen, medan traditionella metoder krävde betydligt fler steg för att nå samma nivå. Detta tyder på att styra utforskningen är långt mer effektivt än att vänta på slumpmässig upptäckt.
Slutsatsen är klar: effektivt lärande kräver mer än bara repetition. Genom att strategiskt utöka det spektrum av möjligheter som en modell betraktar som möjligt, kan vi påskynda dess förmåga att lösa svåra problem. TREK bevisar att målinriktad utforskning slår brutoptimering när det gäller att hantera de tuffaste utmaningarna.