Ny matematik avslöjar varför AI beter sig likadant
Baserad på forskning av Dario Picozzi
Stora språkmodeller blir alltmer likvarandra, men vi förstår fortfarande inte den dolda struktur de delar med sig av, eller hur man justerar ett beteende utan att störa ett annat. Ny forskning visar att den matematiska formen av en models prediktioner – så kallad Fisher-Rao-geometri – är nyckeln till detta mysterium. Genom att kartlägga hur modeller tilldelar sannolikheter till nästa ord har forskare funnit en universell mall som binder samman beteendet hos helt olika AI-arkitekturer.
Denna geometri fungerar som ett semantiskt karta som förblir konsekvent oavsett underliggande kod. Oavsett om det rör sig om transformers, state-space-modeller eller rekurrenta nätverk, överensstämmer utdata-geometrins mönster långt starkare än deras interna aktiveringsmönster. Denna delade struktur underlättar överföring av semantiska kategorier och ligger nära mänskliga ordval. Överensstämmelsen förbättras med skalning, träning och prediktiv noggrannhet, vilket tyder på att när modellerna blir smartare konvergerar deras interna logik mot ett gemensamt, mänskligt liknande ramverk.
Resultaten avslöjar också överraskande konsekvenser för hur modeller skaffar sig fakta. Även om statistiken i träningskroppen kan förutspå vilka fakta en modell kommer att lära sig, visar randomiserade experiment att djupare bevis väsentligen fördröjer upptäckten över alla testade arkitekturer. Denna fördröjning utmanar antaganden om hur snabbt modeller uppdaterar sin kunskap och avslöjar en komplex samverkan mellan datadjup och inlärningshastighet som kvarstår oavsett modelltyp.
Viktigast av allt är att denna geometrisk insikt möjliggör precis kontroll. Den föreskriver minimera störningar interventioner som tillåter forskare att redigera eller styra modeller med minimalt sidoeffekt. Uppdateringar som lärs in på en prompt kan överföras till osedda prompts medan de bättre bevarar befintliga beteenden än traditionella metoder. Denna återanvändbara kontrollmekanism förbättrar styrning, redigering, attributionsanalys, ordboks-inlärning och finjustering, och erbjuder ett kraftfullt nytt verktyg för att hantera de utvecklande förmågorna hos stora språkmodeller.