Tillbaka till bloggen

AI misslyckas med fysikforskning i en tredjedel av fallen

Baserad på forskning av Yigeng Jiang, Tengchao Yang, Taoyong Cui, Jiaxing Wan, Yuan Wang

Tänk dig en AI som inte bara svarar på frågor, utan aktivt genomför vetenskapliga experiment. Ett system som navigerar i komplexa fysik- och kemiproblem med samma noggrannhet som en mänsklig forskare. Det är löftet bakom så kallade djupresearch-agenter – system byggda på stora språkmodeller för att hantera autonom, stegvis vetenskaplig resonemang. Trots potentialen att påskynda upptäckter saknar vi idag ett pålitligt sätt att mäta om dessa digitala forskare verkligen klarar av uppdraget.

Forskare har nu presenterat PhySciBench, ett omfattande testverktyg som fyller detta kritiska evaluationsgap. Det består av 200 expertkuraterade frågor inom fysik och kemi, som speglar verkliga vetenskapliga arbetsflöden över sex olika uppgiftskategorier. Resultaten var nyktergörande. Även det mest avancerade baslinjesystemet, Gemini Deep Research, nådde endast en noggrannhet på 33,5 procent. Analysen avslöjade tre ihärdiga brister i dagens AI-system: de har svårt med långa resonemangskedjor, misslyckas med att överföra kunskap effektivt mellan stegen, och saknar förmågan att själv verifiera resultat med hjälp av fysikaliska principer.

För att åtgärda dessa brister utvecklade teamet DelveAgent, ett modulärt ramverk med flera agenter som kombinerar adaptiv planering, minne med dubbel granularitet och en hierarkisk reflektionsmekanism förankrad i fysik. Denna specialiserade arkitektur visade sig betydligt mer effektiv än generiska modeller. Över fyra vetenskapliga benchmark-test förbättrade DelveAgent noggrannheten med upp till 7,5 procentenheter, samtidigt som kostnaden för inferensen minskade till ungefär en tredjedel av den starkaste baslinjen. Resultaten tyder på att arkitekturell specialisering är nyckeln till att göra autonom forskning tillförlitlig. Med data och kod nu offentligt tillgängliga sätter detta arbete en ny standard för utvärdering av AI inom de fysiska vetenskaperna, och bevisar att skräddarsydda system kan överträffa generiska jättar inom komplexa vetenskapliga domäner.

Källa: arXiv:2606.18648

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.