Tillbaka till bloggen

Ascend-NPU:n slår GPU:n för AI med triljoners parametrar

Baserad på forskning av Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu

Tänk dig att träna en modell med triljontals parametrar utan att hårdvaran smälter. Det var utmaningen forskarna tog itu med genom att optimera DeepSeek-V4-familjen på Ascend SuperPOD-infrastruktur. De nöjde sig inte med att justera inställningar; de byggde ett komplett system för att hantera det enorma minnestryck och de kommunikationshalsar som vanligtvis sänker klockan för sådana här storskaliga insatser.

Kärnan i lösningen är ett hierarkiskt ramverk som synkroniserar modellparallellism, beräkningar och körning av lågnivåkernel. De flesta stora språkmodeller förlitar sig på GPU-kluster, men denna forskargrupp visade att Ascend-NPUs kan hantera belastningen med allvarlig effektivitet. Genom att orkestrera dessa komplexa lager uppnådde de en Model FLOPs Utilization på 34,22 procent. Det motsvarar en förbättring med faktorn 2,93 jämfört med öppna källkods-baslinjer, och allt detta samtidigt som träningsprocessen förblev stabil och tillförlitlig.

Men effektivitet är bara halva sanningen. Forskargruppen använde den optimerade infrastrukturen för att specialisera modellen för komplexa operationsresearch-uppgifter. De skapade en unik dataset som kombinerade branschresurser med syntetiska dokument verifierade av lösare, vilket resulterade i tiotusentals högkvalitativa prover. Resultatet blev en specialiserad modell som slog GPT-5.4-Mini och den ursprungliga DeepSeek-V4-Flash-modellen i zero-shot-resonemang. Den uppnådde en Pass@1-poäng på 71,81 procent, vilket bevisar att målinriktad efterträning på alternativ hårdvara kan leverera prestanda i framkant för svår matematisk modellering.

Detta arbete erbjuder en tydlig blåbok för framtiden av stor modellträning. Det visar att med rätt systemnivåoptimeringar kan man lyfta triljonparmetrar-modeller till nya höjder på icke-GPU-hårdvara. Ännu viktigare demonstrerar det hur domänspecifik data kan omvandla en allmän modell till en specialist som slår de största aktörerna på marknaden.

Källa: arXiv:2607.20145

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.