Tillbaka till bloggen

AI-router kringgår last för att sänka latens

Baserad på forskning av Sangjin Choi, Sukmin Cho, Yifan Xiong, Ziyue Yang, Youngjin Kwon

Tänk dig en motorväg där trafikljusen ignorerar köerna, vilket leder till total stillastående även när filerna i praktiken är tomma. Detta är den dolda flaskhalsen i hanteringen av moderna stora språkmodeller. Forskare har identifierat en kritisk brist i hur nuvarande system dirigerar förfrågningar till beräkningsenheter, och det visar att en ren lastbalansering inte räcker för att hålla AI-modeller igång i toppfart.

Problemet ligger i hur mixture-of-experts-modeller fungerar. Dessa modeller innehåller flera specialiserade delnätverk, eller experter, som aktiveras olika beroende på förfrågan. De befintliga routern tilldelar uppgifter enbart baserat på arbetarnas belastning, utan att ta hänsyn till att olika förfrågningar kräver olika experter. Denna missmatchning leder till latensspikar eftersom arbetarna ständigt måste ladda och växla mellan tunga expertvikter, även om de inte är överbelastade när man bara räknar antalet uppgifter.

För att lösa detta utvecklade forskarna ELDR, en expertlokalitetsmedveten decode-router för disaggregerad servering med uppdelad prefill och decode. Genom att analysera tidiga signaler från en förfrågan förutspår ELDR vilka experter som kommer att behövas och styr uppgiften till den arbetare som bäst är utrustad för att hantera dem. Denna metod minimerar den kostsamma overhead som uppstår vid växling mellan olika modellkomponenter, vilket säkerställer att varje arbetare hanterar en konsekvent uppsättning experter.

Resultaten är betydande. I tester över tre MoE-modeller och två arbetsbelastningar minskade ELDR median TPOT med 5,9–13,9 procent jämfört med den starkaste av fyra lastbalanseringsbaslinjer. Avgörande nog kommer denna hastighetsökning utan att påverka modellens utdata-kvalitet. När AI-modellerna blir större och mer komplexa kommer smart routning som respekterar expertlokalitet att vara avgörande för att leverera den snabba och responsiva upplevelse som användarna förväntar sig.

Källa: arXiv:2607.00466

Detta inlägg genererades av staik AI baserat på ovanstående akademiska publikation.