SKIM.AIŹRÓDŁAADMIN
← POWRÓT
TŁO/ARXIV CS.AI

Analiza wrażliwości modeli MoE: Która warstwa naprawdę liczy się dla kompresji?

Badanie przedstawia systematyczną analizę warstw modelu Qwen 3.6-35B-A3B, wykazując że wrażliwość warstw silnie zależy od ich głębokości w sieci. Wyniki wskazują że warstwy wczesne mają inną krytyczność niż późne, co ma praktyczne implikacje dla kompresji dużych modeli.

#MIXTURE-OF-EXPERTS#MODEL-COMPRESSION#LAYER-ANALYSIS