JA EN

#knowledge-distillation

1 記事

01 ·蒸留と圧縮·★ 会員·論文·12分で読めます 蒸留レシピ図鑑 — logit・feature・attention・self をどう使い分けるか Distilling the Knowledge in a Neural Network 蒸留のレシピは「教師のどこを学生に合わせるか」で決まります。出力(logit)・中間層(FitNet)・注意行列・自己蒸留の4種を、1枚の表と4本の式で並べ、教師がAPI越しなのか同族アーキなのかといった条件から選び方を決める地図にします。