上一条:Learning Multiscale Transformer Models for Sequence Generation. ICML2022.
下一条:Improved Knowledge Distillation for Pre-trained Language Models via Knowledge Selection. EMNLP (Findings) 2022.