Tapered Language Models
-
给Transformer变个形,LLM竟能变得更聪明
文章介绍 Tapered Language Models 研究,说明在不增加参数的前提下重新分配 Transformer 各层参数,可能提升语言模型效率和表现。
-
给Transformer变个形,LLM竟能变得更聪明
LLM 的效率提升不一定只能依赖更多参数和更大算力,重新分配 Transformer 各层参数,把模型“脑容量”放到更关键的位置,也可能让模型在相同规模下变得更聪明。