大模型承重墙，去掉了就开始摆烂！苹果给出了「超级权重」

AIGC动态2年前 (2024)发布机器之心

AIGC动态欢迎阅读

原标题：大模型承重墙，去掉了就开始摆烂！苹果给出了「超级权重」
关键字：权重,模型,报告,研究者,方法
文章来源：机器之心
内容字数：0字

内容摘要：

机器之心报道
编辑：蛋酱、佳琪去掉一个「超权重」的影响，比去掉其他 7000 个离群值权重加起来还要严重。大模型的参数量越来越大，越来越聪明，但它们也越来越奇怪了。
两年前，有研究者发现了一些古怪之处：在大模型中，有一小部分特别重要的特征（称之为「超权重」），它们虽然数量不多，但对模型的表现非常重要。
如果去掉这些「超权重」，模型就完全摆烂了，开始胡言乱语，文本都不会生成了。但是如果去掉其他一些不那么重要的特征，模型的表现只会受到一点点影响。有趣的是，不同的大模型的「超权重」却出奇地相似，比如：
它们总是出现在层中。
它们会放大输入 token 激活的离群值，这种现象研究者们称之为「超激活」（super activation）。无论输入什么提示词，「超激活」在整个模型中都以完全相同的幅度和位置持续存在。而这源于神经网络中的「跨层连接」。
它们还能减少模型对常用但不重要的词汇，比如「的」、「这」、「了」的注意力。
得到了这些发现，圣母大学和苹果的研究团队进一步对「超权重」进行了探索。
他们改进了 round-to-nearest quantization（RNQ）技术，提出了一种对算力特

原文链接：大模型承重墙，去掉了就开始摆烂！苹果给出了「超级权重」