这篇AI论文揭示了上下文学习的秘密:语言模型如何将功能编码为向量魔法
揭示上下文学习的神奇之处:语言模型如何用向量编码实现功能魔法


在自回归变换器语言模型中,鉴定了一种被称为功能向量(FV)的紧凑向量作为输入输出函数的表示。因果中介分析应用于多样化的上下文学习任务,揭示了少数关注头运输FV的机制,使其在不同上下文中保持稳健,并能在零样本和自然文本设置中执行任务。FV包含有关函数的输出空间的信息,并且它们可以被结合以触发新的复杂任务,表明在LLMs中存在着用于通用函数的内部抽象。
来自东北大学的研究人员扩展了LLMs中上下文学习(ICL)的研究,并深入剖析了变压器的存在FV的情况。 它引用了许多相关研究,包括ICL提示形式、元学习模型和贝叶斯任务推断的研究,同时借鉴了对变压器的解码词汇的研究洞察。它还利用了对上下文复制行为的分析,并使用了Pearl等人开发的因果中介分析方法来分离FV。
该研究调查了在大规模的自回归变换器语言模型上训练的广泛自然文本数据中FV的存在。它扩展了ICL的概念,并探索了导致FV出现的变换器的潜在机制。先前的ICL研究,包括提示形式和尺度调整,对本研究提供了有益信息。FV作为输入输出任务的紧凑向量表示被引入。因果中介分析确定了FV并理解了它们的特性,包括对上下文变化的稳健性和语义组合潜力。
- 认识Wonder3D:一种新颖的人工智能方法,可以从单视角图像高效生成高保真带纹理的网格模型
- 图灵的磨坊:AI超级计算机推动英国经济发展
- “加利福尼亚大学圣地亚哥分校研究人员发布TD-MPC2:革新多领域基于模型的强化学习”
该方法采用因果中介分析探索了自回归变换器语言模型中的FV。它进行了多种设置下的隐藏状态编码任务测试,并通过生成输出的准确性评估了自然文本的可移植性。超过40个作业被创建用于测试各种设置下的FV提取,侧重于六个代表性任务。该论文参考了关于ICL和语言模型中函数表示的先前研究。
当前研究通过因果中介分析成功地确定了自回归变换器语言模型中FV的存在。FV作为紧凑的任务表示,在不同上下文中都具有稳健性,并且可以在不同的设置中触发特定的过程。它在中间层展现出强有力的因果效应,并且易于语义向量组合进行复杂任务。该方法优于替代方法,强调LLMs具有适用于各种上下文的多功能、内部函数抽象。
提出的方法通过因果中介分析成功地确定了自回归变换器语言模型中FV的存在。这些紧凑的输入输出任务表示在不同上下文中表现出稳健性,并在语言模型的中间层展示出强有力的因果效应。尽管FV通常包含编码函数输出空间的信息,但它们的重构更加复杂。此外,FV可以结合以触发新的复杂任务,显示出语义向量组合的潜力。研究结果表明在各种上下文中存在通用函数的内部抽象。
未来的研究方向包括深入研究FV的内部结构,以确定其所编码的信息和执行贡献,以及它们在复杂任务中的实用性和可组合性。探索FV在各种模型、任务和层之间的泛化能力非常重要。需要与其他FV构建方法进行比较研究,并探讨它们与任务表示技术之间的关系。此外,将FV应用于自然语言处理任务,如文本生成和问题回答等,值得进一步探索。




