论文主要内容总结
本文通过大规模实证研究,探究了大型语言模型(LLMs)潜在空间的几何结构,分析了11个仅解码器的Transformer-based LLMs在6个科学主题和12层隐藏状态中的语义编码方式,核心发现与结论如下:
- 语义的低维线性子空间编码:LLMs会将高级语义信息(如数学、物理等学科知识)压缩到低维线性子空间中,这些子空间的有效维度通常远低于模型的总隐藏维度(常低于10%)。
- 线性可分的语义簇:不同语义内容的表示形成线性可分的簇,且这种可分性在模型深层更显著(通过SVM分类准确率提升体现),表明深层更倾向于结构化语义分离。
- 指令对潜在表示的影响:思维链(chain-of-thought)等结构化推理指令或对齐行为会锐化并分离潜在表示,即使表面内容不变,也会导致内部表示的显著差异;思维链等推理模式甚至可由单一向量方向编码。
- 应用验证:基于上述发现,作者提出并验证了“潜在空间护栏”——通过简单的MLP分类器直接在潜在表示上操作,能高精度检测对抗性和恶意提示,证明了几何感知工具在LLM可解释性、对齐和安全领域的潜力。
论文创新点
- 大规模跨模型与跨领域研究:首次系统分析11个不同规模、不同家族的LLMs(如Mistral、Llama、Gemma等),覆盖6个科学主题,突破了以往研究集中于特定词汇特征或窄域的局限。
- 揭示高级语义的线
订阅专栏 解锁全文

111

被折叠的 条评论
为什么被折叠?



