Large Language Models Encode Semantics in Low-Dimensional Linear Subspaces

论文主要内容总结

本文通过大规模实证研究,探究了大型语言模型(LLMs)潜在空间的几何结构,分析了11个仅解码器的Transformer-based LLMs在6个科学主题和12层隐藏状态中的语义编码方式,核心发现与结论如下:

  1. 语义的低维线性子空间编码:LLMs会将高级语义信息(如数学、物理等学科知识)压缩到低维线性子空间中,这些子空间的有效维度通常远低于模型的总隐藏维度(常低于10%)。
  2. 线性可分的语义簇:不同语义内容的表示形成线性可分的簇,且这种可分性在模型深层更显著(通过SVM分类准确率提升体现),表明深层更倾向于结构化语义分离。
  3. 指令对潜在表示的影响:思维链(chain-of-thought)等结构化推理指令或对齐行为会锐化并分离潜在表示,即使表面内容不变,也会导致内部表示的显著差异;思维链等推理模式甚至可由单一向量方向编码。
  4. 应用验证:基于上述发现,作者提出并验证了“潜在空间护栏”——通过简单的MLP分类器直接在潜在表示上操作,能高精度检测对抗性和恶意提示,证明了几何感知工具在LLM可解释性、对齐和安全领域的潜力。

论文创新点

  1. 大规模跨模型与跨领域研究:首次系统分析11个不同规模、不同家族的LLMs(如Mistral、Llama、Gemma等),覆盖6个科学主题,突破了以往研究集中于特定词汇特征或窄域的局限。
  2. 揭示高级语义的线
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值