1. STILL框架的核心设计理念
在大型语言模型(LLM)的优化领域,注意力机制的计算效率一直是制约模型应用的瓶颈。传统softmax注意力虽然能够有效捕捉长距离依赖关系,但其O(N²)的计算复杂度使得处理长序列时面临严重的计算资源挑战。STILL框架的创新之处在于,它没有简单地用线性注意力完全替代softmax注意力,而是提出了一种混合架构,通过智能路由机制让两种注意力形式各司其职。
1.1 混合注意力架构的权衡之道
STILL的核心思想源自一个关键观察:在长文本处理中,并非所有token之间的交互都需要同等程度的精细建模。具体来说:
- 局部关键交互 :某些token对(如指代关系、逻辑连接词)需要精确的注意力权重计算,这对应于传统softmax注意力的优势领域
- 全局背景交互 :大多数token只需要维持大致的上下文关系,这可以通过线性注意力高效实现
这种二分法启发STILL采用混合架构,其技术实现包含三个关键组件:
-
自显著性评分模块 :通过轻量级的前向网络计算每个token的重要性得分,公式为:
s_i = σ(W_q·q_i + W_k·k_i + b)其中σ是sigmoid函数,W_q和W_k是可学习参数,b是偏置项。得分高于阈值τ的token将被路由到softmax分支
-
范数保持特征映射 :为了解决线性注意力中特征映射导致的表示退化问题,STILL设计了特殊的映射函数:
ϕ(x) = LayerNorm(ReLU(W_φ·x)) * √d这种设计确保映射后的特征保持与原始空间相似的范数范围
-
动态路由机制 :在实际部署中,STILL采用分块处理策略,将序列划分为多个chunk,在每个chunk内部:
- 计算token显著性得分
- 前k个高得分token进入softmax分支
- 其余token进入线性注意力分支
- 最后合并两个分支的输出
提示:在实际应用中,建议将softmax分支的token比例控制在5-15%之间。我们的实验表明,当这个比例超过20%时,内存优势开始显著下降;低于5%则会导致性能明显降低。
1.2 与传统方案的性能对比
在BABILong基准测试中,STILL展现了显著优势。以4K上下文长度为例:
| 模型类型 | QA1准确率 | 内存占用(GB) | 推理延迟(ms/token) |
|---|---|---|---|
| 纯softmax | 1% | 138 | 85 |
| 纯线性 | 3% | 22 | 28 |
| LoLCATs | 6% | 24 | 31 |
| STILL | 10% | 26 | 34 |
值得注意的是,虽然STILL的绝对延迟比纯线性方案略高,但其准确率提升幅度达到67%。这种性价比使得它在需要平衡精度和效率的场景中尤为适用。




被折叠的 条评论
为什么被折叠?



