linear attention系列论文解读
1 Delta Net
论文链接:[2406.06484] Parallelizing Linear Transformers with the Delta Rule over Sequence Length

1.1
Delta Net的更新公式
开始推导
展开递推式
1.2
定义如下变量
开始推导
1.3
引入变化
开始推导
- 定义
- 数学归纳法得
同理,我们可以通过归纳法证明 :
1.4
代入得到最终公式如下:
令
则
1.5
其中 u、w 的求解采用 UT 变换,其中
同理:
因此,要求
2 Gated Delta Net

2.1
Gated DeltaNet 的更新公式:
仿照 DeltaNet 和 GLA 中的推导,定义
于是,分块后的状态可以写成:
2.2
这跟1.3是一样的,假设
那么由数学归纳法可得:
其中:
等价地,也可以写成:
P同理
2.3
代回到 chunkwise 递推式中,就有
2.4
现在再定义:
于是,整体计算可以进一步写成矩阵形式:
2.5
接下来处理 U、W,采用 UT 变换求解
其中
从
同理,也有:
因此,要计算 U 和 W,关键就在于下面两个量:
需要注意的是,这个表达式与原论文中的写法是等价的:
其中
3 Kimi Delta Attention

3.1
原始公式:
接下来,遵循 DeltaNet 的推导,定义块级符号和以下辅助量:
然后,块级状态可以写为:
3.2
定义
其中
3.3
UT 变换
3.4
最终的 chunk-wise 表达式
- 标题: linear attention系列论文解读
- 作者: 鱿鱼圈
- 创建于 : 2026-06-02 22:13:32
- 更新于 : 2026-06-05 22:43:30
- 链接: https://yuyanqi.com/2026/06/02/linear-attention/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论