linear attention系列论文解读

鱿鱼圈 Lv4

1 Delta Net

论文链接:[2406.06484] Parallelizing Linear Transformers with the Delta Rule over Sequence Length

DeltaNet

1.1

Delta Net的更新公式

开始推导

展开递推式

1.2

定义如下变量

开始推导

1.3

引入变化

开始推导

  • 定义
  • 数学归纳法得

同理,我们可以通过归纳法证明 :

1.4

代入得到最终公式如下:

1.5

其中 u、w 的求解采用 UT 变换,其中 表示对角线元素为 0 的严格下三角掩码矩阵。

同理:

因此,要求 ,核心在于计算:

2 Gated Delta Net

论文链接:arxiv.org/pdf/2412.06464

DeltaNet

2.1

Gated DeltaNet 的更新公式:

仿照 DeltaNet 和 GLA 中的推导,定义

于是,分块后的状态可以写成:

2.2

这跟1.3是一样的,假设

那么由数学归纳法可得:

其中:

等价地,也可以写成:

P同理

2.3

代回到 chunkwise 递推式中,就有

2.4

现在再定义:

于是,整体计算可以进一步写成矩阵形式:

2.5

接下来处理 U、W,采用 UT 变换求解

其中 表示主对角线为零的严格下三角掩码。

的递推式出发,可以得到:

同理,也有:

因此,要计算 U 和 W,关键就在于下面两个量:

需要注意的是,这个表达式与原论文中的写法是等价的:

其中

3 Kimi Delta Attention

论文链接:arxiv.org/pdf/2510.26692

DeltaNet

3.1

原始公式:

接下来,遵循 DeltaNet 的推导,定义块级符号和以下辅助量:

然后,块级状态可以写为:

3.2

定义

其中

3.3

UT 变换

3.4

最终的 chunk-wise 表达式

  • 标题: linear attention系列论文解读
  • 作者: 鱿鱼圈
  • 创建于 : 2026-06-02 22:13:32
  • 更新于 : 2026-06-05 22:43:30
  • 链接: https://yuyanqi.com/2026/06/02/linear-attention/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论