作者信息:本文一作孟维康是哈尔滨工业大学(深圳)与鹏城实验室联合培养的博士生,本科毕业于哈尔滨工业大学,主要研究方向是大规模基础模型的高效训练和推理算法。通讯作者张正教授是哈尔滨工业大学(深圳)长聘教授、博士生导师,长期从事高效能多模态机器学习研究。
继 ICLR 2025 的 PolaFormer 之后,哈工大(深圳)与鹏城实验室合作的扩展版本 PolaFormer++ 近日被 IEEE TPAMI 正式接收。新版本在理论框架、特征映射设计和实验覆盖面上全面升级:首次给出判定特征映射是否具备「降熵尖锐性」的理论判据,并提出极性感知的通道级尖锐(PaCS)特征映射,在六大类视觉核心任务上全面验证了线性注意力的潜力。

Transformer 的核心——Softmax 自注意力,复杂度是序列长度的平方 O(N2d)。处理长视频、高分辨率图像时,计算和显存开销急剧上升,严重限制了实际部署。
线性注意力用核化特征映射 ϕ(⋅) 替换 Softmax,把计算改写为 ϕ(Q)(ϕ(K)⊤V),借助矩阵乘法结合律将复杂度降为线性的 O(Nd′²)。但效率的提升是以表达能力为代价的,差距主要来自两方面:
1. 负值丢失。为保证注意力权重非负,现有方法(如基于 ReLU、1+ELU 的特征映射)不得不把 query 和 key 中的负值全部置零。将 q、k 按正负部分解后可以看到,内积实际上包含四项:

前两项是同号维度间的交互,后两项是异号维度间的交互。基于 ReLU 的映射直接把负成分抹掉,后两项(neglected negatives)完全丢失 —— 模型再也无法完整地重建原始的 q・k 相似度。
2. 注意力分布信息熵过高。没有了 Softmax 的指数缩放,线性注意力的权重分布趋于均匀,熵更高、不「尖锐」。模型难以区分强弱 q-k 对,对关键 token 的关注力被稀释。此前的补救方案(如 FLatten Transformer 的固定幂函数)对所有通道施加统一的尖锐程度,忽略了不同通道本就需要不同程度的尖锐化这一事实。
PolaFormer(ICLR 2025)的核心思想是极性分解:把 q 和 k 逐元素拆成正部与负部(q=q+−q−,k=k+−k−),让正负成分平等地参与相似度计算。同号交互与异号交互分别在同号流(Same-polar Flow)和异号流(Opposite-polar Flow)中独立处理;value 向量沿通道维一分为二,分别承载两路的响应;最后用两个可学习的极性门控矩阵 Gs、Go 对两路输出做 Hadamard 加权,以可学习的方式近似「减法」操作、补偿松弛减法带来的影响,同时保证注意力权重非负。

图 1:PolaFormer++ 整体框架。query-key 对按极性被显式拆分为同号流与异号流,两路输出分别由可学习符号感知矩阵 Gs、Go 调控;极性感知的通道级尖锐特征映射(PaCS)ϕs、ϕo 分别作用于两路,在保持尖锐性的同时区分不同通道对不同极性流的贡献。
在 PolaFormer 的基础上,PolaFormer++ 迈出了关键一步:不同通道对相似度的贡献不同,所需的尖锐程度也不同。为此,作者提出了 PaCS(Polarity-aware Channel-wise Spiky)特征映射。

图 2:PaCS 示意。左:极性分解后的向量由不同的极性流驱动,正负成分获得独立的尖锐化映射;右:基函数与逐通道温度参数组合,构建通道级差异化的特征映射,使输入向量呈现多尺度、通道级的尖锐性。
具体设计上,作者以指数函数为基函数,为每个通道引入一个可学习的温度系数 p(由 sigmoid 归一化):
这样一来,每个通道、每条极性流都有自己专属的「尖锐度旋钮」,模型可以自适应地放大判别性强的响应、压平次要响应,把强弱注意力信号有效分离。
作者将训练后同号流两个温度参数(s1,s2)按通道画成散点图。可以看到,点云大范围弥散、显著偏离 y = x 对角线——说明网络为不同通道学到了高度独立的尖锐化行为,而不是趋同于一个固定幂次。

图 3:每个点代表一个特征通道的一对温度参数(s1,s2)(s1,s2)。显著偏离 y=x 对角线表明网络为每种极性学习到了高度独立的分布。
类似的,对极性门控矩阵 Gs 与 Go 在多个层上做 PCA 可视化,两类矩阵在特征空间中形成明显分离的簇,证实可学习混合策略确实捕捉到了同号与异号值之间互补的关系:

图 4:不同层中 Gs(红)与 Go(黄)的 PCA 可视化。两类门控矩阵分布明显分离,说明二者学到了互补的极性调控模式。
PolaFormer++ 构建了 b0–b5 共 6 个规格的层级式视觉骨干家族(7M–114M 参数),并在六大类任务上做了系统验证。
PolaFormer++ 在各规格上均取得同级别最优或极具竞争力的精度:

精度 - 算力曲线上,PolaFormer++(红色实线)整体位于最上方,在各个计算档位都压过近三年的高效模型:

图 6:ImageNet-1K 上 Top-1 精度 vs. FLOPs 曲线,PolaFormer++(红色)在各档位全面领先。
在 4K–200K 序列长度上实测吞吐与峰值显存:普通 Softmax 注意力(Vanilla-Torch)在 65K 之后直接 OOM;Flash Attention 虽不爆显存,但速度被 PolaFormer++ 越甩越远 ——在 200K 序列长度下提速达 5.25×,且显存占用始终保持最低。

图 7:吞吐(折线)与峰值显存(柱状)随序列长度的变化。PolaFormer++ 在长序列下显著优于 Flash Attention,最高提速 5.25×。
以 RetinaNet、Mask R-CNN(1× 与 3× schedule)为框架:

PolaFormer++-b3 在 ADE20K 上以 28G FLOPs 达到 50.5% mIoU,分别比 EfficientViT-L1 和 SegNeXt-B 高 1.3% 和 2.0%,且算力显著更低;Cityscapes 上 83.4% mIoU 同样领先。可视化结果中,PolaFormer++ 对行人、人行道、车辆的边界刻画更精细,复杂街景下也能完整分割远处人群:

图 8:Cityscapes 语义分割可视化对比。红框标出关键差异区域,PolaFormer++(第一行)边界更细、目标区域更完整。
将 DiT 中的注意力替换为 PolaFormer++ 得到 PolaDiT,在 ImageNet-1K 类条件生成上:
在 GNT 框架下替换点积注意力,LLFF 数据集 8 个场景平均:PSNR 从 27.25 dB 提升至 27.34 dB,LPIPS 从 0.1019 降至 0.1009,SSIM 从 0.8868 提升至 0.8885,三项指标全面改善,证明其在 3D 空间推理与几何建模中的适用性。
将 PolaFormer++ 接入 ESRT 与 MambaIRv2:

图 9:×4 超分可视化对比。PolaFormer++ 在建筑边缘、斑马条纹、金属网格等高频细节上重建出更锐利、更连续的纹理。

图 10:不同全局 batch size 下 PolaFormer++-b0 的 BF16 训练稳定性,loss(实线)与梯度范数(虚线)均平稳收敛。
PolaFormer++ 从两个根本性问题出发 ——负值信息丢失与注意力分布不够尖锐—— 给出了统一且有理论支撑的解法:
从分类、检测、分割,到超分、扩散生成、3D 合成,PolaFormer++ 在六大类任务上实现了精度与效率的更优平衡,为视觉 Transformer 中的线性注意力建立了坚实的理论与实践基础。代码已开源,欢迎试用与拓展!
文章来自于"机器之心",作者 "孟维康"。
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。
项目地址:https://github.com/microsoft/graphrag
【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。
项目地址:https://github.com/langgenius/dify
【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。
项目地址:https://github.com/infiniflow/ragflow/tree/main
【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目
项目地址:https://github.com/phidatahq/phidata
【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。
项目地址:https://github.com/TaskingAI/TaskingAI