恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
074、顶会注意力机制复现:GFNet-Filter频域滤波注意力在YOLOv12中的全局建模,即插即用与实验涨点
首页
资讯中心
/
074、顶会注意力机制复现:GFNet-Filter频域滤波注意力在YOLOv12中的全局建模,即插即用与实验涨点
074、顶会注意力机制复现:GFNet-Filter频域滤波注意力在YOLOv12中的全局建模,即插即用与实验涨点
发布时间:2026/8/10 4:40:33
074、顶会注意力机制复现:GFNet-Filter频域滤波注意力在YOLOv12中的全局建模,即插即用与实验涨点兄弟们,今天这篇咱们聊点硬核的。上周有个学生拿着YOLOv12的baseline来找我,说在VisDrone上小目标AP卡在28.5死活上不去,换了一堆注意力模块——SE、CBAM、CA、EMA全试遍了,要么掉点要么涨个0.3就顶天。我一看他改的代码就乐了,全是在通道维度上做文章,全局上下文信息根本没建模起来。这让我想起去年在CVPR上看到的GFNet那篇工作,人家直接在频域做全局滤波,思路清奇得很。今天咱们就把这个GFNet-Filter的频域滤波注意力扒干净,塞进YOLOv12里看看效果。先说说GFNet到底干了啥。传统注意力机制要么在空间域算相似度(比如Non-local),要么在通道域做重标定(比如SE),但GFNet的思路是——把特征图变换到频域,在频域里做可学习的全局滤波。具体来说,用2D FFT把空间特征转到频域,然后乘上一个可学习的复数滤波器(就是频域里的权重矩阵),再逆变换回空间域。这个操作等价于在空间域做全局卷积,但计算复杂度从O(N²)降到了O(N log N),而且天然具备全局感受野。论文里还证明了这玩意儿能近似任意平移等变卷积,数学上很漂亮。但这里有个坑,兄弟们注意了——直接照搬GFNet原版代码到YOLOv12里,十有八九会炸显存。原版GFNet用的是完整的2D FFT,特征图分辨率一大,频域矩阵的尺寸跟着平方增长。YOLOv12的backbone在P3层输出是80×80,你算算80×80的复数矩阵要占多少内存。所以咱们得改造一下,只对通道维做FFT,空间维保持不动。这个思路其实借鉴了FNO(Four