一、背景与动机:为何提出 ConvNeXt?
1.1 Vision Transformer(ViT)的崛起
自 2020 年 Vision Transformer(ViT)提出以来,基于自注意力机制的纯 Transformer 模型在大规模图像识别任务中展现出超越 CNN 的性能。随后,Swin Transformer 等改进版本通过引入局部窗口注意力、层次化结构等设计,使其适用于密集预测任务(如检测、分割),进一步巩固了 Transformer 在计算机视觉中的主导地位。
1.2 CNN 是否已过时?
尽管 ViT 表现优异,但 CNN 仍具多项优势:
- 归纳偏置强:局部性、平移不变性、权重共享等天然适合图像数据。
- 训练更稳定:对小数据集更鲁棒,不依赖大规模预训练。
- 推理效率高:尤其在边缘设备或低 batch size 场景下,CNN 的 FLOPs 和延迟通常优于 ViT。
然而,传统 CNN(如 ResNet)的设计范式自 2015 年以来变化甚微,而 ViT 引入了许多“现代化”组件(如 LayerNorm、GELU、大感受野、倒残差等)。因此,一个核心问题浮现:
如果将 ViT 的成功设计思想“反向移植”到 CNN 中,能否构建一个既保留 CNN


