欢迎光临
我们一直在努力

RT-DETR改进策略【损失函数篇】| arXiv2025 TeLU双曲正切指数线性单元 强梯度防消失 + 解析光滑稳训练,极速提升收敛与泛化

一、本文介绍

本文记录的是利用TeLU激活函数替换传统ReLU改进RT-DETR的非线性映射与梯度传播

TeLU(Hyperbolic Tangent Exponential Linear Unit)通过极简解析式、正区间恒等逼近与负区间慢饱和梯度保持结合,在全输入域实现稳定梯度传播与高效特征非线性变换。本文利用TeLU激活函数,以 x ⋅ tanh ⁡ ( e x ) x\\cdot\\tanh(e^x) xtanh(ex) 统一实现正区间强梯度加速收敛与负区间持续梯度避免死神经元,全程保持解析光滑与极低计算开销,对深度网络各层特征进行稳定非线性映射、强效抑制梯度消失与数值不稳定问题在激活变换阶段实现强梯度与平滑优化的高效兼顾,完美替代ReLU且无需修改训练超参,显著提升深度网络在分类、检测、分割、时序任务中的收敛速度、精度与泛化鲁棒性。


专栏目录:RT-DETR改进目录一览 | 涉及卷积层、轻量化、注意力、损失函数、Backbone、SPPF、Neck、检测头等全方位改进

专栏地址:RT-DETR改进专栏——以发表论文的角度,快速准确的找到有效涨点的创新点!

文章目录

  • 一、本文介绍
  • 二、TeLU设计原理
    • 2.1 设计出发点
    • 2.2 模块结构
    • 2.3 模块优势
  • 三、TeLU的实现代码
  • 四、添加步骤
    • 4.1 修改ultralytics/nn/modules/conv.py
  • 五、成功运行截图

二、TeLU设计原理

2.1 设计出发点

ReLU 存在死神经元、梯度消失、非光滑、不解析等问题;ELU、GELU、Mish 等虽平滑但计算复杂、梯度弱、收敛慢。因此提出 TeLU(双曲正切指数线性单元),兼顾 ReLU 的高效与平滑激活的稳定,实现更快收敛、更强梯度、更低计算开销。

2.2 模块结构

TeLU(Hyperbolic Tangent Exponential Linear Unit)为单式子解析激活函数,公式极简: T e L U ( x ) = x ⋅ tanh ⁡ ( e x ) TeLU(x) = x \\cdot \\tanh(e^x) Te

赞(0)
未经允许不得转载:171主机测评 » RT-DETR改进策略【损失函数篇】| arXiv2025 TeLU双曲正切指数线性单元 强梯度防消失 + 解析光滑稳训练,极速提升收敛与泛化
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址