一、研究背景
YOLO26 是 2025 年 9 月 Ultralytics 发布的 YOLO 系列最新模型,2026年1月14号发布代码,专为边缘设备和低功耗场景设计,解决了前代模型(如 YOLOv8-YOLOv13)依赖 NMS、DFL 导致的部署复杂、 latency 高等问题,同时满足实时目标检测的效率与精度需求,适配机器人、制造、物联网等多行业应用。
论文:YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection
代码:ultralytics/docs/en/models/yolo26.md at main · ultralytics/ultralytics
官方介绍:Ultralytics YOLO26 – Ultralytics YOLO 文档
视频讲解:YOLO26 杀疯了:性能 Double + 无 NMS/DFL,更快更强更轻量的检测「新爹」_哔哩哔哩_bilibili
| 核心架构创新 | 移除 DFL、端到端无 NMS 推理;ProgLoss+STAL;MuSGD 优化器 | C3k2 瓶颈 + SPPF+ C2PSA 模块;支持姿态 / 定向检测 | HyperACE 模块 + FullPAD 方案;超图增强特征交互 |
| 推理效率 | CPU 推理提速 43%,无后处理瓶颈,冷启动更快 | 依赖 NMS 后处理,存在 latency 开销 | 依赖 NMS 后处理,架构复杂度较高 |
| 部署兼容性 | 原生支持 ONNX/TensorRT/CoreML 等多格式;INT8/FP16 量化无明显精度损失 | 需适配导出,量化稳定性一般 | 导出需处理 DFL 和 NMS,低功耗设备适配差 |
| 小目标检测 | STAL 标签分配 + 多尺度特征,精度显著提升 | 依赖 C2PSA 注意力模块,效果有限 | 多尺度融合优化,但无专门小目标机制 |
| 支持任务 | 目标检测、实例分割、姿态估计、定向检测、分类(5 类) | 目标检测、实例分割、姿态估计、定向检测(4 类) | 仅支持目标检测 |
| 训练稳定性 | MuSGD 优化器 + ProgLoss,收敛快、无训练波动 | 传统 SGD/AdamW,需多轮超参调优 | 传统优化器,复杂架构易过拟合 |
二、YOLO26结构
YOLO26 与 YOLO11 的结构差异主要体现在端到端推理设计、模块参数优化两方面,其骨干网络的 SPPF 模块新增核数与增强模式参数,检测头的 C3k2 模块则全面启用 True 模式,且最后一层新增通道缩放和增强参数,目的是提升特征交互效率,匹配小目标检测的 STAL 标签分配策略。

2.1 SPPF模块
YOLO26 相比 YOLO11 给 SPPF 新增了 shortcut=True 参数,启用残差连接;以及控制maxpool的次数。残差连接让 SPPF 模块在融合多尺度特征的同时保留原始输入信息,提升了特征传递效率,适配 YOLO26 端到端推理和小目标检测的设计目标。

2.2 C3K2模块
两个版本 C3k2 类的实现差异,核心区别集中在初始化参数、内部模块构建逻辑两方面
| 初始化参数 | 新增 attn: bool = False 参数 | 无 attn 参数 | 支持注意力机制(PSABlock)的开关控制 |
| 内部模块逻辑 | 三层条件分支(attn → c3k → Bottleneck) | 两层条件分支(c3k → Bottleneck) | 第一个版本可集成注意力模块,功能更丰富 |
| 模块组合 | attn=True 时:Bottleneck + PSABlock 组合 | 无注意力模块组合 | 第一个版本能增强特征交互(适配小目标检测) |


三、创新点
YOLO26 的核心创新点围绕 “简化架构提效、精准优化提精度、适配部署降门槛” 三大核心目标,共 4 个关键突破,每个创新都针对性解决了前代 YOLO 模型的痛点,下面结合技术细节、解决的问题和实际效果展开说明:

3.1 创新点 1:移除 DFL(Distribution Focal Loss)—— 轻量化回归,破除部署障碍
1. 前代痛点
YOLOv8/v11/v13 等模型依赖 DFL 进行边界框回归:通过预测坐标的概率分布来优化定位精度,但会带来两个关键问题:
-
计算冗余:DFL 需要额外的分布参数计算,增加 15%-20% 的模型参数和推理耗时,尤其在 CPU / 边缘设备上表现明显;
-
部署麻烦:DFL 的分布计算逻辑难以适配低精度量化(如 INT8),导出 ONNX、TensorRT 等格式时需额外适配,易出现精度丢失或兼容性报错。
2. 技术实现
YOLO26 彻底移除 DFL 模块,重新设计边界框回归头:
-
直接回归:回归头不再预测分布参数,而是直接输出边界框的 4 个坐标(x/y/w/h),将 “分布解码” 简化为 “直接回归”,计算逻辑更简洁;
-
精度补偿:通过后续 ProgLoss 的动态权重调节,弥补移除 DFL 后的定位精度损失,最终实现 “轻量化 + 精度不降”。
3. 实际效果
-
推理提速:头部计算量减少 15%,CPU 推理速度提升约 8%-10%;
-
部署兼容:模型导出无特殊依赖,ONNX/TensorRT/CoreML 等格式原生支持,量化(INT8/FP16)后精度损失 < 1%(前代模型量化损失通常 3%-5%)。
3.2 创新点 2:端到端无 NMS 推理 —— 消除后处理瓶颈,提速部署流程
1. 前代痛点
所有前代 YOLO 模型(包括 v11/v13)都依赖 NMS(非极大值抑制)作为后处理步骤:
-
latency 开销:NMS 需要遍历所有预测框,计算 IoU(交并比)并过滤重复框,占整体推理耗时的 20%-30%,边缘设备上更明显;
-
调参复杂:NMS 的 IoU 阈值需要手动适配场景(如密集目标需调低阈值,稀疏目标需调高),不同场景切换时需重新调参;
-
部署冗余:需额外编写 NMS 代码集成到部署 pipeline 中,跨平台(如嵌入式、移动端)适配成本高。
2. 技术实现
YOLO26 通过 “训练阶段优化” 实现推理无 NMS:
-
动态标签分配:训练时引入 “置信度校准 + 冗余框抑制” 机制,让模型学习 “只输出有效框”,避免训练时产生大量重复预测;
-
端到端输出:推理时直接输出最终目标框,无需 NMS 过滤,彻底省去后处理步骤。
3. 实际效果
-
推理流程简化:从 “模型预测→NMS 过滤” 两步变为 “模型直接输出结果” 一步,端到端 latency 降低 20%-30%;
-
冷启动更快:无 NMS 的循环计算,模型冷启动时间减少 50%,适合实时视频流、机器人实时感知等低延迟场景;
-
部署更灵活:无需集成 NMS 代码,跨平台适配成本降低 60%,新手也能快速部署。
3.3 创新点 3:ProgLoss+STAL—— 精准优化训练,攻克小目标痛点
这两个创新是 YOLO26 提升精度的核心,尤其针对工业场景高频的 “小目标检测” 和 “训练不稳定” 问题:
(1)ProgLoss(Progressive Loss)—— 动态平衡损失,稳定训练收敛
① 前代痛点
传统 YOLO 模型的损失权重是固定的(如分类损失:回归损失 = 1:5):
-
训练初期:回归损失过大(目标框尚未初步定位),导致梯度爆炸,模型不收敛;
-
训练后期:分类损失饱和(类别特征已学会),但回归损失仍需优化,固定权重无法适配 “后期精细定位” 需求;
-
小目标被忽略:大目标的损失值通常远大于小目标,固定权重下,模型会优先优化大目标,小目标损失被 “淹没”。
② 技术实现
ProgLoss 是 “分阶段动态调整损失权重” 的损失函数,核心逻辑按训练 epoch 分三阶段:
| 前期(前 30% epoch) | 提高分类损失权重,降低回归损失权重 | 优先让模型学习类别特征,避免回归发散 |
| 中期(30%-80% epoch) | 动态平衡分类 / 回归 / 小目标损失权重 | 适配不同尺寸目标的学习进度,兼顾大小目标 |
| 后期(后 20% epoch) | 提高回归损失权重,降低小目标损失权重 | 精细优化边界框定位,避免小目标过拟合 |
(2)STAL(Small-Target Aware Label Assignment)—— 小目标专属标签分配
① 前代痛点
传统标签分配机制(如 SimOTA)是 “全局均匀分配”:
-
小目标被挤占:小目标(<32×32 像素)的锚框易被大目标抢占,导致小目标 “无标签可学”,漏检率高;
-
特征不匹配:小目标的特征主要集中在高分辨率特征层(如 8×8 尺度),但传统分配会随机分配到各尺度,导致特征与目标尺寸不匹配。
② 技术实现
STAL 是专为小目标设计的标签分配机制:
-
尺寸分类:按目标尺寸分为 “小(<32×32)、中(32-96×96)、大(>96×96)” 三类;
-
锚框预留:为高分辨率特征层(8×8、16×16)预留 20% 的锚框配额,专门分配给小目标,避免被大目标挤占;
-
损失联动:与 ProgLoss 联动,小目标在训练前期 / 中期获得更高的损失权重,强化梯度更新。
(3)两者结合的实际效果
-
训练稳定性:收敛速度提升 25%(从 300 轮降至 210 轮),无梯度爆炸 / 消失问题,无需手动调优损失权重;
-
小目标精度:COCO 数据集小目标 AP(平均精度)提升 12.7%,密集场景(如无人机航拍、密集人群)中小目标漏检率降低 30%;
-
泛化能力:跨数据集测试(如从 COCO 迁移到工业缺陷检测)精度损失 < 2%(前代模型通常 3%-6%)。
3.4 创新点 4:MuSGD 优化器 —— 兼顾收敛速度与泛化能力
1. 前代痛点
传统 YOLO 模型使用 SGD 或 AdamW 优化器,存在明显短板:
-
SGD:泛化能力强,但收敛慢(需 300 + 轮),且需多轮调整学习率;
-
AdamW:收敛快(200 轮左右),但易过拟合,且量化后精度损失大(尤其在边缘设备上);
-
适配性差:无法匹配 YOLO26 的轻量化架构,易出现 “收敛快但泛化差” 或 “泛化好但收敛慢” 的矛盾。
2. 技术实现
MuSGD 是融合 “SGD 稳定性” 和 “Muon 优化器快速收敛” 的混合优化器:
-
两阶段优化:
-
前期(前 50% epoch):采用 Muon 优化器(基于动量的自适应学习率),快速收敛到最优解附近,解决 SGD 收敛慢的问题;
-
后期(后 50% epoch):切换为 SGD 优化器,微调参数,避免 AdamW 的过拟合问题,提升泛化能力;
-
-
动量优化:针对 YOLO26 的轻量化架构,优化动量衰减策略(动量值从 0.9 逐步衰减到 0.85),减少内存占用,适配边缘设备训练。
3. 实际效果
-
训练效率:训练轮数减少 30%,同等精度下训练时间缩短 25%-30%;
-
泛化能力:跨场景测试精度损失 < 2%,工业场景(如制造业缺陷检测)中过拟合率降低 40%;
-
量化适配:量化(INT8)后精度损失 < 1%,远优于 SGD(3%)和 AdamW(5%),适合低功耗设备部署。
四、YOLO26 的 4 个核心创新并非孤立,而是形成 “效率 + 精度 + 部署” 的闭环:
-
移除 DFL + 无 NMS:解决 “效率低、部署难” 的工程痛点;
-
ProgLoss+STAL:解决 “小目标差、训练稳” 的精度痛点;
-
MuSGD:为前三者提供 “快速收敛、泛化稳定” 的训练保障。





